← 목록으로 돌아가기

창작한 제목

아, 진짜... 2023년 겨울, 서버실 온도가 42도까지 올라갔다. 서버들이 무너질 뻔한 순간, Cloudflare의 cache reserve가 특정 엣지 로케이션에서 최대 47분까지 무효화가 지연되는 현상이 발생했다.

## 소제목
### 문제 발생

온콜 엔지니어였던 저는 새벽 3시에 울린 페이저를 받았다. 서버실 온도가 너무 높아서 문제가 생겼음을 알려주는 것 같았지만, 그때는 이미 모든 서비스가 정상 작동하지 않았다.

### 실패 원인 추적

첫 번째로 확인한 것은 Cloudflare의 cache reserve 관련 코드였다. 이 부분은 AWS Lambda 콜드스타트 핀포인트에 위치하고 있었는데, 문제 해결을 위한 최초 조치였지만 결과는 기대와 거리가 멉니다.

두 번째로는 DNS 설정이 문제가 되었다. 서버실 온도를 낮추기 위해 DNS에 보 caching을 적용하였지만, 그 과정에서 특정 엣지 로케이션의 DNS 설정 변경으로 인해 이전에 저장된 정보들이 최신 정보와 불일치하게 됐다.

### 비교 기준 설정

Cloudflare의 cache reserve가 47분까지 지연되는 현상은 AWS 서비스 개요와 클라우드 비용 절감 방법과는 직접적으로 관련이 없습니다. 하지만, 이 문제를 해결하지 않으면 악화될 수 있는 위험이 따랐다.

### 실패 원인 세부 분석

최초의 문제 조치는 코드 수정으로 진행되었다. AWS Lambda 콜드스타트 핀포인트에 대한 부분을 재설정하여 무효화 시간을 단축시켰지만, DNS 설정 변경은 한계가 있었다. 특정 엣지 로케이션에서만 적용되어서 전체 서비스의 성능에는 큰 영향을 주지 않았다.

### 실패 원인 최종 분석

그러나 최악의 경우는 AWS 서버 자체에 문제가 발생했을 때였다. AWS 서버들은 항상 온도 조절 시스템이 작동하여 환경 변화로 인한 문제를 예방하는데, 그 중에서도 엣지 로케이션에서만 DNS 설정 변경을 적용할 경우 전체 서비스의 안전성을 완벽히 보장하지는 못했다.

### 결론

결국 가장 피해야 할 선택은 AWS 서버 자체에 문제가 발생했을 때였다. 이 경우, AWS 서버 자체를 대체하는 새로운 엣지 로케이션을 도입하거나 기존 클라우드 서비스에 비해 AWS 서버가 더 안전하다는 점 등을 고려하여 결정해야 했다.

Cloudflare Cache Reserve 실패 원인 분석

Cloudflare Cache Reserve 최악의 상황: AWS 서버와 엣지 로케이션 간의 불확실성

4-에이전트 루프 자동화 프로그램 코딩 스쿨

함께 보면 좋은 정보