자동 확장 앱은 트래픽에 맞춰 자동으로 확장·축소돼요. 두 가지가 같이 동작해요:
- 대수 자동 조절 — 부하가 높으면 +1대, 낮으면 -1대
- GPU 자동 확보 — 더 띄울 GPU가 없으면 약 3분 안에 추가로 켜서 채움
둘 다 사용자 토글이에요. 보통은 기본값으로 충분하고, 기준을 바꾸고 싶으면 에이전트한테 말하면 돼요.
“이 앱 자동 확장으로 올려줘. 응답이 0.5초 넘게 느려지면 대수 늘려줘, 최대 5대까지”
무엇을 보고 늘릴까요? (5가지 기준)
| 기준 | 측정 | 권장값 |
|---|---|---|
| 응답이 느려질 때 | 최근 1분 응답시간 중 위 5% 제외한 가장 느린 값 | 0.5초 (LLM 8B 모델) |
| 한 대당 요청이 많을 때 | 분당 요청 ÷ 준비된 대수 | 60건/분 |
| 토큰 처리량이 많을 때 | 처리한 토큰 ÷ 60초 | 1000 토큰/초 |
| 에러가 늘 때 | 실패 응답 비율 | 1.0% |
| GPU 부하가 높을 때 | 평균 GPU 사용률 | 75% |
하나만 기준으로 써도 되고, “응답이 느려지거나 에러가 늘면 늘려줘” 처럼 두 기준을 같이 걸 수도 있어요 (둘 중 하나만 넘어도 +1대).
일시적 급증은 무시해요 (안티 플랩)
- 늘릴 때 — 기준을 한동안(기본 60초) 계속 넘어야 +1대 (순간 스파이크 무시)
- 줄일 때 — 부하가 낮은 상태가 한동안(기본 300초) 지속돼야 -1대 (성급한 축소 방지)
GPU가 없으면 자동으로 더 켜요
대수를 늘리려는데 지금 쓸 수 있는 GPU/CPU가 없으면, Onpod가 약 3분 안에 새 인스턴스를 자동으로 확보해서 채워줘요. 비용이 폭주하지 않게 모델별 한도와 쿨다운이 걸려 있고, 30분 유휴 상태면 자동으로 회수해서 비용을 줄여요. 이 기능을 끄면 쓸 수 있는 GPU가 생길 때까지 기다려요.
교체된 옛 인스턴스는 1시간 뒤 자동 정리돼요
서버를 줄이거나 고장 난 컨테이너를 교체하면 옛 인스턴스가 잠시 남는데, 실패 원인을 확인할 여유(1시간)를 두고 Onpod가 자동으로 삭제해요. 그 뒤로는 디스크 보관 요금도 청구되지 않아요 — 옛 인스턴스가 누적되어 요금이 불필요하게 청구되는 일은 없어요.
비용이 걱정되면 — 월 지출 한도 (절대 안 넘어요)
자동으로 늘어나는 게 불안하면 한 달에 쓸 최대 금액을 정해두세요. 트래픽이 아무리 몰려도 자동 확장이 그 금액을 절대 넘지 않아요 — 한도에 닿으면 더 늘리지 않을 뿐, 실행 중인 서버는 그대로예요. 한도의 80%에 닿으면 미리 이메일을 보내고, 한도에 막혀 못 늘렸을 때도 알려드려요.
- 앱 상세 페이지의 「월 지출 한도」 카드에서 금액 설정
- 설정 페이지에서 계정 기본값(앱별 한도가 없는 모든 앱에 적용)
- 앱 카드의 「지금 추세면 월 ~₩○○」로 예상 비용을 항상 확인
“이 앱은 한 달에 5만원 넘게 쓰지 않게 한도 걸어줘”
지금 상태 보기
콘솔 앱 상세 페이지에 상태 배지(여유 있음 / 곧 늘어남 / 늘리는 중)와 실시간 지표가 30초마다 갱신돼요. 에이전트한테 “지금 그 앱 몇 대 떠 있고 얼마나 바빠?” 라고 물어도 돼요.
아웃바운드 통신 제한(방화벽)도 그대로 써요
자동 확장 앱에도 아웃바운드 통신 제한(방화벽)를 켤 수 있어요. 한 번 켜면 지금 실행 중인 서버 전부는 물론, 앞으로 늘어나는 서버에도 자동으로 똑같이 적용돼요 — 새로 늘어난 서버만 잠금이 빠지는 일이 없어요. 무료예요.
관리형 DB도 자동으로 확장돼요
위 규칙은 앱(대수) 자동 확장이에요. Onpod 관리형 Postgres는 디스크가 차면 자동으로 늘어나고(기본 켜짐), 부하가 높아지면 플랜을 자동 상향할 수도 있어요(선택). 자세한 건 관리형 Postgres 도움말 에서. 설정만 정해두면 실제 인프라 작업은 Onpod가 자동으로 처리해요 — 사용자가 DB 서버를 직접 늘릴 일은 없어요. /pricing 에서 단가를 볼 수 있어요.