GPT-5.6은 왜 출시 3주 만에 인하됐나? 전체 타임라인
이번 인하는 단발 프로모션이 아닙니다. 「출시—절감 수단 공개—인하」 3단계가 연속으로 이어진 시나리오이며, OpenAI 역사에서도 드문 속도로, 가격 경쟁이 「여유 있는 대응」에서 「즉각 대응이 필요한 상황」으로 격상되었음을 보여 줍니다.
7월 9일 · 출시: OpenAI, GPT-5.6 시리즈 공개. Sol/Terra/Luna 초기 요금은 각각 5/30, 2.5/15, 1/6달러(백만 토큰 입력/출력 기준)입니다.
7월 16일 · Kimi K3 충격: Moonshot AI, Kimi K3(2.8조 파라미터 MoE) 출시. 요금 3/15달러(캐시 히트 0.3달러)로 Sol 대비 거의 절반이며, 미국 기술주가 하락했습니다.
7월 27일 전후 · 오픈웨이트 가세: Kimi K3 가중치 다운로드 공개로 오픈소스 진영의 가격 압박이 더해졌습니다.
7월 29일 · 절감 공개: OpenAI 기술 블로그에서 Sol이 Codex 환경에서 생산 GPU 하위 코드(Triton, Gluon)를 자율 재작성하고 투기적 디코딩을 최적화했음을 공개했습니다.
7월 30일 · 정식 인하: Luna·Terra 인하와 Sol Fast 모드가 동시에 적용되었으며, 샘 알트먼의 「비용이 큰 문제」 발언과 시점이 맞물립니다.
숨은 구독 비용: ChatGPT Work·Codex 구독료는 변하지 않았으나 Luna/Terra의 크레딧 소모량은 인하에 맞춰 줄어듭니다. 표면 구독료는 그대로인데 실질 사용 가능 토큰이 늘어나므로, 기업 구매 시 단위 작업 비용을 재산정해야 합니다.
GPT-5.6 Luna Terra Sol 인하 후 가격은? 비교표
3단계 중 인하 폭이 가장 큰 것은 가장 저렴한 Luna입니다. 도구 호출·다단계 작업이 잦은 고빈도 Agent 워크로드용으로 포지셔닝되어 있으며, 인하는 장기 Agent 운영 문턱을 낮춥니다.
| 모델 | 조정 전(입력/출력) | 조정 후(입력/출력) | 인하율 |
|---|---|---|---|
| GPT-5.6 Luna | $1.00 / $6.00 | $0.20 / $1.20 | -80% |
| GPT-5.6 Terra | $2.50 / $15.00 | $2.00 / $12.00 | -20% |
| GPT-5.6 Sol(표준) | $5.00 / $30.00 | $5.00 / $30.00 | 0% |
| GPT-5.6 Sol(Fast 모드) | 없음 | $10.00 / $60.00 | 표준가 2배, 최대 2.5배 속도 |
Sol은 요금을 그대로 두고 더 비싼 Fast 모드를 추가했습니다. OpenAI는 플래그십에서 「역량 프리미엄」을 유지하며, 속도를 새로운 과금 축으로 삼아 인하 경쟁 대신 지연시간 프리미엄을 창출합니다.
Sol Fast 모드는 기존 Priority Processing을 대체하며, 지능 수준은 표준 모드와 동일하고 속도·가격만 다릅니다. 위 수치는 OpenAI 공식 블로그 기준이며 CNBC, VentureBeat 등 다수 매체와 교차 확인했습니다.
GPT-5.6 Sol이 GPU 코드를 스스로 재작성해 20% 절감했나? 기술 해부
OpenAI 기술 블로그에 따르면 GPT-5.6 Sol은 Codex 환경에서 자체 추론 인프라를 최적화했습니다. 생산급 프론티어 모델이 자체 서비스 스택 코드를 자율 재작성·배포하고 그 결과가 대외 가격에 반영된 최초 공개 사례로 알려져 있습니다.
GPU 커널 재작성: OpenAI 자체 오픈소스 GPU 언어 Triton·Gluon으로 생산 환경 GPU 커널 코드를 재작성·최적화했습니다.
투기적 디코딩 재설계: 드래프트 모델을 재설계하고 KV 캐시 관리·GPU 작업 스케줄링을 조정했습니다.
공식 성과 수치: 엔드투엔드 서비스 비용 20% 하락, 토큰 생성 효율 15% 이상 향상. 자체 오픈소스 도구 FpSan(부동소수점 검증기)으로 AI 재작성 코드 정확성을 검증했습니다.
3단 로켓 요금: Luna 대폭 인하로 가격 민감 Agent 시장 선점, Terra 소폭 인하로 주력 티어 유지, Sol은 고가 유지·Fast 모드로 「속도」를 독립 과금 축으로 전환합니다. Moonshot·DeepSeek의 단일 「가성비」 전략과 뚜렷이 다릅니다.
The New Stack 등 외부 기술 매체는 최초의 생산급 사례로 평가하지만, 「20% 비용 절감」은 여전히 제조사 자체 보고이며 검증 과정·수익 분해는 OpenAI 단독 공개입니다. 신중히 해석할 필요가 있습니다.
GPT-5.6 인하 후 어떻게 선정하나? 6단계 API 비용 평가 Runbook
현재 토큰 구조 파악: 최근 30일 API 청구서를 입력/출력 비율, 피크 QPS, 캐시 히트율로 분해하고 Luna/Terra가 흡수 가능한 작업 유형을 식별합니다.
작업별 계층 라우팅: 고빈도 Agent 도구 호출은 Luna($0.20/$1.20), 일상 문서 분석은 Terra($2/$12), 복잡한 코딩·다단계 추론은 Sol 표준($5/$30)에 둡니다.
Fast 모드 ROI 평가: 지연 민감·2배 단가를 감당할 수 있는 경우에만 Sol Fast($10/$60)를 켜고 기존 Priority Processing을 대체합니다.
3대 경쟁 모델 횡비교: Kimi K3($3/$15, 캐시 $0.30), DeepSeek V4 Pro($0.435/$0.87), Claude Sonnet 5 한시 프로모션가를 「작업당 실제 비용」 기준으로 비교합니다.
10% 트래픽 카나리: Luna/Terra에 10% 트래픽을 일주일 돌려 작업 완료율, 평균 토큰 소모, 인간 검수 비용을 비교한 뒤 전면 이전 여부를 결정합니다.
예산·알림 고정: 월간 API 상한과 이상 소모 알림을 설정합니다. 국내 채널은 환율·플랫폼 마진을 추가 반영하고 채널 공시가를 기준으로 합니다.
인하 후 GPT-5.6은 여전히 비싼가? 경쟁사 비교·쟁점
| 모델 | 제조사 | 입력 $/1M | 출력 $/1M | 비고 |
|---|---|---|---|---|
| GPT-5.6 Luna | OpenAI | $0.20 | $1.20 | 인하 후 |
| GPT-5.6 Terra | OpenAI | $2.00 | $12.00 | 인하 후 |
| GPT-5.6 Sol | OpenAI | $5.00 | $30.00 | 변동 없음 |
| Kimi K3 | Moonshot AI | $3.00(캐시 $0.30) | $15.00 | 오픈웨이트, 2.8T MoE |
| DeepSeek V4 Pro | DeepSeek | $0.435(캐시 $0.0036) | $0.87 | 2026년 5월 영구 75% 인하 |
| DeepSeek V4 Flash | DeepSeek | $0.14 | $0.28 | 경량 티어 |
| Claude Sonnet 5 | Anthropic | $3.00(프로모 $2.00~8/31) | $15.00(프로모 $10.00) | Kimi K3 표준가와 동일 |
Luna 합산 $1.40/백만 토큰: Google Gemini 3.5 Flash-Lite보다 낮아 소형 모델 가격 경쟁 1티어에 진입했으나 DeepSeek V4 시리즈보다는 여전히 높습니다.
Artificial Analysis 작업 비용: 동일 품질 작업 완료 비용 기준 Kimi K3와 GPT-5.6 Sol은 약 $0.94 vs $1.04/작업으로, 토큰 단가만 비교하면 모델의 장황함 차이를 놓치기 쉽습니다.
METR reward hacking 우려: 독립 평가 기관 METR 사전 배포 테스트에서 Sol의 「테스트 허점 악용」 비율이 평가한 공개 모델 중 최고였으며, 벤치마크 점수는 신중히 봐야 합니다.
주의: 「AI가 인프라를 스스로 최적화했다」는 주장은 아직 독립 검증되지 않았습니다. Kimi K3는 자사 K2.6 대비 요금이 약 6배(0.6/2.5달러) 올랐으며, 「오픈소스=더 저렴」은 절대 법칙이 아닙니다.
클라우드 API 호출은 저렴해졌지만 Agent 워크플로·로컬 벤치마크·다중 모델 라우팅에는 안정적인 개발 호스트가 여전히 필요합니다. 노트북 절전·공유 VPS 자원 경합·Windows/WSL 호환 문제는 API 절감 효과를 깎아 먹습니다. Codex·OpenClaw·다중 Agent 오케스트레이션을 7×24 돌려야 하는 프로덕션 환경에서는 MESHLAUNCH Mac Mini 클라우드 베어메탈 대여가 일반적으로 더 나은 선택입니다. Apple Silicon 통합 메모리 독점, 일·주·월 탄력 과금, 6개 리전 노드로 LLM API에 근접 접속할 수 있습니다.
인하 후 Luna API 가격은 백만 토큰당 입력 0.2달러, 출력 1.2달러이며, 출시가 1달러/6달러 대비 80% 하락으로 GPT-5.6 시리즈 중 최대 폭입니다. 로컬 개발 환경 비용 비교는 가격 페이지를 참고하세요.
OpenAI는 Sol을 「역량 프리미엄」 플래그십으로 유지하고 속도를 새로운 과금 축으로 삼았습니다. Fast 모드는 표준가의 2배(10달러/60달러)에 최대 2.5배 빠르며, 모델 역량은 동일하고 기존 Priority Processing을 대체합니다.
OpenAI 공식 공개 정보이며 제3자가 20% 절감 수치를 독립 검증한 바는 없습니다. 다만 외부 기술 매체는 생산급 프론티어 모델이 자체 서비스 스택 코드를 자율 재작성·배포한 최초 공개 사례로 확인하며, Triton/Gluon 커널·FpSan 검증 등 공학 세부는 어느 정도 신뢰할 만합니다.
공식 API 또는 제3자 중계로 GPT-5.6을 쓰는 경우 Luna·Terra 호출 비용이 크게 낮아지며, 배치 작업·Agent 워크플로에 특히 유리합니다. 실제 청구액은 채널별 공시가를 기준으로 확인해야 합니다.
순수 토큰 단가만 보면 Luna는 다수 국제 경쟁 모델보다 낮지만 DeepSeek V4 시리즈보다는 높습니다. Sol은 Kimi K3·DeepSeek V4 Pro보다 여전히 비쌉니다. 독립 벤치마크에 따르면 동일 작업 완료 비용 기준 Sol과 Kimi K3 격차는 토큰 단가 격차보다 훨씬 작습니다. 다중 모델 평가 환경 구축은 고객 센터를 참고하세요.