출력 토큰 33% 인하가 이 발표의 핵심이야

8월 21일부터 OpenAI가 프론티어 모델 GPT-5.6 Sol의 API 가격을 내렸어. 기간은 11월 21일까지, 3개월이야.

헤드라인은 대부분 "20% 이상 인하"로 나갔는데, 그 숫자는 입력 토큰 기준이야. 실제로 더 크게 움직인 건 출력 쪽이야.

구간 항목 기존 인하 후 변화
272K 토큰 이하 입력 $5 / 100만 $4 / 100만 −20%
272K 토큰 이하 출력 $30 / 100만 $20 / 100만 −33%
272K 토큰 이하 캐시 입력 $0.50 $0.40 −20%
272K 토큰 이하 캐시 쓰기 $6.25 $5.00 −20%
272K 토큰 초과 입력 $10 / 100만 $8 / 100만 −20%
272K 토큰 초과 출력 $45 / 100만 $30 / 100만 −33%
272K 토큰 초과 캐시 입력 $1.00 $0.80 −20%
272K 토큰 초과 캐시 쓰기 $12.50 $10.00 −20%

왜 출력이 더 많이 깎였는지가 이 발표를 읽는 열쇠야. 추론 모델과 에이전트 워크로드에서 실제 비용을 지배하는 건 출력 토큰이거든. 모델이 생각하는 과정에서 만들어내는 토큰이 전부 출력으로 계산되니까, 긴 추론을 돌리는 작업일수록 출력 비중이 커져. 코딩 에이전트가 파일을 읽고 계획을 세우고 수정안을 만드는 한 사이클을 생각해보면, 읽는 양보다 만들어내는 양이 요금표를 지배해.

즉 이 인하는 챗봇 사용자보다 에이전트를 돌리는 개발자를 겨냥한 가격표야. 같은 20% 인하라도 어느 항목을 깎느냐에 따라 실제 수혜자가 갈린다는 걸 보여주는 사례이기도 해.

적용 범위도 같은 방향을 가리켜. 인하는 API와 함께, 에이전트 제품 ChatGPT Work와 코딩 도구 Codex의 크레딧 요금제에 적용돼. 반면 Pro·Plus·Business 구독에 포함된 사용량은 변동이 없어. 소비자 요금은 그대로 두고 개발자 요금만 내린 거지.

272K라는 구간 경계도 짚어둘 만해. 컨텍스트가 27만 2천 토큰을 넘어가면 입력과 출력 단가가 두 배 가까이 뛰는 구조인데, 인하 후에도 이 구조는 유지돼. 긴 문서를 통째로 넣는 파이프라인이라면 이 경계를 넘나드는지가 실제 청구서에서 가장 큰 변수야. 문서를 쪼개서 여러 번 호출하는 게 한 번에 넣는 것보다 싼 구간이 존재한다는 뜻이고, 이건 인하 전후 모두 유효한 설계 고려사항이야.

한 달 새 두 번째 인하

시간 순서를 보면 흐름이 더 잘 보여.

GPT-5.6 Sol은 7월 9일 출시됐어. 출시 당시 가격은 그대로 유지됐고, 몇 달간 프론티어 프리미엄을 지켰지. 그러다 7월 30일 OpenAI가 Terra와 Luna 모델의 가격을 내렸어. 그리고 8월 21일 이번엔 최상위 모델인 Sol까지 내려왔어. 한 달 사이 두 번째야.

이 순서가 중요한 이유는, 보통 가격 인하가 하위 모델부터 시작해서 상위로 올라오기 때문이야. 하위 모델은 대체재가 많으니 먼저 압박을 받고, 최상위 모델은 성능 우위를 근거로 프리미엄을 지켜. 그 프리미엄이 3주 만에 무너졌다는 건, 최상위 구간에서도 대체 가능한 선택지가 실제로 생겼다는 뜻이야.

기간을 3개월로 못 박은 것도 읽을 거리야. 영구 인하가 아니라 11월 21일까지의 프로모션이야. 두 가지 해석이 가능해. 하나는 신중한 실험이라는 해석. 가격 탄력성을 재보고 매출 영향을 확인한 뒤 결정하겠다는 거지. 다른 하나는 방어적 조치라는 해석. 특정 시점의 경쟁 압력에 대응하는 임시 대응이고, 상황이 바뀌면 되돌리겠다는 뜻. 어느 쪽이든 개발자 입장에서는 11월 21일 이후를 가정에서 빼두는 게 안전해.

상대는 누구야

로이터 보도가 지목한 경쟁 압력은 둘이야. 앤트로픽중국 AI 모델.

앤트로픽 쪽 압박은 특히 최근 몇 달간 뚜렷해졌어. 코딩 도구와 에이전트 워크로드에서 개발자 선택이 실제로 이동했다는 관측이 이어졌고, 그 영역은 토큰 소비가 가장 큰 곳이기도 해. 압박은 코딩과 에이전트 워크로드에서 가장 뚜렷해. 이 영역은 토큰 소비량이 크고 사용자가 결과 품질에 민감해서, 개발자들이 모델을 실제로 비교하고 갈아타는 빈도가 높아. 그리고 이 영역의 사용자는 소비자 구독과 달리 API를 통해 직접 비용을 지불하니까 가격에 즉각 반응해.

중국 모델 쪽 압박은 성격이 달라. Qwen 계열은 오픈웨이트로 배포되면서 누적 다운로드에서 구글과 메타를 앞질렀고, 여러 API 제공사가 그걸 저렴하게 서빙하고 있어. 여기서 경쟁 축은 절대 성능이 아니라 성능 대비 가격이야. 대부분의 실무 작업에서 최상위 모델이 반드시 필요한 건 아니거든. 이 사실이 널리 인식될수록 프론티어 프리미엄은 지키기 어려워져.

같은 주에 있었던 다른 뉴스도 이 그림에 들어맞아. 파인콘이 8월 19일 넥서스를 정식 출시하면서 내놓은 메시지가 "모델을 업그레이드하는 대신 지식 계층을 붙이면 구형 모델로도 프론티어급 결과를 낸다"였어. 실제로 GPT-5.2에 넥서스를 붙였더니 정확도는 12% 오르고 비용은 80% 내려갔다고 밝혔지. 모델 회사 입장에서 이런 주장이 확산되는 건 가격 방어에 직접적인 악재야.

각자가 챙기는 것

개발자가 챙기는 건 명확해. 같은 코드로 같은 작업을 돌리는데 청구서만 줄어드는 종류의 변화니까 도입 비용이 사실상 없어. 출력 토큰 33% 인하는 에이전트 워크로드에서 체감되는 절감이야. 특히 장시간 도는 코딩 에이전트나 다단계 파이프라인처럼 출력이 많은 작업일수록 효과가 커. 캐시 입력 가격도 20% 내려서, 같은 시스템 프롬프트를 반복 사용하는 구조라면 절감폭이 더 커져.

OpenAI가 챙기는 건 사용량과 잠금이야. 가격 인하의 목적은 단기 매출이 아니라 사용량 확대와 이탈 방지야. 특히 Codex 크레딧에 적용했다는 건 코딩 도구 경쟁에서 물러서지 않겠다는 신호야. 개발자가 한번 파이프라인을 구축하면 모델을 바꾸는 데 실제 비용이 들거든. 지금 붙잡아두면 나중에 가격을 올려도 이탈이 덜해.

소비자 구독자는 이번 발표에서 얻는 게 없어. 요금도 그대로고 포함 사용량도 그대로야. Pro·Plus·Business에 포함된 사용량은 그대로야. 이건 OpenAI가 두 시장을 분리해서 관리하고 있다는 뜻이야. 소비자 시장에서는 브랜드와 제품 경험으로 경쟁하고, 개발자 시장에서는 가격으로 경쟁하는 구조.

추론 인프라를 파는 회사들에게는 부담이야. 저렴한 서빙을 논거로 삼던 사업자들은 프론티어 모델 자체가 싸지면 상대적 우위가 줄어들어. 원가 우위를 하드웨어나 아키텍처에서 확실히 확보하지 못한 곳은 이 국면에서 마진 압박을 먼저 받게 돼.

경쟁 모델 회사들은 압박을 받아. 최상위 모델의 출력 가격이 100만 토큰당 20달러로 내려오면, 비슷한 성능대의 모델들도 가격표를 다시 봐야 해. 이건 연쇄적으로 움직이는 종류의 변화야.

또 하나 실무적으로 중요한 건 이번 인하가 기존 코드에 아무 변경도 요구하지 않는다는 점이야. 모델 이름도 그대로고 API 스펙도 그대로인데 단가만 내려가. 이런 종류의 변화는 도입 마찰이 없어서 효과가 즉시 나타나. 반대로 말하면 개발자가 아무 행동도 하지 않아도 청구서가 줄어드는 거라, OpenAI 입장에서는 이 인하로 신규 사용자를 얼마나 끌어왔는지를 분리해 측정하기가 어려워. 3개월 프로모션이라는 형태를 택한 것도 그 측정을 위한 실험 설계로 볼 여지가 있어.

가격 전쟁의 앞선 사례들

클라우드 스토리지가 가장 자주 인용되는 선례야. AWS S3, 구글 클라우드 스토리지, 애저 블롭이 2010년대 내내 반복적으로 가격을 내렸고, 결과적으로 스토리지 단가는 극적으로 낮아졌어. 그런데 이 회사들의 매출은 줄지 않았어. 가격이 내려가면서 저장하는 데이터의 양이 그보다 빠르게 늘었거든. 수요의 가격 탄력성이 1보다 컸다는 뜻이야.

AI 추론에서도 같은 일이 벌어질 가능성이 있어. 지금 비용 때문에 포기한 사용처가 많거든. 문서 전체를 매번 처리하거나, 모든 사용자 요청에 추론 모델을 붙이거나, 에이전트를 상시 돌리는 방식은 가격 때문에 막혀 있는 경우가 흔해. 가격이 내려가면 그런 사용처가 열려.

메모리 반도체의 역사도 비슷한 교훈을 줘. 단가는 수십 년간 계속 내려갔지만 시장 규모는 커졌고, 그 과정에서 살아남은 건 원가 곡선의 맨 앞에 선 소수 업체였어. AI 추론에서도 결국 같은 논리가 작동할 가능성이 있어. 가격이 계속 내려가는 시장에서는 원가 구조가 곧 생존 조건이고, 자체 실리콘이나 인프라 소유 여부가 그 구조를 가르는 변수가 돼.

실패 쪽 선례로는 초기 클라우드 IaaS 시장의 일부 후발주자들을 들 수 있어. 선두를 따라잡으려고 가격만 낮췄지만 생태계와 도구가 부족해서 사용량이 따라오지 않았고, 결국 마진만 잃고 점유율은 못 얻는 결과가 나왔어. 가격 인하가 작동하려면 가격이 유일한 병목이어야 해.

한 가지 더. 통신 요금제의 역사도 참고가 돼. 데이터 요금이 내려가면서 사용량이 폭증했지만, 그 과정에서 통신사는 파이프 사업자로 밀리고 부가가치는 그 위의 서비스 회사들이 가져갔어. AI 모델 회사들이 경계하는 시나리오가 이거야. 토큰이 싸지면서 상품화되고, 가치는 그 위의 애플리케이션 레이어로 옮겨가는 것.

발표 경로도 조금 특이해. 이번 인하는 대대적인 공지보다 가격 페이지 갱신과 로이터 보도를 통해 알려졌고, 프로모션 시작일(8월 21일)과 보도 시점(8월 22~23일) 사이에 시차가 있었어. 가격 인하를 큰 이벤트로 만들지 않은 건 의도적일 수 있어. 공격적인 마케팅으로 다루면 경쟁사의 맞대응을 부르고, 나중에 원래 가격으로 되돌릴 때도 부담이 커지거든. 조용히 내리고 조용히 되돌리는 게 프로모션 형태를 택한 이유와도 맞아떨어져.

경쟁자들은 어떻게 받아칠까

앤트로픽의 선택지는 세 가지야. 맞대응 인하, 성능 차별화 강조, 또는 기업 계약 조건으로 우회. 이 중 어느 쪽을 택하는지가 앞으로 몇 달 동안 이 시장의 온도를 결정해. 코딩 에이전트 영역에서 이미 강한 위치를 갖고 있다면 성능으로 버티는 선택이 합리적일 수 있지만, 가격 격차가 커지면 그 위치도 흔들려.

구글은 다른 카드를 갖고 있어. TPU라는 자체 실리콘으로 원가 구조가 다르고, 마벨과의 계약 확대에서 보듯 그 구조를 계속 강화하고 있어. 원가에서 우위가 있으면 가격 경쟁에서 더 오래 버틸 수 있어. 게다가 버텍스AI에서 경쟁 모델까지 팔아 클라우드 매출을 챙기는 이중 포지션이야.

메타의 위치도 미묘해. 오픈웨이트로 모델을 배포하면서 동시에 애저를 통해 외부 모델을 대량으로 쓰는 이중 구조인데, 8월 20일 블룸버그 보도에서 드러난 것처럼 연간 수억 달러를 마이크로소프트에 지불하고 있어. 모델 가격이 내려가면 이런 대형 구매자의 원가도 함께 내려가고, 그건 자체 모델 개발의 경제적 논거를 조금씩 약하게 만들어.

중국 오픈웨이트 진영은 가격 경쟁에서 구조적으로 유리해. 가중치를 공개하면 서빙은 여러 사업자가 경쟁적으로 하고, 그 경쟁이 가격을 계속 밀어내려. 모델 회사가 직접 마진을 지킬 필요가 없는 구조야. 다만 최상위 성능 구간에서는 여전히 격차가 있고, 기업 도입에서는 규제와 신뢰 문제가 남아.

추론 인프라 스타트업들에게는 양날의 검이야. 프론티어 모델 가격이 내려가면 "우리는 더 싸게 서빙한다"는 논거의 여백이 줄어들어. 대신 전체 추론 수요가 커지면 시장 자체는 확대돼. 에치드나 그록 같은 전용 하드웨어 회사들의 논리는 여전히 성립하지만, 손익분기점이 이동해.

OpenAI 자신도 이 국면에서 선택을 해야 해. 가격을 내리면 사용량은 늘지만 매출당 마진은 얇아지고, 그 상태에서 대규모 인프라 투자를 계속하려면 다른 수익원이 필요해. 기업 계약과 소비자 구독의 비중이 커질수록 API 가격은 더 공격적으로 쓸 수 있는 카드가 돼. 이번 인하가 API에만 적용되고 소비자 구독은 건드리지 않은 것도 그 구조를 보여줘.

정리하면 이번 인하에서 확인되는 건 세 가지야. 첫째, 최상위 모델의 가격 프리미엄이 출시 6주 만에 흔들릴 만큼 대체재가 늘었다는 것. 둘째, 인하의 무게중심이 출력 토큰에 실려 있어 에이전트 워크로드를 명확히 겨냥했다는 것. 셋째, 소비자 요금을 건드리지 않음으로써 OpenAI가 두 시장을 완전히 분리해 운용하고 있다는 것. 이 세 가지는 앞으로 다른 모델 회사들의 가격 결정을 읽을 때도 그대로 적용해볼 수 있는 틀이야.

그래서 뭐가 달라지는데

API를 쓰는 개발자라면 지금 할 일은 두 가지야. 첫째, 현재 파이프라인의 입력 대 출력 토큰 비율을 확인해. 출력 비중이 높다면 이번 인하의 실제 효과가 헤드라인 20%보다 훨씬 커. 둘째, 11월 21일이라는 종료일을 캘린더에 넣어둬. 프로모션 가격으로 단가 계산을 해두고 나중에 원가가 튀는 상황은 피해야 해.

비용을 관리하는 입장이라면 캐시 입력 가격이 함께 내려간 걸 활용할 수 있어. 같은 시스템 프롬프트나 문서를 반복해서 넣는 구조라면 캐싱을 제대로 붙이는 것만으로 절감폭이 크게 벌어져. 인하 전에도 유효했던 최적화지만, 지금은 그 이득이 더 커졌어.

모델 선택을 고민하는 팀이라면 최상위 모델의 가격 장벽이 낮아진 게 실질적인 변화야. 그동안 비용 때문에 중급 모델을 쓰던 작업 중 일부는 이제 최상위 모델로 올려도 예산이 맞을 수 있어. 다만 반대 방향의 실험도 해봐. 파인콘 사례가 보여주듯 맥락 구조를 개선하면 중급 모델로도 충분한 경우가 많아.

스타트업을 운영한다면 이 흐름은 원가 구조에 대한 좋은 소식이야. AI 기능의 단가가 계속 내려가고 있고, 그건 이전에 단위경제성이 안 나오던 제품이 성립하기 시작한다는 뜻이야. 다만 경쟁자도 같은 조건을 받는다는 걸 잊지 마. 가격이 내려간 만큼 AI 기능 자체는 차별화 요소가 아니게 돼.

국내에서 AI 서비스를 운영한다면 환율까지 함께 봐야 해. 달러로 청구되는 API 요금은 원화 기준 원가가 환율에 그대로 노출되거든. 33% 인하가 환율 변동에 상쇄되는 구간도 있을 수 있어서, 절감 효과를 원화 기준으로 다시 계산해두는 게 안전해.

AI 산업을 보는 입장이라면 이번 인하가 알려주는 건 프론티어 프리미엄의 수명이야. 최상위 모델의 가격 방어력이 출시 6주 만에 흔들렸다면, 앞으로 모델 성능만으로 프리미엄을 지키는 기간은 더 짧아질 거야. 그 조건에서 모델 회사들은 제품·유통·기업 계약 쪽으로 무게를 옮길 수밖에 없어.

🥄 남은 궁금증 세 가지

— 이게 AI 가격이 계속 내려간다는 신호야? 방향은 그쪽으로 보이지만 단정하긴 일러. 이번 건 영구 인하가 아니라 11월 21일까지의 프로모션이야. 다만 추론 원가 자체가 하드웨어와 최적화로 계속 내려가고 있고, 대체 모델이 늘어나는 것도 사실이라, 장기 방향은 하락 쪽일 가능성이 높아. 다만 그 하락이 매끄럽게 이어질 거라고 가정하고 사업 계획을 짜는 건 위험해.

— 그럼 지금 최상위 모델로 갈아타야 해? 작업 성격에 달렸어. 출력 토큰을 많이 쓰는 추론·에이전트 작업이면 이번 인하의 효과가 커서 갈아탈 이유가 생겨. 반대로 분류나 추출처럼 짧은 출력이 나오는 작업이면 최상위 모델의 이점 자체가 적어. 먼저 재봐야 할 건 가격이 아니라 우리 작업에서 모델 등급이 결과 품질을 실제로 얼마나 바꾸는지야.

— 소비자 요금은 왜 안 내렸어? 시장이 다르기 때문이야. 개발자는 토큰 단가를 직접 비교하고 파이프라인을 바꿀 수 있어서 가격에 민감해. 반면 소비자 구독자는 제품 경험과 습관으로 묶여 있어서 가격 탄력성이 낮아. 두 시장을 분리해 관리하는 건 합리적인 선택이고, 이번 인하가 개발자 시장에서의 경쟁 압력에서 나왔다는 걸 역으로 보여주기도 해.

참고 자료

숫자와 기준은 발표 시점 기준이라 바뀔 수 있어. 투자 판단은 각자의 몫!