endueendue

Sonnet 5.5 가 Opus 를 앞선 날, 모델은 이제 어떻게 고를까

Claude Sonnet 5.5 가 Opus 5.5 의 절반 가격으로 한 벤치마크에서 Opus 를 앞섰습니다. 그런데 설정에 따라서는 작업 하나에 드는 돈이 오히려 더 많습니다. 발표된 숫자와 독립 측정을 나란히 놓고 모델 고르는 순서를 정리했습니다.

어두운 배경에 크기가 다른 원 세 개가 한 줄로 놓여 있고, 가운데 원을 라벤더색 점선 고리가 감싼다. 그 아래로 초록색 손잡이가 가운데 눈금에 걸린 슬라이더가 있다.

9월 28일 Anthropic 이 Claude Sonnet 5.5 를 공개했습니다. 발표에서 가장 많이 인용된 숫자는 Terminal-Bench 4.0 점수입니다. 에이전트가 터미널에 명령어를 직접 입력하며 전문 작업을 끝까지 해내는지 보는 시험인데, Sonnet 5.5 가 70.6% 로 상위 모델 Opus 5.5(66.4%)보다 높게 나왔습니다. 토큰 가격은 Opus 5.5 의 절반입니다.

그러면 이제 Opus 는 쓸 일이 없을까요? 숫자를 조금 더 들여다보면 답이 그렇게 간단하지 않습니다.

이 글에서는 Anthropic 이 발표한 수치와 독립 평가 기관의 측정을 나란히 놓고, 우리 팀 작업에 맞는 모델을 고르는 순서를 정리했습니다.

Anthropic 이 발표한 숫자

Anthropic 이 공개한 벤치마크에서 두 모델을 나란히 놓으면 이렇습니다.

벤치마크 Sonnet 5.5 Opus 5.5
Terminal-Bench 4.0 70.6% 66.4%
OSWorld 2.1 (부분 점수) 80.1% 81.8%
CursorBench 4.0 55.5% 57.8%
GDPval-AA v2.1 1844 1846
Humanity’s Last Exam (도구 사용) 64.5% 67.7%
FrontierCode 1.1 46.2% 54.4%

Sonnet 5.5 가 앞선 건 Terminal-Bench 하나입니다. 나머지는 Opus 5.5 가 조금씩 앞서는데, FrontierCode 를 빼면 차이가 4점을 넘지 않습니다. FrontierCode 에서만 8.2점이 벌어집니다.

전 세대와 비교하면 변화가 큽니다. Sonnet 5 는 같은 Terminal-Bench 4.0 에서 10.3% 였습니다. 가격은 Sonnet 5 그대로 입력 100만 토큰당 2달러, 출력 10달러이고, 출력 속도는 30% 넘게 빨라졌다고 합니다. Anthropic 은 토큰을 덜 쓰는 덕분에 작업당 비용도 Sonnet 5 보다 최대 30% 줄었다고 설명합니다.

발표 수치는 제조사가 직접 잰 것입니다. 독립 평가 기관 Artificial Analysis 가 따로 돌린 Terminal-Bench 4.0 에서도 Sonnet 5.5 가 64%, Opus 5.5 가 60% 남짓으로 순서는 같았습니다.

한 주 사이에 바뀐 가격표

Sonnet 5.5 가 나오기 일주일 전, 9월 21일과 22일 이틀 동안 세 회사가 새 모델을 냈습니다. 아래 가격은 입력과 출력 100만 토큰당 기본 요율입니다.

모델 공개일 입력 출력 이전 모델과 비교
Grok 4.7 9월 21일 $2 $6 Grok 4.6 과 같음
Claude Opus 5.5 9월 22일 $4 $20 Opus 5($5/$25)보다 20% 낮음
GPT-6 Sol 9월 22일 $2 $10 GPT-5.6 Sol($4/$20)의 절반
GPT-6 Luna 9월 22일 $0.10 $0.50 GPT-5.6 Luna($0.20/$1.20)의 절반 이하
Claude Sonnet 5.5 9월 28일 $2 $10 Sonnet 5 와 같음

Sonnet 5.5 와 GPT-6 Sol, Grok 4.7 의 입력 가격이 모두 100만 토큰당 2달러입니다. 입력 단가만으로는 셋을 가르기 어렵습니다. 입력이 아주 길면 더 높은 요율을 받는 모델도 있으니, 긴 문서를 다룬다면 제공사 가격표를 함께 확인하세요.

작업 하나에 드는 돈

토큰 단가가 절반이면 비용도 절반일 것 같습니다. 실제 비용은 모델이 작업 하나를 끝내는 데 토큰을 얼마나 쓰느냐로 정해집니다.

Artificial Analysis 는 자체 지표인 Intelligence Index 의 과제를 모델마다 돌려서 점수와 과제당 비용을 공개합니다. 추론 강도별로 보면 이렇습니다.

모델 · 추론 강도 지표 점수 과제당 비용
Opus 5.5 · 최대 58 $5.98
Sonnet 5.5 · 최대 56 $7.60
Sonnet 5.5 · 높음 47 $1.08
Sonnet 5.5 · 낮음 36 $0.41

추론 강도를 최대로 올린 Sonnet 5.5 는 과제 하나에 출력 토큰을 약 19만 3천 개 썼습니다. Artificial Analysis 가 지금까지 잰 모델 가운데 가장 많고, 최대 설정의 Opus 5.5(약 11만 9천 개)보다 60% 가량 많습니다. 그래서 토큰 단가가 절반인 Sonnet 5.5 가 과제당 비용은 Opus 5.5 보다 27% 높았습니다. 점수는 2점 낮았고요.

같은 모델 안에서도 차이가 큽니다. Sonnet 5.5 를 낮음에서 최대로 올리면 과제당 비용은 18배 넘게 늘고, 점수는 36에서 56으로 오릅니다. 높음과 최대 사이만 봐도 비용은 7배, 점수는 9점 차이입니다.

Anthropic 이 말한 “작업당 최대 30% 절감”도 설정에 따라 달라집니다. Artificial Analysis 측정에서 최대 설정의 Sonnet 5.5 는 Sonnet 5 보다 과제당 비용이 50% 가량 높게 나왔습니다.

물론 이 지표의 과제는 여러분 팀의 작업과 다릅니다. 표는 방향을 읽는 데 쓰고, 판단은 직접 잰 숫자로 내리는 편이 안전합니다.

모델 고르는 순서

  1. 지난주에 실제로 한 일에서 과제를 뽑습니다. 실패한 테스트 고치기, 고객 문의 스레드 요약하기처럼 반복되는 일 열 개에서 스무 개면 충분합니다. 과제마다 끝났다고 볼 기준을 한 줄로 적어 둡니다.
  2. 성공한 과제당 비용을 셉니다. 과제마다 쓴 토큰과 성공 여부를 기록한 뒤 전체 비용을 성공한 과제 수로 나눕니다. 싼 모델이 두 번 실패하고 세 번째에 성공하면 비싼 모델로 한 번에 끝낸 것보다 비쌀 수 있습니다.
  3. 모델을 바꾸기 전에 추론 강도부터 조정합니다. 위 측정처럼 같은 모델도 설정에 따라 비용이 열 배 넘게 달라집니다. 중간급 모델을 보통이나 높음으로 먼저 돌려 보고, 그걸로 안 풀리는 과제만 최대 설정이나 상위 모델로 올립니다.
  4. 작업 종류마다 기본 모델을 따로 둡니다. 발표된 숫자로는 터미널에서 명령을 치며 일하는 에이전트에 Sonnet 5.5 가 강하고, FrontierCode 같은 고난도 코딩에서는 Opus 5.5 가 아직 앞섭니다. 분류나 정보 추출처럼 양이 많고 단순한 일이라면 GPT-6 Luna 같은 소형 모델을 먼저 시험해 볼 만합니다. 입력 가격이 Sonnet 5.5 의 20분의 1입니다.
  5. 새 모델이 나오면 같은 과제로 다시 잽니다. 이번처럼 일주일 사이에 가격표가 여러 번 바뀌기도 합니다. 1번에서 만든 과제 묶음을 남겨 두면 새 모델 평가가 한두 시간이면 끝납니다. 정기적으로 도는 작업은 모델을 고정해 두어야 비용이 예고 없이 달라지지 않습니다.

endue 에서는

endue 는 여러 제공사의 모델을 한 카탈로그에 모아 두고, 모델을 세 곳에서 정하게 합니다. 에이전트 빌더에서 정하는 에이전트 기본값, 입력창에서 메시지 하나에만 쓰는 모델, 그리고 자기 모델을 고정해 두는 루틴입니다. 모델 선택기에는 100만 토큰당 가격과 도구 호출 지원 여부가 함께 나오고, 일부 모델은 추론 강도도 고를 수 있습니다.

그래서 위 순서를 그대로 옮길 수 있습니다. 빠르고 저렴한 모델을 에이전트 기본값으로 두고, 어려운 메시지 몇 개에서만 더 강한 모델로 올리면 됩니다. 정기 작업은 루틴에 모델을 고정해 두면 에이전트를 다시 손봐도 비용이 그대로 유지됩니다.

자세한 설정은 모델 고르기 문서에 있고, 지금 고를 수 있는 모델과 가격은 모델 목록에서 볼 수 있습니다.

참고 자료