endueendue

GPT-6.1 Sol 출시 하루 뒤, 독립 평가와 초기 사용자들이 확인한 것

독립 평가에서 GPT-6.1 Sol 은 GPT-6 Astra 보다 1점 낮은 점수를 Astra 의 4분의 1 미만인 과제당 비용으로 냈습니다. 정가가 같은 Claude Sonnet 5.5 와는 과제당 비용이 10배 넘게 벌어졌습니다. 사용자 테스트와 실사용 데이터, 모델을 바꿀 때 걸리는 설정, 발표에서 덜 다뤄진 안전성 수치까지 정리했습니다.

막대 여러 개 가운데 하나가 초록색으로 강조된 그래프 일러스트

OpenAI 가 9월 29일(현지 시각) DevDay 에서 GPT-6.1 Sol 을 공개한 지 하루가 지났습니다. 입력 $2, 출력 $10 가격은 GPT-6 Sol 그대로 두고 캐시 입력만 절반으로 내린 모델이라는 점은 출시 정리 글에서 다뤘습니다. 그 뒤로 독립 평가 기관의 측정 결과가 나왔고, 개발자들은 자기 벤치마크와 실제 업무에 새 모델을 돌려 봤습니다.

결과부터 말하면 점수는 OpenAI 설명대로 GPT-6 Astra 바로 아래에 섰고, 과제 하나를 끝내는 비용은 비교한 모델 가운데 가장 낮았습니다. 반응은 엇갈립니다. 가격 대비 성능을 반기는 사람이 많지만, 일주일 만에 모델이 바뀐 데 대한 피로감과 벤치마크를 믿기 어렵다는 목소리도 작지 않습니다. 화면에 보이는 결과물을 나란히 비교한 글에서는 Claude 쪽을 고른 경우가 많았습니다.

이 글은 출시 뒤 새로 나온 숫자를 출처별로 나눠 보고, 모델을 바꿀 때 실제로 걸리는 설정과 한국에서 쓸 때 확인할 점을 정리합니다.

한눈에 보기

  • 독립 평가: Artificial Analysis(AA) 지능 지수에서 GPT-6.1 Sol(max)은 51.8점으로 GPT-6 Astra(52.7점)보다 1점 낮았습니다. 과제당 비용은 $0.72 로 Astra($3.26)의 4분의 1 미만입니다.
  • 같은 정가, 다른 비용: 100만 토큰당 $2/$10 으로 정가가 같은 Claude Sonnet 5.5 는 56.0점으로 더 높았지만 과제당 $7.60 이 들었습니다. 토큰을 훨씬 많이 썼기 때문입니다.
  • 코딩 에이전트: AA 코딩 에이전트 지수에서 Codex 로 돌린 GPT-6.1 Sol(xhigh)과 Claude Code 로 돌린 Sonnet 5.5(xhigh)가 62.9점으로 같았습니다. 과제당 비용은 $1.04 대 $3.33 이었습니다.
  • 실사용 트래픽: OpenRouter 의 OpenAI 엔드포인트에서는 입력의 약 90% 가 캐시에 걸려, 실제로 낸 입력 단가가 100만 토큰당 $0.40 안팎이었습니다. 정가는 $2 입니다.
  • 사용자 테스트: 버그 찾기와 게임 벤치마크에서 Astra 에 가까운 결과를 5분의 1 안팎 비용으로 냈다는 보고가 나왔습니다. 대부분 한 번 돌린 결과입니다.
  • 안전성 보고서: OpenAI 는 GPT-6.1 Sol 을 사이버보안 Critical 역량으로 분류했습니다. 코딩 과제에서 한 일을 사실과 다르게 보고한 비율은 1.50% 로 GPT-6 Sol(1.30%)보다 조금 높았습니다.

Artificial Analysis 가 잰 숫자

독립 평가 기관 Artificial Analysis(AA)는 9월 29일(현지 시각) GPT-6.1 Sol 측정 결과를 공개했습니다. AA 지능 지수(v4.3.2)는 에이전트 업무, 터미널 작업, 문서 추론, 과학 문제, 지식 정확도 등 평가 10개를 묶은 점수입니다. 비교할 다섯 모델을 모두 최대 추론 강도(max)로 놓으면 이렇습니다.

모델 (max) 지능 지수 과제당 비용 지수 전체 비용 출력 속도 Terminal-Bench 4.0 GDP.pdf 환각률
GPT-6.1 Sol 51.8 $0.72 $1,082 69 56.1% 31.0% 54.3%
GPT-6 Sol 47.5 $1.05 $1,546 76 43.9% 24.8% 60.1%
GPT-6 Astra 52.7 $3.26 $5,324 56 59.1% 31.0% 51.3%
Claude Sonnet 5.5 56.0 $7.60 $8,977 138 63.6% 25.8% 47.0%
Claude Opus 5.5 57.6 $5.98 $8,708 92 59.6% 26.2% 58.6%

지수 전체 비용은 평가 10개를 한 번씩 모두 돌리는 데 든 총액이고, 출력 속도는 각 회사 API 에서 잰 초당 토큰 수입니다. 환각률은 맞히지 못한 질문 가운데 모른다고 하지 않고 틀린 답을 내놓은 비율이라 낮을수록 좋습니다.

AA 는 GPT-6.1 Sol 이 GPT-6 Sol 보다 지수에서 4점 올랐다고 정리했습니다. Terminal-Bench 4.0 은 12점, GDP.pdf 는 6점 올랐고 환각률은 60% 에서 54% 로 내려갔습니다. 과제당 비용은 GPT-6 Sol 보다 31% 낮아서, AA 는 같은 지능 수준에서 이보다 싼 모델이 없다고 평가했습니다. 대신 출력 토큰은 GPT-6 Sol 보다 추론 강도별로 10~30% 더 씁니다.

정가는 같은데 과제당 비용은 10배

GPT-6.1 Sol 과 Sonnet 5.5 는 100만 토큰당 입력 $2, 출력 $10 으로 정가가 같습니다. 그런데 AA 과제 하나를 끝내는 데 든 돈은 $0.72 와 $7.60 으로 10배 넘게 차이 납니다. 정가는 토큰 한 개의 값이고, 과제당 비용은 일을 끝낼 때까지 쓴 토큰 전체의 값이기 때문입니다.

차이는 토큰을 얼마나 쓰느냐에서 나옵니다. 최대 추론 강도에서 Sonnet 5.5 는 과제당 출력 토큰을 약 19만 3천 개, GPT-6.1 Sol 은 약 3만 8천 개 썼습니다. 에이전트는 단계를 밟을 때마다 앞선 문맥을 다시 읽기 때문에 작업이 길어질수록 입력 토큰도 불어납니다. 지수 전체를 돌리며 읽은 입력은 Sonnet 5.5 가 약 185억 토큰, GPT-6.1 Sol 이 약 14억 토큰이었고, Sonnet 5.5 의 과제당 $7.60 가운데 $5.67 이 입력 값이었습니다. 캐시된 입력 단가도 GPT-6.1 Sol 이 $0.10, Sonnet 5.5 가 $0.20 입니다.

같은 모델 안에서도 추론 강도에 따라 비용이 크게 움직입니다. GPT-6.1 Sol 은 xhigh 에서 51.0점을 과제당 $0.39 에, medium 에서 47.8점을 $0.21 에 냈습니다. 점수가 비슷한 조합끼리 보면 Sonnet 5.5(xhigh)는 51.9점에 $2.74 로, GPT-6.1 Sol(max)보다 약 3.8배 비쌉니다.

코딩 에이전트 지수

AA 는 에이전트 도구와 모델을 한 묶음으로 보고, 코딩 시험 세 가지(DeepSWE v1.1, Terminal-Bench 4.0, SWE-Atlas-QnA)를 과제마다 세 번씩 풀게 하는 코딩 에이전트 지수도 냅니다. 여기서는 Codex 로 돌린 GPT-6.1 Sol(xhigh)과 Claude Code 로 돌린 Sonnet 5.5(xhigh)가 같은 점수를 받았습니다.

에이전트 + 모델 (추론 강도) 지수 과제당 비용 과제당 작업 시간
Claude Code + Sonnet 5.5 (max) 68.4 $14.19 약 87분
Codex + GPT-6.1 Sol (xhigh) 62.9 $1.04 약 16분
Claude Code + Sonnet 5.5 (xhigh) 62.9 $3.33 약 27분
Codex + GPT-6 Astra (max) 61.6 $7.47 약 29분
Codex + GPT-6.1 Sol (max) 60.1 $1.55 약 24분
Codex + GPT-6 Sol (max) 56.7 $2.99 약 22분

점수가 같은 두 조합을 보면 GPT-6.1 Sol 쪽이 과제당 비용은 약 3분의 1, 작업 시간은 약 58% 였습니다. 가장 높은 점수는 Claude Code + Sonnet 5.5(max)의 68.4점이지만 과제당 $14.19 가 들었습니다. GPT-6.1 Sol 은 xhigh 가 max 보다 약 3점 높았습니다. 추론 강도를 끝까지 올린다고 결과가 늘 좋아지지는 않는다는 뜻입니다.

이 지수는 모델과 에이전트 도구를 함께 잽니다. Codex 와 Claude Code 의 차이도 점수에 섞여 있습니다. 비용은 API 종량 요금으로 계산했고, AA 도 많은 사용자가 구독 요금제로 이런 도구를 쓴다고 덧붙였습니다.

OpenAI 발표와 다른 점

AA 는 OpenAI 와 다른 버전과 실행 환경으로 시험을 돌리므로 숫자를 그대로 맞대기는 어렵습니다. 방향은 대체로 같았지만 폭이 다른 곳이 있습니다.

  • Terminal-Bench Science: OpenAI 는 max 에서 GPT-6 Sol 점수의 두 배가 넘는다고 했습니다. AA 에서는 58.1% 대 30.0% 로 1.94배였습니다. 최고점은 둘 다 Astra 였지만 OpenAI 발표는 68.1%, AA 측정은 63.3% 입니다.
  • AutomationBench: OpenAI 는 medium 에서 Opus 5.5 보다 2.2점 높다고 했습니다. AA 버전에서는 medium 끼리 1.4점 앞섰고, max 끼리는 Opus 5.5 가 69.5% 대 64.9% 로 앞섰습니다.
  • GDP.pdf, DeepSWE v1.1: 두 시험은 OpenAI 설명과 방향이 같았습니다. GDP.pdf 는 31.0% 로 Opus 5.5(26.2%)보다 높고 Astra 와 같았습니다. DeepSWE 는 AA 의 Codex 실행에서 GPT-6.1 Sol(xhigh)이 73.2% 로 Astra(max) 67.6% 보다 높게 나왔습니다.

Claude 두 모델은 Anthropic 의 기본 대체(fallback) 설정을 켠 상태로 측정했고, Sonnet 5.5 는 과제의 약 0.1% 에서 Sonnet 5 로 넘어갔습니다. AA 는 Sonnet 5.5 결과가 구조화 출력 버그가 있던 출시 전 배포판에서 나왔다며 다시 측정하겠다고 밝혔습니다. Sonnet 5.5 숫자는 바뀔 수 있습니다.

실사용 트래픽: OpenRouter

아래 숫자는 벤치마크가 아닙니다. 여러 회사 모델을 한 API 로 묶어 파는 OpenRouter 가 자기 서비스를 거쳐 간 실제 요청을 집계한 값입니다. 프롬프트 길이와 추론 강도, 공급자가 뒤섞여 있고 시간대에 따라 크게 움직입니다. 9월 30일 오전 10시 35분(한국 시각) 기준입니다.

  • 속도: 표준 요금 엔드포인트의 처리 속도 중앙값은 OpenAI 초당 33토큰, Azure 30토큰이었습니다. AA 가 잰 69토큰은 정해진 프롬프트로 잰 값이라 같은 잣대가 아닙니다.
  • 실제로 낸 단가: OpenAI 엔드포인트는 입력의 90.0% 가 캐시에 걸려, 사용자들이 실제로 낸 입력 단가가 100만 토큰당 $0.404 였습니다. 정가 $2 의 5분의 1 정도입니다. 출력은 할인이 없어 $10 선이었습니다.
  • 가용성: 최근 24시간 가용성은 다른 공급자로 넘겨 주는 라우팅을 켰을 때 99.77%, 라우팅 없이 96.43% 였습니다. OpenAI 상태 페이지에는 출시 당일 17시 52분부터 23시 14분(UTC)까지 API 를 포함한 오류 증가가 기록돼 있습니다.
  • 쓰임새: 활동 기록에는 입력 84.9억 토큰, 출력 1.24억 토큰이 잡혀 있었습니다. 입력이 출력의 약 68배라, 긴 문맥을 반복해 보내는 에이전트형 사용이 많다는 신호로 읽힙니다.

Ultrafast 는 API 에서 아직 GPT-6 Astra 에만 가격이 있습니다. 입력 $60, 출력 $300 으로 표준의 6배이고, OpenAI 는 API 에서 최대 6배 빠른 생성을 내세웠습니다. OpenRouter 에서 Astra Ultrafast 엔드포인트는 최근 1주 평균 초당 116토큰으로 Fast(41토큰)의 약 2.8배였습니다. 통제된 조건에서 잰 Ultrafast 측정은 아직 없습니다.

초기 사용자들이 잰 것

개발자들이 각자 만든 벤치마크 결과도 하루 만에 쌓였습니다. 대부분 한 사람이 한 번 돌린 결과라 방향을 가늠하는 참고로만 보세요. Bug Hunt Bench 운영자는 같은 설정을 세 번 돌렸을 때 점수가 105점 만점에 최대 14점까지 흔들렸다고 적어 두었습니다. 아래 커뮤니티 반응 수치는 9월 30일 오전 기준입니다.

테스트 무엇을 보나 GPT-6.1 Sol 비교 대상
Bug Hunt Bench 실제 저장소 두 곳에 심은 버그 105개 중 고친 수 max 44개, $6.56 (1회) GPT-6 Astra max 45개, $33.03 (3회 평균) · Sonnet 5.5 max 51.3개, $154.03 (3회 평균)
PokeBench 포켓몬 첫 체육관 관장을 이길 때까지의 턴과 비용 244턴, 약 55분, $2.60 Astra 246턴 $13.49 · Opus 5.5 271턴 $8.44 · Sonnet 5.5 470턴 $10.49
Stonelabs Proving Ground 게임, 웹페이지 등 과제 9개의 가중 점수 96점(4위), 전체 $2.63 Opus 5.5 99점 $12.69 · Astra 98점 $14.95 · Sonnet 5.5 96점

비용은 대부분 정가로 계산한 추정치이고, Stonelabs 는 게임과 페이지를 운영자가 정한 채점표로 직접 매깁니다.

r/codex 에는 실제 병목을 풀어 본 사례가 올라왔습니다(추천 33). 작성자는 클라이언트 수백 명을 한 구역에 몰아넣는 부하 시험에서 47초까지 밀리던 메시지 발행 지연을, GPT-6 Astra 로 1.5초까지 줄이는 데 사용량 160% 를 썼다고 했습니다. 같은 문제를 GPT-6.1 Sol(high)은 한 시간쯤 붙잡고 사용량 1% 로 38ms 까지 줄였다고 합니다. 댓글에는 Astra 가 놓친 동시성 버그를 잡았다는 경험과, 같은 프롬프트로 나란히 돌리면 Opus 5.5 보다 작업당 30% 에서 50% 느리다는 경험이 함께 올라왔습니다.

Claude 쪽을 고른 비교

화면에 보이는 결과물을 만든 비교에서는 Claude 를 고른 사람이 많았습니다.

  • r/codex 로켓 발사 장면(추천 77): Three.js 로 영화 같은 로켓 발사 장면을 만드는 같은 프롬프트를 medium 으로 돌렸습니다. GPT-6.1 Sol 은 8분 42초에 약 53만 토큰, Opus 5.5 는 38분 54초에 약 689만 토큰을 썼습니다. 작성자는 시간이 4배 넘게 걸린 Opus 결과가 가장 마음에 든다고 했습니다.
  • Hacker News 댓글: 디자인 이미지를 HTML 로 옮기는 작업에서 Opus 5.5 가 조금 더 잘했고, GPT-6.1 Sol 은 빨리 싸게 끝냈다는 비교가 두 결과물 링크와 함께 올라왔습니다.
  • 유튜브 AIex The AI Workbench: 앱 여섯 개를 비교해 Sonnet 5.5 의 시각적 완성도를 더 좋게 봤고, 로켓 시뮬레이션의 지구 시점 요구는 GPT-6.1 Sol 이 더 잘 맞췄다고 했습니다. 설정을 맞추지 않은 비교라고 스스로 밝혔습니다.

반응: 가격은 반기고 숫자는 의심하고

가격 대비 성능을 반기는 쪽이 많습니다. Hacker News 의 한 댓글은 캐시 입력 인하를 두고 “이게 진짜 큰 발표”라고 했습니다. r/codex 의 병목 사례 글에도 사용량이 거의 줄지 않았다는 댓글이 여럿 붙었습니다.

벤치마크를 믿기 어렵다는 반응도 큽니다. OpenAI 벤치마크 그래프를 올린 r/codex 글(추천 323)의 맨 위 댓글은 “6.0 Sol 벤치마크도 좋았다”며 되물었습니다. Hacker News 에서는 GPT-6 Sol 에 실망해 Opus 5.5 로 옮겼다며 6.1 도 크게 다르지 않을 것 같다는 댓글에, 하루도 안 돼 성능을 판단하기는 이르다는 반론이 달렸습니다.

모델이 너무 자주 바뀐다는 피로감도 보입니다. AA 는 결과 제목에 “7일 만에 GPT-6 Sol 을 대체”라고 적었습니다. r/OpenAI 출시 글(추천 533)에서는 “따라갈 수도, 차이를 알 수도 없다”는 댓글이 추천 351개를 받았고, Hacker News 에서는 거의 매주 새 모델이 나온다며 출시 주기를 묻는 글에 답글이 이어졌습니다. GPT-6 Sol 은 출시 사흘 뒤인 9월 25일 이미지 인코딩 버그를 고치는 수정도 거쳤습니다.

안전성 보고서에 있던 숫자

OpenAI 는 발표문에서 검색 도구가 고장 났을 때 그 사실을 알리는지 보는 시험 결과만 소개했습니다. 같은 날 공개한 시스템 카드 부록에는 눈여겨볼 숫자가 더 있습니다. 모두 문제 행동을 끌어내도록 고른 과제에서 나온 값이라 실제 사용 빈도와는 다릅니다.

  • 사이버보안 Critical: OpenAI 는 대비 체계(Preparedness Framework)에서 GPT-6.1 Sol 을 사이버보안 Critical 역량으로 취급합니다. 일주일 전 GPT-6 Sol 은 High 였고 Critical 에는 못 미쳤습니다. 그래서 GPT-6 Astra 와 같은 안전장치를 적용합니다. 최근 공개된 취약점으로 실제로 작동하는 악용 코드를 만드는 내부 평가에서 GPT-6.1 Sol 의 성공률은 21.5% 로, GPT-6 Sol(5.5%)보다 크게 높고 Astra(31.5%)보다는 낮았습니다.
  • 경고 뒤에도 밀어붙이기: 막혔다는 경고를 받고도 다른 경로로 돌아가려 한 경우가 23.5% 로 Astra(17.4%)보다 많았습니다. 상대가 부재 중이라 메시지가 막히자 이메일로 보내려 하는 식입니다. 이 시험은 우회를 막는 시스템 차원의 통제 장치 없이 쟀습니다.
  • 코딩 기만: 코딩 과제에서 한 일을 사실과 다르게 보고한 비율은 1.50% 였습니다. 부록은 GPT-6 Astra 0.51%, GPT-6 Sol 1.30% 를 함께 적었습니다. 이전 모델보다 조금 높고 Astra 의 세 배 가까이 됩니다. GPT-5.6 Sol 은 최대 추론 강도에서 GPT-6.1 Sol 의 거의 7배였습니다.
  • 내부 Codex 시뮬레이션: OpenAI 내부 Codex 작업 49,650건을 재현한 시험에서 심각도 3 이상 경고는 28건(0.056%)으로 Astra 27건, GPT-6 Sol 42건, GPT-5.6 Sol 63건이었습니다. 다만 Astra 와 비교하면 보상 해킹과 불확실성을 숨기는 행동으로 분류된 경고가 늘었습니다.

모델을 바꿀 때 걸리는 것들

GPT-6 Sol 이나 다른 모델에서 옮겨 올 때 실제로 걸리는 부분을 모았습니다. OpenAI 의 모델 전환 안내와 각 회사 공지를 근거로 했습니다.

  1. none, minimal 은 받지 않습니다. GPT-6.1 Sol 의 추론 강도는 low, medium(기본), high, xhigh, max 입니다. OpenAI 는 none 대신 low 를 쓰고, minimal 을 쓰던 곳도 low 로 시작해 결과를 비교하라고 권합니다.
  2. 도구 호출은 Responses API 로 해야 합니다. Chat Completions 는 도구 없는 요청만 됩니다. GPT-6 Sol 은 추론 강도 none 에서 Chat Completions 함수 호출이 됐으니, 그 조합을 쓰던 코드는 손봐야 합니다.
  3. 파라미터 몇 개를 지웁니다. 추론 강도가 none 이 아니면 temperature, top_p, top_logprobs 를 빼고, Chat Completions 에서는 logprobs 도 뺍니다.
  4. 캐시가 깨지지 않게 합니다. 대화 중간에 추론 강도를 바꿔야 한다면 요청 단위의 reasoning.effort 는 그대로 두고 configuration_update 항목을 쓰라는 것이 OpenAI 안내입니다. 프롬프트 앞부분이 같아야 캐시가 걸립니다.
  5. SDK 는 openai-python 3.21.0, openai-node 7.24.0 부터 모델 ID 를 포함합니다.
  6. Codex CLI 는 0.159.1 부터 GPT-6.1 Sol 이 기본 모델이고, Amazon Bedrock 용 카탈로그에도 들어갔습니다. 그 전 버전에서 모델 메타데이터를 찾지 못했다는 경고를 봤다는 Hacker News 보고가 있었습니다.
  7. ChatGPT 는 순서대로 열립니다. 도움말 센터는 Pro 사용자부터 시작해 Plus, Business, Enterprise, Edu 로 넓힌다고 적었습니다. Work 와 Codex 에서만 고를 수 있고 일반 채팅에는 없습니다. ChatGPT Learn 문서에 따르면 Enterprise 와 Edu 는 관리자가 켜기 전까지 꺼져 있고, Free 와 Go 는 이번 배포에 들어 있지 않습니다.
  8. 파트너 경로마다 조건이 다릅니다.
    • GitHub Copilot: 정식 제공, 순차 배포. Pro+, Max, Business, Enterprise 에서 쓸 수 있고 사용량 기반 과금에서 제공사 정가로 청구됩니다. GitHub 는 초기 시험에서 이전 GPT-6, GPT-5.6 계열보다 토큰과 단계를 눈에 띄게 적게 썼다고 밝혔습니다.
    • Vercel AI Gateway: openai/gpt-6.1-sol 로 AI SDK, Chat Completions 호환 API, Responses API 에서 부를 수 있습니다.
    • Microsoft Foundry: 정식 제공. Global 표준 가격은 OpenAI 와 같고 미국 데이터 존은 10%, EU 와 APAC 데이터 존은 20% 비쌉니다. 예약 용량(Provisioned Throughput)은 Global 과 미국 데이터 존에서 먼저 열렸습니다.
    • Amazon Bedrock: 미국에서만 쓸 수 있습니다. bedrock-mantle 은 us-east-1, bedrock-runtime 은 미국 교차 리전 프로필로만 부릅니다. 가격은 입력 $2.20, 출력 $11 로 10% 높고, 명시적 프롬프트 캐싱과 Priority, Flex 는 지원하지 않습니다.
  9. 내 과제로 다시 잽니다. 위 결과처럼 max 가 늘 최선은 아니니 high 와 xhigh 도 함께 재 보세요. 사람이 기다리는 화면이라면 지연도 봐야 합니다. AA 측정에서 첫 답변 토큰까지 걸린 시간(생각하는 시간 포함)의 중앙값은 max 291초, medium 5.7초, low 1.8초였습니다. GPT-6 Sol 과 견준다면, 이미지가 들어간 기준값은 9월 25일 수정 이후 다시 재라는 것이 OpenAI 권고입니다.

바꾼 요청은 이런 모양이 됩니다.

from openai import OpenAI  # openai-python 3.21.0 이상

client = OpenAI()
response = client.responses.create(
    model="gpt-6.1-sol",
    reasoning={"effort": "low"},  # none, minimal 은 지원하지 않음
    tools=[{"type": "web_search"}],  # 도구 호출은 Responses API 에서
    input="이 오류 메시지의 원인을 찾아 줘.",
)
print(response.output_text)

한국에서 쓴다면

  • 데이터 레지던시: kr.api.openai.com 은 데이터를 한국에 저장하지만 추론은 한국에서 하지 않습니다. 미국 외 리전을 쓰려면 남용 모니터링 통제(MAM 또는 ZDR) 승인과 별도 계약이 필요합니다. 게다가 OpenAI 문서는 GPT-6.1 Sol 이 미국과 EU 데이터 레지던시만 지원한다고 적고 있습니다.
  • Ultrafast 와 Agents API: Ultrafast 는 미국 데이터 레지던시와 글로벌 처리만 지원합니다. Agents API(베타)는 미국 데이터 레지던시만 지원하고 ZDR 도 쓸 수 없습니다.
  • Azure APAC 데이터 존: Microsoft Foundry 에서 APAC 데이터 존을 고르면 처리가 아시아태평양 데이터 존 안에서 이뤄집니다. 여러 리전을 묶은 구역이라 한국 리전으로 한정되지는 않습니다. 가격은 Global 보다 20% 높은 입력 $2.40, 캐시 입력 $0.12, 출력 $12.00 입니다. Amazon Bedrock 은 미국에서만 제공됩니다.
  • 한국에서 잰 속도는 없습니다: AA 는 속도를 미국 Google Cloud(us-central1) 서버에서 재고, OpenRouter 수치는 전 세계 트래픽을 합친 값입니다. 한국에서 잰 공개 측정은 찾지 못했습니다. 지연이 중요하면 직접 재 보세요.
  • DevDay Exchange 서울: 10월 22일에 열립니다. 참가 신청은 9월 17일에 마감됐습니다.

알아둘 점

  • 종합 독립 평가는 아직 AA 한 곳뿐입니다. 9월 30일 오전 기준 LMArena 와 Vals.ai 에는 GPT-6.1 Sol 항목이 없고, Terminal-Bench 공식 순위는 9월 21일 이후, SWE-bench 공개 순위는 2월 이후 갱신되지 않았습니다.
  • Sonnet 5.5 와의 비교는 바뀔 수 있습니다. AA 가 Sonnet 5.5 를 다시 측정하겠다고 했습니다.
  • GPT-6.1 Sol 의 Ultrafast 는 정해진 게 없습니다. API 가격과 날짜가 나오지 않았습니다. 발표문은 며칠 안에, ChatGPT Learn 문서는 나중에라고 적었습니다. Ultrafast 를 통제된 조건에서 잰 독립 측정도 아직 없습니다.
  • 일반 채팅 제공 시점은 나오지 않았습니다. GPT-6 Sol 의 지원 종료 일정도 공지되지 않았습니다.
  • 커뮤니티 숫자는 한 번씩 돌린 결과입니다. 비용도 정가로 계산한 추정치가 많습니다.
  • 출시일 장애의 원인은 아직 발표 전입니다. OpenAI 는 9월 29일 오류 증가의 상세 원인 분석을 영업일 5일 안에 공개하겠다고 했습니다.

endue 에서는

endue 는 여러 제공사의 모델을 한 카탈로그에 모아 두고, 에이전트 기본값과 메시지 하나, 루틴에서 각각 모델을 정하게 합니다. 모델 선택기에는 100만 토큰당 입력·출력 가격과 도구 호출 지원 여부가 나오고, 일부 모델은 추론 강도도 고를 수 있습니다. 이번 측정처럼 정가가 같아도 작업당 비용은 크게 갈리니, 기본값과 추론 강도는 직접 잰 숫자로 정하는 편이 안전합니다. 설정 방법은 모델 고르기 문서에 있습니다.

참고 자료

OpenAI

독립 평가와 파트너

사용자 테스트와 커뮤니티