Gemini 4 Argon 리뷰: 에이전트를 운영하는 팀이 지금 결정할 수 있는 것
발표 사흘째의 Gemini 4 Argon 을 운영자의 눈으로 다시 봤습니다. 작업 유형별로 어디가 강하고 어디가 약한지, 작업 하나에 실제로 얼마가 드는지, 출력 100만 토큰과 가드레일 없는 버전이 운영에 무엇을 뜻하는지, 그리고 API 가 열리기 전에 오늘 준비할 수 있는 것을 정리했습니다.

목차
Gemini 4 Argon(제미나이 4 아르곤)이 발표된 지 사흘이 지났습니다. 숫자는 브리핑에, 벤치마크 표 한 줄 한 줄과 측정 조건은 깊이 읽기에 정리해 두었습니다. 이 글은 다른 질문에서 출발합니다. 에이전트를 실제로 돌리는 팀이 이 모델을 두고 지금 결정할 수 있는 것은 무엇이고, 결정을 미뤄야 하는 것은 무엇인가.
점수표를 다시 읽지는 않겠습니다. 대신 공개 리더보드의 숫자를 작업 유형별로 다시 묶고, 토큰이 아니라 작업 하나의 비용으로 환산하고, 출력 100만 토큰과 “가드레일 없는 버전”이 운영 설계에 뜻하는 바를 짚은 뒤, API 가 열리기 전에 오늘 끝낼 수 있는 준비를 목록으로 남깁니다.
세 줄 결론
- 모델은 프런티어급으로 보입니다. 긴 입력을 읽고 계획을 세우고 문서를 만드는 일에서 선두이고, 터미널에서 손으로 하는 일과 화면을 보고 조작하는 일에서는 뒤집니다. 코딩은 그 중간입니다.
- 아직 아무것도 바꿀 수 없습니다. 10월 3일 기준 구글의 모델 목록과 가격표 어디에도 Argon 이 없습니다. 모델 ID 도, 출시 기념가의 종료일도, 모델 카드도 그대로 비어 있습니다.
- 준비는 오늘 끝낼 수 있습니다. 우리 작업 세트, 작업당 토큰 로그, 경로별 출력 상한, 캐시를 타는 프롬프트 구조, 작업 유형별 라우팅은 지금 쓰는 모델로 만들어 두면 Argon 이 열리는 날 바로 비교할 수 있습니다.
사흘 동안 달라진 것, 그대로인 것
달라진 것. 발표 직전에 나온 블룸버그 보도(벤치마크는 좋지만 실제 업무에서는 덜하다는 구글 직원들의 말)에 구글이 공식적으로 답했습니다. 9to5Google 이 10월 1일 전한 구글의 입장은 “Gemini 4 가 코딩 같은 영역에서 성능이 떨어진다고 말하는 것은 부정확하다”는 것이고, 한 직원은 내부에 프런티어 수준이라는 “폭넓은 합의”가 있다고 했습니다. The Implicator 가 전한 구글 Gemini 제품 책임자 툴시 도시(Tulsee Doshi)의 설명은 더 구체적입니다. 지난 몇 주 동안 구글 직원들이 모델을 써 봤고, 많은 이들이 가장 어려운 코딩과 리서치 문제에 이 모델을 쓰고 있다는 것입니다. 양쪽 말이 모두 사실일 수 있습니다. 어떤 종류의 코딩이냐에 따라 평가가 갈린다는 뜻이고, 아래 성적표가 그 갈림을 보여 줍니다.
Vals 의 공개 리더보드도 10월 2일에 갱신됐습니다. Argon 은 Vals Index 1위를 지켰고, 이번 갱신에는 작업당 비용과 지연 시간이 같이 적혔습니다. 이 글의 비용 계산은 그 표에서 시작합니다.
그대로인 것. 구글 AI for Developers 의 모델 목록 페이지와 가격 페이지를 10월 3일에 다시 확인했습니다. 둘 다 Argon 을 싣지 않았습니다. 가격 페이지의 가장 비싼 Gemini 는 여전히 Gemini 3.1 Pro Preview 이고, 모델 목록은 Gemini 3.8 Flash 부터 2.5 계열까지입니다. 출시 기념가 2달러·10달러가 언제 4달러·20달러가 되는지도 발표되지 않았습니다. 유료 API 고객과 Google AI Ultra 구독자가 다음 차례라는 말은 사흘 전과 같고, 날짜도 사흘 전처럼 없습니다.
작업 유형으로 다시 묶은 성적표
구글 표는 벤치마크 이름순입니다. 에이전트를 운영하는 입장에서는 “이 모델에 어떤 일을 맡길 것인가”로 묶어 보는 편이 쓸모 있습니다. 아래는 Vals 의 공개 리더보드(10월 2일)와 구글 표를 작업 유형별로 다시 배치한 것입니다. 순위는 그 리더보드에 올라 있는 전체 모델 가운데의 자리입니다.
| 맡길 일 | 벤치마크 | Argon | 순위 | 읽는 법 |
|---|---|---|---|---|
| 긴 문서·저장소 읽기 | GraphWalks 25만 6천에서 100만 토큰(구글 표) | 84.2% | 비교 4개 모델 중 1위, 2위와 12.4%p 차 | 가장 분명한 강점 |
| 재무·세무 문서 작업 | Vals Finance Agent v2 / Tax Agent Bench | 65.40% / 76.23% | 1위(74개 중) / 2위(65개 중) | 선두 |
| 법률 리서치 | LegalBench / Legal Research Bench | 88.30% / 54.81% | 3위(149개 중) / 4위(73개 중) | 상위권 |
| 업무 자동화 | AutomationBench(Zapier) | 51.3% | 1위 | 선두 |
| 앱 하나 만들기 | Vibe Code Bench | 91.91% | 2위(108개 중) | Sonnet 5.5 바로 아래 |
| 코드 마이그레이션 | Code Migration | 68.17% | 2위(73개 중) | 상위권. 한 과제에 57.82달러 |
| 터미널 작업 | Terminal-Bench 4.0 | 57.58% | 5위(43개 중) | Opus 5.5 에 9%p 뒤짐 |
| 알고리즘 문제 | IOI | 100% | 1위(40개 중) | 만점 |
| 운영 장애 대응 | SRE Bench | 44.27% | 3위(16개 중) | 상위권이지만 절반 이하 |
| 화면 보고 조작하기 | CUA-bench / OSWorld-2.0(구글 표) | 4.83% / 69.2% | 7위(8개 중) / Astra 72.6% 에 뒤짐 | 가장 분명한 약점 |
| 취약점 찾고 고치기 | CyberBench v1.1 / CWE-bench v1 | 77.86% / 68% | 2위(44개 중) / 공동 1위 | 선두권 |
| 의료 기록 작성 | MedScribe | 87.43% | 15위(106개 중) | 평범 |
패턴이 보입니다. 읽고, 계획하고, 문서를 만드는 일에는 강하고, 환경 안에서 손으로 하는 일에는 약합니다. 긴 컨텍스트와 재무·법률·자동화 벤치마크는 모두 “자료를 많이 읽고 긴 답을 만드는” 일이고, Argon 은 여기서 선두입니다. 반대로 터미널, 화면 조작, 장애 대응은 “한 번에 하나씩 행동하고 결과를 보고 다음을 정하는” 일이고, 여기서는 Claude Opus 5.5 나 GPT-6 Astra 가 앞서거나 Argon 이 아예 하위권입니다. CUA-bench 의 4.83%는 그 리더보드에 올라 있는 여덟 모델 중 일곱 번째이고, 한 과제를 돌리는 데 193.78달러가 들었습니다.
블룸버그 취재원과 구글의 반박이 동시에 맞을 수 있는 이유가 여기 있습니다. “가장 어려운 리서치 문제”는 Argon 이 잘하는 일이고, 터미널을 열고 화면을 눌러 가며 프런트엔드를 고치는 일은 아직 아닙니다.
에이전트 플랫폼에서 이 패턴은 역할 분담으로 번역됩니다. 긴 자료를 읽고 계획을 세우는 단계와 그 계획을 환경 안에서 실행하는 단계를 같은 모델에 맡길 이유가 없습니다. 지금도 여러 에이전트를 나누는 원칙으로 다루던 이야기인데, Argon 의 성적표는 그 분담선을 꽤 또렷하게 그어 줍니다.
토큰이 아니라 작업으로 계산하기
목록 가격만 보면 Argon 은 출시 기념가에서 GPT-6.1 Sol 과 같고, 표준가에서 Claude Opus 5.5 와 같습니다. 그런데 모델이 작업 하나에 쓰는 토큰 수가 다르기 때문에, 작업 하나의 비용은 다른 그림을 보여 줍니다.
Vals Index 는 재무·코딩·법률·세무 네 분야의 벤치마크 여덟 개를 묶은 지수이고, 표에 과제당 비용과 지연을 함께 적습니다. Argon 은 표준가 4달러·20달러로 계산했습니다.
| 모델 | Vals Index | 과제당 비용 | 표에 적힌 지연 |
|---|---|---|---|
| Gemini 4 Argon | 68.90% | 15.68달러 | 46분 33초 |
| Claude Sonnet 5.5 | 67.04% | 21.34달러 | 1시간 18분 |
| Claude Opus 5.5 | 66.97% | 32.14달러 | 1시간 19분 |
| Claude Fable 5.1 | 65.83% | 28.71달러 | 1시간 17분 |
| GPT-6 Astra | 63.13% | 18.46달러 | 27분 48초 |
| GPT-6.1 Sol | 61.15% | 3.24달러 | 43분 10초 |
이 표에서 읽을 것은 두 가지입니다. 표준가로 계산해도 Argon 의 과제당 비용은 Claude 세 모델보다 낮습니다. 그리고 GPT-6.1 Sol 은 점수가 7.75%p 낮은 대신 비용이 5분의 1입니다. 모든 작업을 가장 좋은 모델로 돌릴 이유가 없다는 뜻이고, 어떤 작업을 어디로 보낼지가 비용의 대부분을 결정한다는 뜻입니다.
Artificial Analysis 의 측정은 한 가지를 더 말해 줍니다. Argon 은 작업 하나에 평균 6만 2천 출력 토큰을 쓰고, GPT-6 Astra 는 2만 7천 개를 씁니다. 그래서 같은 지능 지수 점수(53)에서 과제당 비용이 출시 기념가로 1.99달러, 표준가로 3.98달러입니다. 출력이 비용의 중심이라는 뜻이고, 이것이 다음 절의 출력 상한 이야기로 이어집니다.
에이전트 루프 하나로 계산해 보기
실제 운영에서 비용을 가르는 것은 캐시입니다. 에이전트 루프는 매 단계 같은 시스템 프롬프트, 같은 도구 스키마, 같은 저장소 요약을 다시 보냅니다. Argon 의 캐시 입력은 95% 할인이라 출시 기념가에서 100만 토큰당 0.10달러, 표준가에서 0.20달러입니다.
가정은 이렇습니다. 루프 40단계, 매 단계 앞에 붙는 안정 프리픽스 3만 토큰, 단계마다 새 입력 2천 토큰과 출력 3천 토큰. 대화 이력이 쌓이는 것은 뺀 단순 계산입니다.
| 조건 | 입력 비용 | 출력 비용 | 합계 |
|---|---|---|---|
| 출시 기념가, 캐시 없음 | 2.56달러 | 1.20달러 | 3.76달러 |
| 출시 기념가, 프리픽스 캐시 | 0.28달러 | 1.20달러 | 1.48달러 |
| 표준가, 캐시 없음 | 5.12달러 | 2.40달러 | 7.52달러 |
| 표준가, 프리픽스 캐시 | 0.56달러 | 2.40달러 | 2.96달러 |
캐시가 입력 비용을 10분의 1 가까이로 줄이고, 그러고 나면 남는 것은 거의 전부 출력 비용입니다. 그러니 할 일은 둘입니다. 프롬프트에서 매번 같은 부분을 맨 앞에 두어 캐시가 걸리게 하고, 출력에 상한을 두는 것입니다. 캐시 저장 요금(구글은 다른 Gemini 모델에서 토큰당 시간 단위로 받습니다)은 Argon 에 대해 아직 발표되지 않았으니, 그 항목은 열어 두세요.
2027년 예산은 두 모델 모두 두 배로
구글 가격 페이지에는 Argon 과 상관없이 운영 예산에 영향을 주는 날짜가 하나 있습니다. Gemini 3.8 Flash 의 가격은 2026년 12월 31일까지 100만 토큰당 입력 0.75달러·출력 3.75달러이고, 2027년 1월 1일부터 1.50달러·7.50달러로 두 배가 됩니다. Argon 의 출시 기념가도 어느 날 두 배가 됩니다. 지금 Flash 를 기본 모델로 쓰면서 Argon 을 기다리는 팀이라면, 2027년 예산은 두 모델 모두 두 배 가격으로 잡아 두는 편이 안전합니다.
출력 100만 토큰을 운영 설계로 옮기면
출력 한도가 6만 4천 토큰에서 100만 토큰으로 늘었다는 사실은 깊이 읽기에서 비용과 시간으로 환산해 두었습니다. 여기서는 그것을 설계 결정 네 개로 옮깁니다.
한도는 요청의 속성이 아니라 경로의 속성입니다. Vals 는 Argon 의 최대 출력을 26만 2천 토큰으로 적었고, Artificial Analysis 는 Long Decode Continuation 이라는 새 API 기능으로 100만 토큰까지 받았다고 설명합니다. 구글 문서에는 아직 둘 다 없습니다. 어느 쪽이든, 모델이 허용하는 최대값을 서비스의 기본값으로 삼으면 안 됩니다. 요약 경로는 4천, 코드 리뷰 경로는 3만, 마이그레이션 계획 경로는 20만, 이런 식으로 경로마다 상한을 정하고 그 위에서만 예외를 두세요.
긴 응답은 백그라운드 작업입니다. 수십만 토큰짜리 생성은 몇 시간이 걸릴 수 있고, 그동안 연결은 끊깁니다. 스트리밍으로 받되 중간 결과를 영속 저장소에 쓰고, 끊기면 이어 받고, 끝나면 알림을 보내는 작업 큐로 다루세요. 사용자가 화면 앞에서 기다리는 요청과 같은 경로에 두지 않는 것이 핵심입니다.
리뷰할 수 없는 결과물은 받지 않습니다. 구글이 내세우는 사례는 80만 줄짜리 커널 마이그레이션입니다. 사람이 줄 단위로 읽을 수 없는 변경은 테스트와 CI 가 받아야 합니다. 긴 출력을 쓰는 경로에는 결과물을 작은 단위로 쪼개 달라고 요청하고, 각 단위가 자동 검사를 통과해야 다음으로 넘어가는 관문을 두세요. 리뷰 부담은 모델이 아니라 파이프라인 설계가 줄입니다.
비용 알림은 경로마다 겁니다. 상한을 꽉 채운 응답 하나가 출시 기념가에서 10달러, 표준가에서 20달러입니다. 하루 몇 건이 그렇게 나가는지를 경로별로 세고, 예산 초과를 모델이 아니라 운영자가 먼저 알아야 합니다.
가드레일에 등급이 생겼다
이번 출시에서 가장 주목할 만한 운영상의 사실은 벤치마크가 아니라 배포 방식에 있습니다. 구글은 Fairwind 프로그램의 신뢰할 수 있는 방어자들과 자사 보안 팀에 Argon 을 “사이버 가드레일 없이” 제공한다고 밝혔습니다. 같은 모델이 누가 쓰느냐에 따라 다른 안전 정책으로 움직인다는 뜻입니다.
이것은 플랫폼을 운영하는 팀에게 분명한 메시지입니다. 모델 제공사의 안전 동작은 상수가 아니라 설정입니다. 어느 날 모델이 거절하던 요청을 다음 버전이 수행할 수 있고, 같은 모델이라도 계정이나 계약에 따라 다르게 움직일 수 있습니다. 그러니 에이전트가 무엇을 할 수 있는지는 모델 밖에서 정해야 합니다. 도구 허용 목록, 에이전트마다 따로 주는 최소 권한, 되돌릴 수 없는 행동 앞의 사람 승인, 모든 도구 호출의 기록. 이 네 가지는 어떤 모델을 꽂아도 그대로 있어야 하는 것들입니다.
프롬프트 인젝션 수치도 같은 눈으로 봐야 합니다. 구글의 평가 문서에 따르면 Gray Swan 의 간접 프롬프트 인젝션 시험에서 15번 시도 안에 인젝션이 성공한 비율은 Argon 0.7%, Claude Opus 5.5 1.0%, GPT-6 Astra 8.5%입니다. 좋은 숫자이지만 0 은 아닙니다. 하루에 도구 호출이 수천 번 일어나는 에이전트라면 “성공 확률이 낮다”가 아니라 “성공했을 때 피해가 어디까지 가는가”로 설계해야 합니다. 외부 문서를 읽는 에이전트에게 메일 발송 권한을 같이 주지 않는 식의 분리가 그 답입니다.
행동 시험 결과도 하나 있습니다. Andon Labs 는 장기 사업 시뮬레이션 Vending-Bench 2 에서 Argon 이 확인 메일을 지어내고, 환불을 거부하고, 공급업체에 거짓말을 했다고 적었습니다. 시뮬레이션이지만, 실제 계정을 맡기기 전에 가짜 계정으로 같은 상황을 돌려 보라는 신호로는 충분합니다.
구글 스스로도 Argon 의 사고 과정과 행동을 지켜보다가 “필요하면 실행을 멈추는” 감시 장치를 둔다고 했습니다. 모델 제공사가 그렇게 한다면, 그 모델을 쓰는 플랫폼도 같은 능력이 있어야 합니다. 실행 중인 에이전트를 사람이 언제든 멈출 수 있고, 멈춘 이유가 화면에 보이는 것 말입니다.
API 가 열리기 전에 오늘 할 수 있는 준비
Argon 을 지금 쓸 수는 없지만, Argon 이 열렸을 때 일주일 안에 결정을 내리려면 지금 있어야 하는 것들이 있습니다. 전부 지금 쓰는 모델로 만들 수 있습니다.
- 우리 작업 세트를 만드세요. 결과가 분명한 실제 작업 50개를 고르고, 통과 기준을 적어 두고, 지금 쓰는 모델(예를 들어 Gemini 3.8 Flash 나 Claude Sonnet 5.5)로 한 번 돌려 기준선을 남깁니다. 공개 벤치마크는 모든 연구소가 맞춰 튜닝하는 대상이지만, 우리 작업 세트는 아닙니다.
- 작업당 토큰을 기록하세요. 입력, 캐시 입력, 출력 토큰을 작업 단위로 성공 여부와 나란히 남깁니다. 이 기록이 없으면 모델을 바꿨을 때 “좋아진 것 같다”밖에 말할 수 없습니다.
- 경로마다 출력 상한을 정하세요. 지금 모델의 상한이 6만 4천이라 문제가 없었던 경로도, 100만이 되면 다른 경로가 됩니다.
- 프롬프트의 안정 프리픽스를 맨 앞으로 옮기세요. 시스템 프롬프트, 도구 스키마, 저장소 요약처럼 매번 같은 부분이 먼저 오고, 매번 다른 부분이 뒤에 와야 캐시가 걸립니다. 위 계산에서 이것 하나가 비용을 60% 줄였습니다.
- 작업 유형별 라우팅을 만드세요. 기본은 빠르고 싼 모델, 긴 자료를 읽고 계획을 세우는 유형만 상위 모델로 보내는 분기를 지금 만들어 두면, Argon 은 그 분기의 선택지 하나로 들어옵니다.
- “모르겠다”를 따로 세세요. Artificial Analysis 기준 Argon 의 환각률은 15%, 정확도는 50%입니다. 검색 기반 응답이나 고객 지원 흐름이라면 기권과 오답을 구분해야 이 모델의 성격이 서비스에 어떻게 나타날지 알 수 있습니다.
- 되돌릴 수 없는 행동에 승인 관문을 두세요. 메일 발송, 메시지 게시, 데이터 삭제처럼 계정 밖으로 나가거나 지우는 행동은 모델과 상관없이 사람이 확인하는 자리가 있어야 합니다. 그리고 그 관문을 거친 행동을 가짜 계정으로 먼저 돌려 보세요.
- 2027년 예산을 두 배로 잡으세요. Flash 는 날짜가 정해져 있고, Argon 은 정해져 있지 않습니다.
endue 에서는
endue 는 여러 제공사의 모델을 한 카탈로그에 모아 두고, 모델을 세 곳에서 정하게 합니다. 에이전트 빌더에서 정하는 에이전트 기본값, 입력창에서 메시지 하나에만 쓰는 모델, 그리고 자기 모델을 고정해 두는 루틴입니다. 모델 선택기에는 100만 토큰당 가격과 도구 호출 지원 여부가 같이 나오고, 일부 모델은 추론 강도도 고를 수 있습니다. 지금 모델 목록에는 Gemini 3.8 Flash 를 비롯한 Gemini 모델들이 다른 제공사의 모델과 나란히 있습니다.
위 준비 목록의 5번은 그래서 오늘 그대로 해 볼 수 있습니다. 빠른 모델을 에이전트 기본값으로 두고, 긴 자료를 읽는 메시지에서만 상위 모델로 올리고, 정기 작업은 루틴에 모델을 고정해 두는 식입니다. 사용량 화면은 토큰을 모델별, 에이전트별로 보여 주니 2번의 기록도 거기서 시작할 수 있습니다. 설정 방법은 모델 고르기 문서에 있습니다.
7번의 승인 관문은 endue 의 기본 동작입니다. 메일 발송, 메시지 게시, 데이터 삭제처럼 되돌릴 수 없는 행동은 항상 승인 카드를 지나고, 이 관문은 설정으로 끌 수 없습니다. 실행이 멈추는 세 가지 이유와 각각의 카드는 동작 방식 문서에 있습니다. 어떤 모델을 꽂아도 그 자리는 같습니다.
아직 모르는 것
- 유료 API 고객과 Ultra 구독자가 언제, 어느 지역에서 쓸 수 있는지
- 모델 ID, 입력 컨텍스트 윈도, 레이트 리밋, 캐시 저장 요금
- 요청 하나의 실제 출력 상한이 26만 2천인지 100만인지, 그리고 Long Decode Continuation 이 어떻게 동작하는지
- 출시 기념가가 끝나는 날
- Argon 의 모델 카드와 Frontier Safety Framework 보고서
참고 자료
- Google, Gemini 4 Argon: our next era of frontier intelligence (2026년 9월 30일)
- Google DeepMind, Gemini 4 Argon 평가 방법과 결과 (PDF, 9월 30일), Fairwind Program
- Google AI for Developers, Gemini 모델 목록, 가격 (10월 3일 확인)
- Vals AI, Vals Index (10월 2일 갱신), Gemini 4 Argon 모델 페이지
- Artificial Analysis, Gemini 4 Argon 평가 결과 (9월 30일)
- Zapier, AutomationBench 순위표; Collinear, CWE-bench v1
- Bloomberg(야후 파이낸스 게재), Google grapples with employee skepticism about new Gemini model (9월 30일)
- 9to5Google, Google stands by Gemini 4 performance as some claim it ‘struggles’ in real-world use (10월 1일)
- The Implicator, Google Staff Doubt Gemini 4 Argon Coding Despite Benchmarks (10월 1일)
- The Hacker News, Google Rolls Out Gemini 4 Argon to Trusted Cyber Defenders, Plans Guardrail-Free Version (10월 1일)
- Andon Labs, Vending-Bench 2, Argon 행동 관찰 (9월 30일)


