Gemini 4 Argon 깊이 읽기: 벤치마크 18개, 출력 100만 토큰, 단계적 출시
구글의 첫 Gemini 4 모델은 자사 표의 벤치마크 18개 중 12개에서 1위를 했고, 공개 리더보드도 대체로 같은 쪽을 가리킵니다. 이 글은 누가 어떤 조건으로 쟀는지, 작업 하나에 토큰을 얼마나 쓰는지, 100만 토큰짜리 응답 한 번이 얼마인지, 왜 지금은 사이버 방어 팀만 쓸 수 있는지 정리했습니다.

목차
구글이 Gemini 4 Argon(제미나이 4 아르곤)을 발표했습니다. 한국 시간으로 10월 1일 새벽 5시, 미국 시간 9월 30일 오후입니다. Gemini 4 세대의 첫 모델이고, 구글은 이를 새 프런티어 모델이라고 부릅니다. 다만 지금은 검증을 거친 사이버 방어 팀만 API 를 호출할 수 있습니다.
그래서 지금 기댈 수 있는 자료는 세 가지입니다. 구글이 낸 벤치마크 표, 먼저 접근 권한을 받은 몇몇 독립 평가 기관의 결과, 그리고 둘을 두고 오가는 논쟁입니다. 이 글은 표를 한 줄씩 읽고, 공개 리더보드와 맞춰 보고, 출력 100만 토큰의 비용을 계산한 뒤, 출시 방식과 회의론까지 차례로 봅니다. 짧게 보려면 브리핑을 먼저 읽어 주세요.
한눈에 보기
| 항목 | 내용 |
|---|---|
| 발표 | 9월 30일 20:00 UTC(한국 시간 10월 1일 05:00), 구글 딥마인드 코라이 카바쿨루 명의의 글 |
| 지금 쓸 수 있는 곳 | 구글 Fairwind 사이버 방어 프로그램 파트너 일부, 미국 정부 평가 기관 |
| 다음 차례 | 유료 Gemini API 고객, Google AI Ultra 구독자. 날짜는 없음 |
| 출력 한도 | 응답 하나에 100만 토큰. 기존 6만 4천 토큰에서 늘어남 |
| 가격 | 출시 기념가 100만 토큰당 입력 2달러·출력 10달러, 이후 4달러·20달러. 캐시 입력 95% 할인. 출시 기념가가 언제 끝나는지는 미공개 |
| 구글 표 | 18개 중 12개 1위, 1개 공동 1위 |
| Artificial Analysis | 지능 지수 53, GPT-6 Astra 와 같은 점수. 이 순위표 1위는 여전히 Claude Opus 5.5(58) |
| 아직 없는 것 | 모델 ID, 입력 컨텍스트 윈도, 학습 데이터 기준일, 레이트 리밋, 모델 카드 |
Argon 은 어디에 놓이나
구글은 Argon 이라는 이름의 뜻을 설명하지 않았고, 함께 나온 형제 모델도 없습니다. Pro·Flash·Lite 같은 등급이 아직 없습니다. 구글 대변인은 로이터에 Argon 이 이전 Pro 모델보다 크고 Gemini 4 세대의 “중심” 모델이 될 것이며, Gemini 3.5 Pro 는 내지 않기로 했다고 말했습니다. Artificial Analysis 는 Flash 급을 넘는 구글 딥마인드의 독자 모델이 7개월여 만에 나온 것이라고 짚었습니다.
외부 리더보드에는 추론 강도가 High 와 Medium 두 가지로 올라 있고, Artificial Analysis 는 High 가 가장 높은 설정이라고 적었습니다. 구글 API 문서에는 아직 Argon 이 아예 없어서, 이 이름들은 바뀔 수 있습니다.
구글이 낸 표
구글은 Argon 을 세 모델과 비교했습니다. OpenAI 의 GPT-6 Astra, Anthropic 의 Claude Fable 5.1 과 Claude Opus 5.5 입니다. GraphWalks 가 컨텍스트 길이별로 두 줄이라 벤치마크 18개가 19줄을 차지합니다. 굵은 글씨가 줄마다 가장 높은 점수입니다.
| 영역 | 벤치마크 | Argon | GPT-6 Astra | Fable 5.1 | Opus 5.5 |
|---|---|---|---|---|---|
| 지식 업무 | Vals Index | 68.9% | 63.1% | 65.8% | 67.0% |
| 지식 업무 | AutomationBench | 51.3% | 41.4% | 31.4% | 42.5% |
| 지식 업무 | Vals Finance Agent v2 | 65.4% | 53.5% | 58.9% | 58.6% |
| 지식 업무 | Harvey 법률 에이전트 벤치마크 | 19.6% | 5.4% | 6.7% | 3.8% |
| 에이전트 코딩 | DeepSWE v1.1 | 77.9% | 74.1% | 67.4% | 74.2% |
| 에이전트 코딩 | FrontierSWE v2 | 55.0% | 65.5% | 56.3% | 62.3% |
| 에이전트 코딩 | Vibe Code Bench | 91.9% | 89.6% | 90.3% | 90.3% |
| 에이전트 코딩 | Terminal-bench 4.0 | 57.4% | 58.2% | 57.9% | 66.4% |
| ML 엔지니어링 | PostTrainBench | 45.3% | 44.3% | 40.2% | 49.3% |
| 과학·수학 | Terminal-Bench Science 0.1 | 57.6% | 68.1% | 52.6% | 63.3% |
| 과학·수학 | LABBench 2 | 88.8% | 85.4% | 68.6% | 73.1% |
| 과학·수학 | RiemannBench | 76.0% | 72.0% | 65.6% | 69.6% |
| 긴 컨텍스트 | GraphWalks, 12만 8천 토큰 이하 | 99.7% | 98.7% | 91.4% | 90.6% |
| 긴 컨텍스트 | GraphWalks, 25만 6천에서 100만 토큰 | 84.2% | 71.8% | 65.0% | 66.8% |
| 컴퓨터 사용 | Agent’s Last Exam | 39.5% | 34.2% | 없음 | 38.2% |
| 컴퓨터 사용 | OSWorld-2.0, 오프라인 부분 | 69.2% | 72.6% | 없음 | 없음 |
| 멀티모달 | Chartography | 71.6% | 71.0% | 46.2% | 66.3% |
| 멀티모달 | LVBench | 91.7% | 87.5% | 79.7% | 83.7% |
| 사이버 보안 | CWE-bench v1 | 68.0% | 68.0% | 58.0% | 67.0% |
벤치마크 단위로 세면 Argon 이 12개에서 1위, 1개에서 공동 1위입니다. GPT-6 Astra 는 3개 1위에 CWE-bench 공동 1위, Opus 5.5 는 2개 1위, Fable 5.1 은 1위가 없습니다.
차이의 크기는 고르지 않습니다. 가장 크게 앞선 네 곳은 지식 업무와 긴 컨텍스트에 몰려 있습니다. Harvey 법률 벤치마크에서 12.9%p, GraphWalks 25만 6천에서 100만 토큰 구간에서 12.4%p, AutomationBench 에서 8.8%p, Vals Finance Agent v2 에서 6.5%p 앞섰습니다. 반대로 1위를 한 곳 중 다섯 군데는 차이가 2%p 미만이고, Vals Index 와 Vibe Code Bench 도 여기에 들어갑니다. 가장 크게 뒤진 세 곳은 차이가 대부분의 승리 폭보다 큽니다. FrontierSWE v2 와 Terminal-Bench Science 에서 Astra 에 10.5%p, Terminal-bench 4.0 에서 Opus 5.5 에 9.0%p 뒤졌습니다.
코딩 쪽 결과가 가장 엇갈립니다. 에이전트 코딩 벤치마크 넷 중 두 개는 1위이고, 나머지 두 개는 네 모델 가운데 가장 낮은 점수입니다.
숫자를 만든 방식
구글은 표와 함께 5쪽짜리 평가 방법 문서를 냈습니다. 몇 줄은 표를 읽는 방식 자체를 바꿉니다.
누가 쟀나. 경쟁 모델 점수는 각 회사가 공개한 수치나 공개 리더보드에서 가져왔고, 각 모델의 최고 추론 설정 기준입니다. Argon 은 여러 항목을 구글이 직접 쟀습니다. DeepSWE v1.1(mini-SWE-agent 하네스 사용), Terminal-bench 4.0, Terminal-Bench Science, OSWorld-2.0 이 그렇습니다. PostTrainBench, LABBench 2, GraphWalks 는 모든 모델을 구글이 직접 돌렸습니다.
모델마다 다른 조건.
- Terminal-Bench Science: Argon 만 “검증 타임아웃 6배”로 돌렸고, 다른 모델 점수는 리더보드 값입니다. 그러고도 Astra 에 10.5%p 뒤졌습니다.
- OSWorld-2.0: Argon 점수는 세 번 돌린 결과 중 최고값입니다.
- LVBench: Gemini 는 영상을 초당 1프레임으로 봤고, Astra 는 800프레임, Fable 5.1 은 300프레임, Opus 5.5 는 600프레임을 받았습니다. 구글은 이를 “API 제약” 때문이라고 설명했습니다.
빠진 모델. 표에는 Claude Sonnet 5.5 도, Argon 하루 전에 나온 GPT-6.1 Sol 도 없습니다. 둘 다 일부 순위표에서는 중요한 자리에 있습니다. Vals Index 에서는 Sonnet 5.5 가 67.04%로 2위라 Opus 5.5 보다 조금 높고, Vibe Code Bench 에서는 Sonnet 5.5 가 92.39%로 1위, Argon 이 91.91%로 2위입니다.
이런 사정이 표를 틀리게 만들지는 않습니다. 다만 방향은 믿을 만하고, 격차의 크기는 걸러서 봐야 한다는 뜻입니다.
공개 리더보드로 맞춰 보기
표의 상당수 항목은 누구나 볼 수 있는 리더보드에서 왔습니다. 그 리더보드에 올라 있는 모델을 모두 넣고 보면 Argon 의 자리는 이렇습니다(10월 1일 기준).
| 벤치마크(순위표) | Argon 순위 | 상위권의 다른 모델 |
|---|---|---|
| Vals Index | 1위, 68.90% | Sonnet 5.5 67.04%, Opus 5.5 66.97% |
| Vals Finance Agent v2 | 1위, 65.40% | Gemini 3.8 Flash 61.44% |
| Harvey 법률 에이전트 벤치마크(Vals) | 5위, 19.58% | Meta Muse Spark 모델 넷. 1위는 Muse Spark 1.2, 25.42% |
| Vibe Code Bench(Vals) | 2위, 91.91% | Sonnet 5.5 92.39% |
| FrontierSWE v2(Proximal) | 구글 표의 네 모델 중 최하위, 5회 평균 55.0% | Astra 65.5%, Opus 5.5 62.3%, Fable 5.1 56.3% |
| AutomationBench(Zapier) | 1위, High 51.29% | Argon Medium 50.08%, Sonnet 5.5 44.75% |
| CWE-bench v1 | pass@1 68%로 공동 1위 | Grok 4.7, GPT-6 Astra 도 68% |
| DeepSWE v1.1(Datacurve) | 올라 있지 않음 | Astra, Gemini 3.8 Flash, Claude Opus 5 가 모두 74% |
알아 둘 만한 세부가 세 가지 있습니다.
Harvey 벤치마크는 채점 기준을 전부 통과해야 과제 하나를 맞힌 것으로 칩니다. Argon 은 개별 기준의 94.0%를 통과했고, 완전히 맞힌 과제는 19.6%입니다. 이 순위표 1위는 구글 비교표에 없던 Meta 의 Muse Spark 모델들입니다.
CWE-bench 는 모델마다 자기 에이전트 하네스에서 돌립니다. Argon 은 Antigravity, Astra 는 Codex, Claude 모델은 Claude Code 를 씁니다. 그러니 모델과 도구를 한꺼번에 재는 셈입니다. 동점은 pass@4 로 가르는데, Grok 4.7 81%, Opus 5.5 79%, Argon 75%, Astra 74%입니다. 순위표에 나온 실행 1회당 비용은 Argon 6.63달러, Astra 2.85달러, Grok 4.7 2.75달러, Opus 5.5 0.79달러입니다. 순위표를 운영하는 Collinear 는 Argon 의 캐시 입력을 100만 토큰당 0.20달러로 계산했는데, 구글이 밝힌 95% 할인을 적용하면 0.10달러라 Argon 비용이 조금 높게 잡혔을 수 있습니다.
DeepSWE 의 77.9%는 구글이 직접 돌린 결과입니다. 공개 순위표에는 Argon 이 없고, 거기서는 더 싼 Gemini 3.8 Flash 가 이미 74%로 Astra 와 같은 자리에 있습니다.
Artificial Analysis 와 Arena
Artificial Analysis(AA)는 평가 10종을 자체 방식으로 돌리는 곳이고, 출시 당일 Argon 결과를 냈습니다.
- 지능 지수: High 설정에서 53점. GPT-6 Astra(max, 53)와 같고 GPT-6.1 Sol(52)보다 1점 높습니다. Gemini 3.1 Pro Preview 보다 23점, Gemini 3.8 Flash 보다 12점 높습니다. AA 순위표의 모델 설정 223개 중 8위이고, 1위는 여전히 Claude Opus 5.5(max, 58)입니다.
- 에이전트 작업: AA 판 AutomationBench 에서 78%로 1위, Sonnet 5.5 보다 7점 높습니다. Terminal-Bench 4 에서는 57%로 Sonnet 5.5(64%), Opus 5.5(60%), Astra(59%)에 뒤졌습니다.
- 문서 작업: AA-Briefcase 에서 AA 가 기록한 것 중 가장 높은 루브릭 통과율(65%)을 냈지만, 분석과 표현 품질 점수는 낮았습니다.
- 토큰: 작업당 평균 출력 토큰이 6만 2천 개로, Astra 의 2만 7천 개의 두 배가 넘습니다.
가장 멀리 퍼진 숫자는 환각률입니다. AA-Omniscience 에서 Argon 의 환각률은 15%로, Astra 51%, GPT-6.1 Sol 54%와 차이가 큽니다. AA 는 환각률을 “맞히지 못한 질문 중 틀린 답을 낸 비율”로 정의합니다. 모르면 모른다고 하는지, 아니면 찍는지를 재는 지표입니다. 같은 시험에서 Argon 의 정확도는 50%로 Astra(63%)보다 13점 낮고, 둘을 합친 Omniscience 점수는 Argon 42, Astra 43 으로 비슷합니다. 정리하면 Argon 은 아는 사실이 더 적은 대신, 모를 때 모른다고 훨씬 자주 말합니다.
15%라는 수치는 AA 가 잰 것입니다. 구글 글에는 환각률 이야기가 아예 없습니다.
익명의 두 답변 중 하나를 사람이 고르는 Arena 에서는 Argon(High)이 Text 1위(1525점), WebDev 8위(1679점)로 출발했습니다. Agent Arena 순위도 8위인데, 3천 세션 남짓을 바탕으로 한 잠정 결과입니다.
구글이 내부에서 썼다는 사례
구글 글은 내부 성과로 시작합니다. 모두 구글의 주장이고, 외부에서 검증된 것은 없습니다.
- 양자 연구: 핵심 서브루틴의 큐비트와 게이트 수를 줄이는 작업에서, 한 사례는 “몇 분 만에 기존 발표 결과보다 40% 개선”했다고 합니다.
- 메모리: Argon 에이전트 팀이 전체 플릿의 프로파일링 데이터를 읽고 데이터센터 전반에 메모리 최적화를 적용해 300TiB 넘게 확보했고, 최종 절감 예상치는 500TiB 에서 1PiB 입니다.
- Rust 마이그레이션: C·C++ 코드를 Rust 로 옮기는 작업으로, 수만 줄짜리 라이브러리(re2, libgav1)부터 80만 줄이 넘는 Fuchsia Zircon 커널까지 다룹니다. 운영 반영 전에 감사와 에뮬레이션 테스트, 리뷰를 거친다고 합니다.
- libgav1: 에이전트가 SIMD 코드 3만 2천 줄을, 컴파일러가 알아서 벡터화하는 안전한 Rust 코드로 바꿨습니다. 결과 디코더는 이전 Rust 포트보다 2.7배 빠르고 출력은 같다고 합니다.
- 보안: Wiz 의 Scan for Good 프로그램에서 전 세계 병원이 쓰는 의료 소프트웨어의 개인정보 노출 취약점을 찾았다고 합니다. 어떤 소프트웨어인지, 고쳐졌는지는 밝히지 않았습니다.
출력 100만 토큰
출력 한도가 6만 4천 토큰(Gemini 3.8 Flash 와 3.1 Pro Preview 문서 기준 65,536)에서 100만 토큰으로 늘었습니다. 참고로 OpenAI 는 GPT-6 Astra 의 출력 한도를 12만 8천 토큰으로 안내합니다. 구글이 내세우는 이유는 깊이입니다. 이만큼 여유가 있으면 모델이 “하나의 궤적에서 수십만 토큰”을 쓰며 생각할 수 있다는 것입니다.
내 서비스의 한도를 올리기 전에 계산부터 해 보세요.
- 비용: 출시 기념가에서 출력은 100만 토큰당 10달러입니다. 한도를 꽉 채운 응답 하나가 10달러, 표준 가격이 되면 20달러입니다.
- 시간: AA 는 아직 Argon 의 속도를 공개하지 않았습니다. AA 순위표의 다른 프런티어 모델들은 초당 출력 토큰이 대략 50개에서 140개 사이입니다. 이 속도면 100만 토큰에 두 시간에서 여섯 시간이 걸립니다.
- 연결: HTTP 프록시, 로드 밸런서, 서버리스 런타임 대부분은 그보다 훨씬 먼저 연결을 끊습니다. AA 는 Long Decode Continuation 으로 Argon 을 시험했다고 밝혔는데, 긴 응답을 멈췄다가 다음 호출에서 이어 가는 Gemini API 의 새 기능이라고 설명합니다. 구글 문서에는 아직 나오지 않습니다.
이 한도가 값을 하는 곳은 한 번에 끝내야 하는 작업입니다. 긴 마이그레이션 계획, 테스트 스위트 전체, 수백 쪽 내내 앞뒤가 맞아야 하는 보고서, 모델이 오래 생각해야 하는 어려운 문제 같은 것들입니다. 짧은 호출을 여러 번 하는 보통의 에이전트 루프는 이 한도 근처에도 가지 않습니다. 그래도 AA 기준 작업당 출력이 이미 Astra 의 두 배가 넘으니, 긴 답을 요청하지 않더라도 토큰 예산은 다시 봐야 합니다.
긴 출력을 쓸 거라면 응답 하나를 백그라운드 작업처럼 다루세요. 요청마다 출력 상한을 명시하고, 스트리밍으로 받고, 중간 결과를 영속 저장소에 쓰고, 비용 알림을 걸어 두는 식입니다.
작업당 비용
목록 가격부터 보면, 출시 기념가 2달러·10달러는 GPT-6.1 Sol 과 같습니다. 표준가 4달러·20달러는 Claude Opus 5.5 의 목록 가격과 같습니다. 캐시 입력은 95% 할인이라 출시 기념가 기준 100만 토큰당 0.10달러이고, 매 단계 긴 컨텍스트를 다시 보내는 에이전트에 유리합니다.
작업을 끝내는 데 드는 비용은 그림이 다릅니다. Argon 이 많이 쓰기 때문입니다. AA 기준 지능 지수 작업 하나에 지금 가격으로 1.99달러로, Astra(3.26달러)의 60%이지만 GPT-6.1 Sol 의 2.7배입니다. 표준가로는 3.98달러, Astra 의 1.2배 정도가 됩니다. 점수가 비슷한 모델과 견주면, 추론 강도 high 의 Claude Opus 5.5 가 같은 지수에서 54점을 작업당 1.82달러에 냅니다. Zapier AutomationBench 에서도 작업당 지금 0.85달러, 목록 가격으로 1.70달러로 같은 흐름입니다.
출시 기념가가 언제 끝나는지는 공개되지 않았습니다. AA 는 “최소 한 달”이라고 쓰면서도 같은 글에서 구글이 종료일을 확정하지 않았다고 적었습니다. 그리고 구글 한국 블로그 글은 영어 원문의 각주가 빠져 표준 가격(4달러·20달러)이 아예 보이지 않습니다. 예산은 4달러·20달러로 잡으세요.
왜 지금은 사이버 방어 팀만 쓰나
Fairwind 는 9월 2일 Gemini 3.8 Flash Cyber 와 CodeMender 에이전트로 시작한 프로그램이고, 파트너가 650곳이 넘습니다. 이제 그중 일부가 Argon 을 독점적으로 받아 단독으로, 또는 CodeMender 안에서 씁니다. 구글은 이 신뢰할 수 있는 방어자들과 자사 팀에는 Argon 을 “사이버 가드레일 없이” 제공한다고 밝혔습니다.
접근에는 조건이 붙습니다.
- 정부와 국가 사이버 당국, 핵심 기반 시설 운영사, 주요 기술 플랫폼이 우선이고, 방어용 벤치마크를 연구하는 학계 연구실도 신청할 수 있습니다. 신청 기관은 신원 조사를 받습니다.
- 사내 보안, 침해 대응, 모의 해킹 팀만 쓸 수 있고, 피싱에 강한 MFA 가 필요하며, 어떤 직원이 썼는지 기록해야 합니다.
- 접근 권한을 되팔거나 나눌 수 없고, 악성코드 제작은 금지입니다.
- Gemini Enterprise 의 관리형 모델로 쓰면 데이터를 보존하지 않는 설정(zero data retention)을 지원합니다.
구글은 미국 정부의 자발적 사전 모델 접근 절차에도 참여하고 있다고 밝혔습니다. 그리고 넓게 풀기 전에 네 가지 안전장치를 강화하고 있다고 했습니다.
- 오남용: 사이버·CBRN 피해로 이어질 요청을 거절하고, 모델 내부 활성값을 보는 프로브로 이를 뒷받침합니다. 내부와 외부 레드팀이 시험했습니다.
- 프롬프트 인젝션: Gray Swan 의 간접 프롬프트 인젝션 시험에서 15번 시도 안에 인젝션이 성공한 비율이 0.7%로, Opus 5.5 1.0%, Astra 8.5%보다 낮습니다.
- 정렬 이탈: Argon 의 사고 과정과 행동을 지켜보다가 “필요하면 실행을 멈추는” 감시 장치를 둡니다.
- 샌드박스: 위험도가 높은 학습이나 평가 전에 시험 환경을 격리하고 봉인합니다.
Argon 의 모델 카드와 Frontier Safety Framework 보고서는 아직 나오지 않았습니다. 딥마인드 사이트의 최신 FSF 보고서는 Gemini 3.7 Flash 와 Gemini 3 Pro 것입니다.
조심스러운 출시는 일정과도 관련이 있어 보입니다. 9월 28일 OpenAI 는 GPT-6.1 Astra 가 시험에서 작업 범위와 권한을 지키지 못했다며 출시를 보류했습니다. 자세한 내용은 Dots 후속 글에 있습니다. 9월 30일에는 FTC 가 AI 기업들의 에이전트 위험을 조사하고 있다고 밝혔습니다. 또 Engadget 보도에 따르면 구글은 9월 월스트리트저널에, 파트너의 설정 오류로 Gemini 모델 하나가 5월에 시험 환경을 벗어난 일이 있었다고 말했습니다.
회의론
첫날 나온 의심은 네 갈래였습니다. 점수가 실제 일에서도 나오는지, 지금 누가 쓸 수 있기는 한지, 구글의 도구는 어떤지, 혼자 돌릴 때 어떻게 행동하는지입니다.
블룸버그 취재원. 블룸버그는 모델을 써 본 직원들 말을 빌려, Gemini 4 가 “벤치마크에서는 잘했지만” 직원들이 “실제로 일을 시켜 보면 덜하다”고 보도했습니다. 코딩 실력이 고르지 않고, 한 사람은 “프런트엔드 디자인에 특별히 능하지 않다”고 했습니다. 두 사람은 벤치마크 점수에 맞춰 튜닝하는 이른바 벤치맥싱의 영향이 보인다고 했습니다. 따라잡았다고 보는 직원도 있었습니다. 구글은 “Gemini 4 가 코딩 같은 영역에서 성능이 떨어진다고 말하는 것은 부정확하다”고 반박했고, 한 직원은 내부에 프런티어 수준이라는 “폭넓은 합의”가 있다고 말했습니다.
이 기사의 첫 판은 9월 30일 미국 서부 시간 12시 52분 야후 파이낸스에 실렸습니다. 구글 발표보다 8분 빨랐습니다. 알파벳 주가는 그날 2% 넘게 오르다 보도가 퍼지며 대부분을 반납하고 0.93% 상승으로 마감했습니다. 발표 뒤 시간외 거래에서 1.7%가량 올랐다가, 10월 1일 낮에는 1.2%가량 내린 상태였습니다. 국내 기사 중에는 이 순서를 거꾸로 적은 곳도 있으니 숫자는 원문으로 확인하는 편이 좋습니다.
프런트엔드에 관한 외부 자료는 엇갈립니다. Arena 의 WebDev 순위표에서 Argon 은 9월 30일 8위로, Claude Opus 5.5 보다 135점가량 낮고 GPT-6.1 Sol 보다도 아래였습니다. 앱 전체를 만드는 Vals 의 Vibe Code Bench 에서는 2위입니다. AA 의 문서 작업 시험은 표현 품질 점수를 낮게 줬습니다. 출시 전 “argon” 체크포인트를 써 본 사람들은 반대로 UI 작업을 칭찬했습니다.
아직 쓸 수 없다. Hacker News 출시 스레드는 10월 1일 16:55 UTC(한국 시간 10월 2일 01:55) 기준 1,579점, 댓글 1,048개였습니다. 하루 전 GPT-6.1 Sol 스레드의 1,057점보다 훨씬 많습니다. 최상위 댓글에서 가장 많이 나온 불만은 접근이었고, 다섯 개 중 하나꼴입니다. 한 댓글은 “OpenAI 나 Anthropic 은 모델 발표가 곧 정식 출시인데”라고 적었습니다. r/ClaudeAI 스레드를 요약한 서브레딧 봇은 이 스레드 대다수가 “Gemini 4 는 아직 나오지 않았다”고 본다고 정리했습니다. 즈비 모쇼비츠(Zvi Mowshowitz)는 “우리에게 없는 건 모델에 대한 접근”이라고 썼습니다. Argon 이 공개 API 에 올 즈음이면 경쟁사가 또 새 모델을 낼 거라는 예상도 많았습니다.
벤치마크 피로감. 최상위 댓글 열 개 중 하나꼴은 숫자 자체를 의심했습니다. “요즘 벤치마크는 너무 포화됐다”는 반응이 있었고, 평가 방법이 최고 추론 설정의 결과만 보여 준다는 지적도 있었습니다. Reddit 에서는 환각률 결과가 가장 많은 추천을 받는 동시에 가장 많은 정정도 받았습니다. “15%라는 게 Gemini 가 답변 15%에서 환각을 일으킨다는 뜻은 아니다”라는 댓글이 대표적입니다. 가명으로 활동하는 논평가 Teortaxes 는 중간 입장을 냈습니다. 선호도 데이터로 벤치맥싱됐을 수는 있지만, 꾸미기 어려운 시험의 일부 점수는 “눈이 번쩍 뜨일” 수준이라는 것입니다.
도구. Hacker News 에서 두 번째로 큰 주제는 모델이 아니었습니다. 최상위 댓글의 15% 정도가 구글의 Antigravity 하네스를 이야기했습니다. 기능이 빠져 있다는 불만, 구독을 서드파티 도구에서 쓰면 계정이 정지될까 걱정된다는 이야기입니다. 한 사용자는 “agy 를 쓰는 건 과거로 돌아가는 기분”이라고 했습니다. 긱뉴스(GeekNews)에도 비슷한 댓글이 달렸습니다. 모델이 아무리 좋아도 Antigravity CLI 하네스가 너무 엉성해서 믿음이 잘 가지 않는다는 내용입니다.
혼자 둘 때의 행동. Andon Labs 는 장기 사업 시뮬레이션인 Vending-Bench 2 에서 Argon 을 3위로 매기면서, Argon 이 “확인 메일을 지어내고, 환불을 거부하고, 송장 오류를 악용하고, 공급업체에 거짓말을 한다”고 적었습니다. 시뮬레이션이긴 해도, 에이전트에게 실제 계정을 맡기기 전에 꼭 시험해야 할 종류의 행동입니다.
반대쪽 자료도 있습니다. 전문 업무를 재는 Mercor 의 APEX-Agents 순위표에서 Argon 은 pass@1 82.2%로 1위이고, Sonnet 5.5 는 75.5%, Opus 5.5 는 73.5%입니다. Hacker News 의 사전 접근 사용자들, 그중 여럿은 구글 직원이라고 밝힌 사람들은 대체로 호평했고, 한 사람은 복잡한 일을 처음으로 맡길 만한 Gemini 모델이라고 했습니다. The Decoder 의 결론은 그 사이에 있습니다. Argon 이 구글을 “상위 3개 AI 연구소 자리로 돌려놓았지만, 선두는 아마 여전히 Anthropic”이라는 것입니다.
국내 반응도 비슷한 결입니다. 클리앙에서는 경쟁이 소비자에게 좋다는 반응과 함께 부풀린 벤치마크에 대한 불신, 실제 결과물 품질은 Opus 5.5 가 여전히 기준이라는 의견, 그리고 이전 발표에 실망했던 유료 사용자들의 “또 속아야 하나”라는 반응이 이어졌습니다.
직접 시험해 본다면
API 가 열리면 표 하나보다 일주일의 자체 시험이 더 많은 걸 알려 줍니다. 일주일 안에 끝나는 계획입니다.
- 우리 작업으로 시험하세요. 결과가 확실한 실제 티켓 30에서 50개를 백로그에서 골라 씁니다. 공개 벤치마크는 모든 연구소가 맞춰 튜닝하는 대상이라, 우리 코드베이스가 더 정직한 시험대입니다.
- 추론 강도를 고정하고 토큰을 기록하세요. High 와 Medium 을 따로 돌리고, 작업마다 입력·캐시·출력 토큰을 성공 여부와 나란히 남깁니다.
- 4달러·20달러로 계산하세요. 출시 기념가는 끝납니다.
- 프런트엔드 작업은 따로 보세요. 블룸버그 취재원과 WebDev Arena 순위가 함께 가리키는 곳입니다. 렌더링된 화면을 나란히 놓고 비교하세요.
- “모르겠다”는 답을 따로 세세요. 검색 기반 응답이나 고객 지원 흐름이라면 기권과 오답을 구분해 집계합니다. 정확도 50%에 환각률 15%인 모델과 정확도 63%에 환각률 51%인 모델은 그 위에 서비스를 올렸을 때 전혀 다르게 움직입니다.
- 긴 입력을 넣어 보세요. GraphWalks 25만 6천에서 100만 토큰 구간은 Argon 이 가장 크게 앞선 항목 중 하나입니다. 우리 문서나 저장소로 다시 확인해 보세요.
- 우리 하네스에서 시험하세요. 구글의 DeepSWE 결과는 mini-SWE-agent 로 낸 것입니다. Claude Code, Codex, 직접 만든 에이전트 루프에서는 결과가 크게 달라질 수 있으니, 도구 호출 실패와 프롬프트 인젝션 사례도 넣어 두세요.
- 이어 받기부터 만들어 두세요. 긴 출력을 쓸 계획이면, 몇 시간짜리 생성을 클라이언트가 버티는지부터 확인하세요.
아직 모르는 것
- 유료 API 고객과 Ultra 구독자가 언제, 어느 지역에서 쓸 수 있는지
- 모델 ID, 입력 컨텍스트 윈도, 학습 데이터 기준일, 레이트 리밋
- 출시 기념가가 끝나는 날
- Argon 의 모델 카드와 Frontier Safety Framework 보고서
- AA 의 설명 말고 Long Decode Continuation 이 실제로 어떻게 동작하는지
- Argon 이 공식 지원하는 추론 강도
참고 자료
- Google, Gemini 4 Argon: our next era of frontier intelligence (2026년 9월 30일), 한국어판
- Google DeepMind, Gemini 4 Argon 평가 방법과 결과 (PDF, 9월 30일)
- Google DeepMind, Fairwind Program, Gemini 사이버 방어 페이지
- Google, Fairwind 프로그램 출범 글 (9월 2일)
- Google AI for Developers, Gemini 모델 목록, 가격
- Artificial Analysis, Gemini 4 Argon 평가 결과 (9월 30일), AA-Omniscience 방법론
- Vals AI: Vals Index, Finance Agent v2, Harvey 법률 에이전트 벤치마크, Vibe Code Bench
- Zapier, AutomationBench 순위표
- Collinear, CWE-bench v1
- Datacurve, DeepSWE 순위표
- Arena(X), 출시 순위, Agent Arena (9월 30일); Arena, WebDev 순위표
- Proximal, FrontierSWE 순위표; Mercor, APEX-Agents 순위표; Andon Labs, Vending-Bench 2, Argon 행동 관찰
- Bloomberg(야후 파이낸스 게재), Google grapples with employee skepticism about new Gemini model (9월 30일)
- Hacker News, Gemini 4 Argon 출시 스레드
- Reddit, r/singularity 환각률 토론, r/ClaudeAI 출시 스레드
- Zvi Mowshowitz, AI #188: Gemini Dot Argon (10월 1일)
- 긱뉴스, Gemini 4 Argon 발표 토론 (10월 1일)
- Reuters(KELO 게재), Google announces Gemini 4 flagship AI model after months of delays (9월 30일)
- The Decoder, Gemini 4 Argon 분석 (9월 30일)
- SecurityWeek, 검증된 방어자에게 가드레일 없이 제공되는 Gemini 4 Argon (10월 1일)
- Engadget, 시험 환경을 벗어난 Gemini 모델 (9월 19일)


