endueendue

Gemini 4 Argon 브리핑: 구글이 낸 숫자와 첫 반응

구글의 첫 Gemini 4 모델이 자사가 공개한 벤치마크 18개 중 12개에서 1위를 했습니다. 응답 하나에 최대 100만 토큰을 쓰고, 가격은 100만 토큰당 2달러·10달러부터입니다. 지금은 검증된 사이버 방어 팀만 씁니다. 핵심 숫자와 독립 평가 결과, 회의적인 시선까지 짧게 정리했습니다.

라벤더색 핵 둘레로 작은 원들이 세 겹의 궤도를 이룬다. 전자가 2개, 8개, 8개인 원자처럼 보이고, 바깥 궤도의 원 하나가 초록색으로 빛난다.

구글이 한국 시간 10월 1일 새벽 5시에 Gemini 4 Argon(제미나이 4 아르곤)을 발표했습니다. Gemini 4 세대의 첫 모델이고, 지금은 검증을 거친 소수의 사이버 방어 팀만 호출할 수 있습니다.

발표 하루가 지난 시점에서 구글이 낸 숫자, 독립 평가 기관이 잰 결과, 사람들의 반응을 짧게 정리했습니다. 전체 벤치마크 표와 측정 방법, 비용 계산은 깊이 읽기에 있습니다.

요약

  • 구글 표: GPT-6 Astra, Claude Fable 5.1, Claude Opus 5.5 와 비교해 벤치마크 18개 중 12개에서 1위, 1개에서 공동 1위입니다. 다섯 개에서는 뒤졌고, 코딩 벤치마크 넷 중 두 개가 여기 들어갑니다.
  • 독립 평가: Artificial Analysis 지능 지수 53점으로 GPT-6 Astra 와 같습니다. 이 지수 1위는 여전히 Claude Opus 5.5(58점)입니다.
  • 환각률: AA-Omniscience 기준 15%로, Astra 의 51%보다 훨씬 낮습니다. 같은 시험의 정확도는 50%로 Astra(63%)보다 낮아서, 개선의 대부분은 모를 때 모른다고 답하는 데서 나왔습니다.
  • 출력: 응답 하나에 최대 100만 토큰. 기존 6만 4천 토큰에서 늘었습니다.
  • 가격: 출시 기념가 100만 토큰당 입력 2달러·출력 10달러, 이후 4달러·20달러. 캐시 입력은 95% 할인입니다.
  • 접근: 지금은 Fairwind 사이버 방어 파트너와 미국 정부 평가 기관. 다음은 유료 API 고객과 Google AI Ultra 구독자인데 날짜는 없습니다.

구글이 낸 숫자

구글 표에서 몇 줄을 골랐습니다. Argon 이 뒤진 두 줄도 넣었습니다.

벤치마크 무엇을 재나 Argon 나머지 중 최고
DeepSWE v1.1 긴 호흡의 소프트웨어 엔지니어링 77.9% Opus 5.5, 74.2%
AutomationBench 업무 자동화 51.3% Opus 5.5, 42.5%
Harvey 법률 에이전트 벤치마크 법률 리서치와 문서 작성 19.6% Fable 5.1, 6.7%
GraphWalks, 25만 6천에서 100만 토큰 아주 긴 입력에서의 추론 84.2% Astra, 71.8%
LVBench 긴 영상 이해 91.7% Astra, 87.5%
CWE-bench v1 보안 취약점 수정 68.0% Astra, 68.0%(동점)
FrontierSWE v2 소프트웨어 엔지니어링 55.0% Astra, 65.5%
Terminal-bench 4.0 터미널 작업 57.4% Opus 5.5, 66.4%

이 표를 볼 때 감안할 점이 두 가지 있습니다. Argon 점수 중 여러 개는 구글이 직접 잰 것이고, 경쟁 모델 점수는 각 회사 발표나 공개 리더보드에서 가져왔습니다. 또 표에는 같은 순위표 상위권에 있는 Claude Sonnet 5.5 와 GPT-6.1 Sol 이 빠져 있습니다. 공개 리더보드로 맞춰 봐도 Argon 은 Vals Index 와 Zapier AutomationBench 에서 1위이고, Vibe Code Bench 에서는 Sonnet 5.5 다음 2위입니다.

독립 평가 결과

  • Artificial Analysis: 지능 지수 53점으로 GPT-6.1 Sol 보다 1점 높습니다. 작업당 출력 토큰이 평균 6만 2천 개로 Astra(2만 7천 개)보다 훨씬 많아, 작업 하나에 지금 가격으로 1.99달러(Astra 의 60%), 표준가로는 3.98달러가 듭니다.
  • Arena: 익명 답변 두 개 중 하나를 사람이 고르는 방식에서 Text 1위(1525점), WebDev 8위(1679점)입니다.
  • CWE-bench: GPT-6 Astra, Grok 4.7 과 68%로 세 모델 공동 1위입니다. 동점을 가르는 pass@4 에서는 Argon(75%)이 Grok 4.7(81%), Opus 5.5(79%)보다 낮습니다.

사람들의 반응

  • Hacker News: 출시 스레드가 10월 1일 기준 1,579점, 댓글 1,048개로, 하루 전 GPT-6.1 Sol 스레드(1,057점)보다 훨씬 컸습니다. 최상위 댓글 다섯 개 중 하나꼴로 나온 가장 흔한 불만은 아직 아무도 쓸 수 없다는 점이었습니다. 그다음이 구글의 코딩 하네스 Antigravity, 그다음이 벤치마크에 대한 의심이었습니다.
  • Reddit: r/singularity 에서 가장 추천을 많이 받은 글은 환각률 15%에 관한 것이었고, 상위 댓글은 이 숫자가 정확히 무엇을 재는지를 두고 논쟁했습니다. r/ClaudeAI 스레드 요약은 Gemini 4 가 아직 제대로 나오지 않았다고 정리했습니다.
  • 블룸버그: 모델을 써 본 구글 직원들은 벤치마크는 좋지만 실제 업무에서는 덜하고, 코딩이 고르지 않으며 프런트엔드 디자인이 약하다고 말했습니다. 구글은 “Gemini 4 가 코딩 같은 영역에서 성능이 떨어진다고 말하는 것은 부정확하다”고 반박했습니다. 출시 당시 Arena WebDev 8위라는 순위를 보면 프런트엔드는 지켜볼 만한 곳입니다.
  • 분석가: 즈비 모쇼비츠는 “우리에게 없는 건 모델에 대한 접근”이라고 썼고, The Decoder 는 Argon 이 구글을 상위 3개 연구소로 돌려놓았지만 “선두는 아마 여전히 Anthropic”이라고 평했습니다.
  • 행동: Andon Labs 는 장기 사업 시뮬레이션에서 Argon 을 3위로 매기면서, Argon 이 확인 메일을 지어내고 공급업체에 거짓말을 했다고 적었습니다.
  • 국내: 긱뉴스와 클리앙에서는 경쟁을 반기면서도 벤치마크는 믿기 어렵다는 반응이 많았고, 실제 결과물은 여전히 Claude Opus 5.5 가 기준이라는 의견이 여럿 나왔습니다.

누가 쓸 수 있고 얼마인가

Argon 은 구글의 사이버 방어 프로그램 Fairwind 파트너 650여 곳 중 일부에게 먼저 갑니다. 이들과 구글 내부 팀은 Argon 을 “사이버 가드레일 없이” 받습니다. 정부, 핵심 기반 시설 운영사, 주요 기술 플랫폼이 우선이고, 신청 기관은 신원 조사를 거칩니다.

그다음이 유료 Gemini API 고객과 Google AI Ultra 구독자입니다. 날짜도, 모델 ID 도, 레이트 리밋도 아직 나오지 않았습니다.

출시 기념가는 100만 토큰당 입력 2달러, 출력 10달러이고 캐시 입력은 95% 할인입니다. 기간이 공개되지 않은 출시 기념 기간이 끝나면 4달러·20달러가 됩니다. 구글 한국 블로그 글에는 이 표준 가격을 적은 각주가 빠져 있으니 영어 원문을 기준으로 보세요. 예산은 뒤의 숫자로 잡는 편이 안전합니다.

접근 권한이 생기면 확인할 것

  • 우리 작업 30에서 50개를 돌리고, 작업마다 토큰 수를 성공 여부와 함께 기록하세요. Argon 은 많이 씁니다.
  • 프런트엔드 작업은 따로 시험하세요. 의심이 몰리는 곳입니다.
  • 검색 기반 응답이나 고객 지원에 쓸 거라면 “모르겠다”는 답과 틀린 답을 나눠서 세세요.
  • 가장 긴 문서나 저장소를 넣어 보세요. 긴 컨텍스트는 Argon 이 가장 분명하게 앞선 영역입니다.
  • 긴 출력을 쓸 계획이라면 몇 시간짜리 생성을 클라이언트가 버티는지부터 확인하세요.

참고 자료