AI UPDATE·5 min read

Google, 긴 작업을 끝까지 수행하는 프론티어 AI 모델 Gemini 4 Argon 공개

Google이 코딩·전문 지식 업무·사이버 방어처럼 복잡하고 긴 작업을 지속적으로 수행하도록 설계한 Gemini 4 Argon을 공개했다. 최대 출력 한도를 기존 64K에서 100만 토큰으로 확장했으며, 현재는 신뢰할 수 있는 사이버 방어자에게 먼저 제한적으로 제공하고 있다.

Google Gemini 4 Argon이 코딩, 전문 지식 업무, 사이버 방어 등 긴 작업을 하나의 연속된 흐름으로 수행하고 최대 100만 출력 토큰을 지원하는 변화를 표현한 이미지
Gemini 4 Argon은 복잡한 장기 작업을 지속적으로 수행하도록 설계된 Google의 새로운 프론티어 모델이다. 대표 이미지: DECHIVE 제작 · 내용 출처: Google

UPDATE DETAIL

무엇이 발표됐는가

Google은 2026년 9월 30일 새로운 프론티어 모델 Gemini 4 Argon을 발표했다.

Argon은 실제 소프트웨어 엔지니어링, 금융·법률 같은 전문 지식 업무, 사이버 보안 방어처럼 복잡하고 장시간 이어지는 작업에서 깊은 추론을 지속하도록 설계됐다.

이번 발표의 초점은 개별 질문의 정확도만 높이는 것이 아니다. Google은 여러 단계가 이어지는 장기 작업을 처음부터 끝까지 수행하는 모델의 능력을 강조했다.

최대 100만 출력 토큰

Google은 Argon의 최대 출력 토큰 한도를 기존 64K에서 1M, 즉 100만 토큰으로 확대했다. 하나의 작업 흐름에서 더 오래 추론하고 수십만 토큰 규모의 결과를 생성할 수 있도록 한 변화다.

1M은 컨텍스트 윈도우가 아니라 최대 출력 토큰 한도다.

따라서 Gemini 4 Argon을 “100만 토큰 컨텍스트 모델”이라고 설명하면 이번 발표를 잘못 전달하게 된다.

코딩

Google은 Argon을 내부 개발 업무에도 사용하고 있다. 공개 사례에는 대규모 C/C++ 코드베이스를 Rust로 마이그레이션하는 작업이 포함된다.

작업 규모는 re2와 libgav1 같은 핵심 라이브러리의 수만 줄에서 Fuchsia Zircon 커널의 80만 줄 이상까지 확장됐다. 다만 이러한 대규모 변경은 자동·수동 감사, 에뮬레이션 테스트와 리뷰를 거친 뒤에야 프로덕션에 적용된다.

전문 지식 업무

Argon은 코딩 외에도 금융·법률·세무처럼 여러 단계의 판단이 필요한 업무를 대상으로 한다. 문서 하나를 읽고 질문 하나에 답하는 수준보다, 여러 자료를 분석하고 후속 행동까지 이어가는 장기 워크플로가 주요 사용 영역이다.

Google 자체 평가에서 Argon은 금융·법률·업무 자동화와 장기 소프트웨어 엔지니어링 벤치마크에서 높은 성능을 보였다. 다만 벤치마크 결과가 모든 실제 환경의 성능을 보장하는 것은 아니다.

사이버 방어

Google은 Argon이 중요한 소프트웨어 취약점을 스스로 찾아내고, 검증하고, 패치할 수 있도록 훈련했다고 설명한다.

강력한 사이버 능력은 방어와 오용 가능성을 함께 가진다. Google은 초기에는 Fairwind Program을 통해 선정된 신뢰할 수 있는 사이버 방어자와 내부 팀에 더 폭넓은 사이버 방어 능력을 제공하고 있다.

Google은 유해한 사이버·CBRN 요청을 거부하는 안전장치, 간접 프롬프트 인젝션 방어, 모델의 추론과 행동을 감시해 필요할 때 실행을 멈추는 완화 조치, 고위험 훈련·평가 환경의 격리 강화를 함께 발표했다.

이용 대상과 지원 환경

현재 Gemini 4 Argon은 일반 Gemini 모델처럼 누구나 바로 사용할 수 있는 상태가 아니다.

Google은 Fairwind Program을 통해 초기 사이버 방어자와 신뢰된 테스트 참여자에게 먼저 제공하고 있다. 이들의 실제 환경 평가와 피드백으로 안전장치를 보완한 뒤 개발자·기업·소비자에게 접근 범위를 넓힐 계획이다.

광범위한 출시가 시작되면 유료 API 고객과 Google AI Ultra 가입자가 초기 대상이 될 예정이다.

출시 상태

  • 공식 발표: 완료
  • 신뢰된 사이버 방어자 대상 초기 제공: 진행 중
  • 일반 개발자·기업·소비자 대상 광범위 출시: 아직 시작되지 않음

Google은 미국 정부의 자발적인 출시 전 모델 접근 절차에도 참여하면서 실제 테스트와 안전장치 개선에 맞춰 단계적으로 범위를 확대할 계획이라고 밝혔다.

가격

Google이 발표한 도입 가격은 100만 입력 토큰당 2달러, 100만 출력 토큰당 10달러다. 캐시된 입력 토큰에는 입력 가격 대비 95% 할인이 적용된다.

이 가격은 영구 가격이 아니다. 도입 기간이 끝나면 100만 입력 토큰당 4달러, 출력 토큰당 20달러가 적용될 예정이다. 따라서 Argon을 단순히 “$2/$10 모델”이라고만 기록하면 향후 잘못된 정보가 될 수 있다.

WHAT CHANGED

무엇이 바뀌는가

기존 방식

LLM 작업은 비교적 짧은 단위로 나뉘는 경우가 많았다. 사람이 질문하고 AI가 답하면 사람이 결과를 확인한 뒤 다음 프롬프트를 입력했으며, 복잡한 작업에서는 이 과정을 계속 반복했다.

변경된 방식

Argon이 지향하는 단위는 더 길다. “목표 → 조사 → 추론 → 코드·문서 작업 → 검증 → 수정 → 결과”의 흐름을 하나의 장기 작업으로 이어가는 것이다.

100만 출력 토큰이라는 큰 출력 한도도 이러한 장기 작업을 위한 기술적 변화 중 하나다.

실제 영향

중요한 변화는 AI가 단순히 더 길게 말할 수 있다는 것이 아니라, AI에게 맡길 수 있는 작업 단위 자체가 커지고 있다는 점이다.

작업 단위가 커질수록 검증 문제도 커진다. 여러 단계 중 앞부분의 판단이 틀린 채 마지막까지 진행되면 최종 결과만으로는 오류의 시작점을 찾기 어려울 수 있다.

AI가 더 오래 일할 수 있게 될수록, 우리는 최종 답뿐 아니라 그 과정까지 검증해야 한다.

WHAT WE CAN DO

이 변화로 무엇을 할 수 있는가

대규모 코드 작업

단순 함수 생성보다 코드베이스 분석, 리팩터링, 마이그레이션과 테스트처럼 긴 개발 작업에 적합하다.

  • AI가 만든 변경을 자동 테스트와 코드 리뷰 없이 바로 배포하지 않는다.

전문 리서치

여러 문서와 데이터를 분석해 장문의 결과물을 만드는 금융·법률·기업 리서치에 활용할 수 있다.

  • 긴 결과가 곧 정확한 결과라는 뜻은 아니므로 근거와 출처를 별도로 검증한다.

사이버 보안

취약점 발견에서 검증과 수정 제안까지 이어지는 방어 작업에 활용할 수 있다. 초기 접근이 신뢰된 사이버 방어자로 제한된 것은 이 능력의 양면성을 고려한 조치다.

장기 AI 에이전트

Argon과 같은 모델은 오랫동안 작동하는 에이전트의 기반 모델로도 의미가 있다. 작업 시간이 길어질수록 사용자는 결과뿐 아니라 어떤 판단과 행동을 거쳐 결과에 도달했는지를 확인해야 한다.

← AI Update 목록