구글, ‘제미나이 4 아르곤’ 공개…보안 전문가에 먼저 푼다
아이티데일리 (IT DAILY) ·
✦ AI 요약
구글이 차세대 AI 모델 '제미나이 4 아르곤(Gemini 4 Argon)'을 공개했다.
이 모델은 최대 출력량을 6만4000토큰에서 100만 토큰으로 늘리고, 소프트웨어 엔지니어링과 법률·금융 등 기업 지식업무, 사이버 보안에 초점을 맞췄다.
일반 이용자 공개는 보류됐고, 먼저 사이버 보안 전문가와 제한된 이용자층에 제공한 뒤 접근 범위를 확대할 예정이다.
구글이 차세대 AI 모델 '제미나이 4 아르곤(Gemini 4 Argon)'을 공개했다. 발표 시점 기준 1일 구글 발표 내용에 따르면, 이 모델은 복잡한 작업의 여러 단계를 장시간 수행하도록 설계됐다. 이를 위해 최대 출력량을 6만4000토큰에서 100만 토큰으로 확대했으며, 출력 한도 증가 폭은 기존 대비 15배 이상이다. 장시간 추론 지속도 지원한다.
구글은 '제미나이 4 아르곤'이 소프트웨어 엔지니어링, 법률·금융 등 기업 지식업무, 사이버 보안에 초점을 맞췄다고 밝혔다. 활용 예시로는 대규모 코드 작업 처리와 여러 단계의 복잡한 문제를 하나의 실행 경로에서 처리하는 경우를 제시했다. 구글은 아르곤이 대규모 코드 작업과 다단계 복잡 문제를 단일 실행 경로에서 처리하는 데 활용 가능하다고 설명했다.
다만 일반 이용자에 대한 즉시 공개는 보류됐다. 대신 사이버 보안 전문가에게 우선 제공한다. 구글은 실제 환경에서 검증한 뒤 접근 범위를 확대할 방침이다.
한편 '제미나이 4 아르곤' 사진의 출처는 구글코리아다.
구글은 아르곤을 내부 운영과 개발에 실제로 적용하고 있다. 구글 내부의 아르곤 사용 사례로는 여러 아르곤 에이전트의 데이터센터 서버군 프로파일링 데이터 분석이 제시됐다.
구글은 이 분석을 바탕으로 메모리 최적화 방안을 도출·적용했다고 밝혔다. 그 결과로 300TiB 이상의 메모리를 확보했다고 발표했다.
구글은 또 C·C++ 코드베이스의 Rust 전환 작업에도 아르곤을 투입했다. 적용 대상에는 수만 줄 규모 라이브러리와 80만 줄이 넘는 퓨시아(Fuchsia) OS의 지르콘(Zircon) 커널이 포함됐다. 제미나이 4 아르곤 벤치마크 사진은 구글코리아가 제공했다.
구글의 아르곤 중점 강화 분야는 사이버 보안이다. 구글은 아르곤이 소프트웨어 취약점을 자율 탐지·검증·패치할 수 있도록 학습시켰다고 설명했다. 아르곤은 취약점 해결 능력 평가인 'CWE-bench v1'에서 68%를 기록하며 공동 1위를 차지했다.
구글은 '페어윈드 프로그램(Fairwind Program)'을 통해 신뢰 가능한 사이버 보안 전문가에게 아르곤을 우선 제공한다. 구글은 외부 사이버 방어 전문가와 구글 내부 보안팀에 사이버 가드레일 미적용 버전을 제공할 예정이다. 목적은 취약점 탐색·검증 등 방어 작업에서 모델의 사이버 역량을 비제한하는 데 있다.
구글은 광범위한 공개 전에 안전장치를 추가 검증하고 있다. 이 모델은 사이버 공격 및 화학·생물학·방사능·핵(CBRN) 공격에 쓰일 수 있는 유해 요청을 거부하도록 설계됐다. 또 내부·외부 레드팀이 안전장치 우회 가능성을 시험하고 있으며, 구글은 간접 프롬프트 인젝션(prompt injection) 공격에 대한 방어도 강화하고 있다. 간접 프롬프트 인젝션(prompt injection)은 외부 문서 등에 숨겨진 명령으로 AI 행동 변경을 시도하는 방식이다.
이와 함께 이 모델은 이용자 의도와 허용 범위를 이탈한 작업 시도를 감시하며, 필요 시 실행 중단 조치를 적용한다. 구글은 이러한 과정을 진행하면서 미국 정부의 자발적 사전 출시 모델 접근 절차에도 참여하고 있다.
아르곤은 구글 딥마인드가 공개한 평가 대상이다. 아르곤은 장기 소프트웨어 엔지니어링 작업 평가인 'DeepSWE v1.1'에서 77.9%를 기록했고, 기업 업무 자동화 평가인 'AutomationBench'에서는 51.3%를 기록했다. 장시간 영상 이해 평가인 'LVBench'에서는 91.7%를 기록했다.
'LVBench'에서는 비교 대상 모델 중 최고 점수를 기록했다. 금융·법률 등 전문 업무 평가에서도 일부 우위를 보였다. 금융·코딩·법률·세무 업무 평가인 'Vals Index'에서는 68.9%를 기록했고, 'Vals Index'에서 클로드 오푸스 5.5의 67.0%와 GPT-6 아스트라의 63.1%를 상회했다.
별도 평가에서는 금융 리서치 별도 벤치마크에서 65.4%를 기록했고, 법률 업무 별도 벤치마크에서는 19.6%를 기록했다. 이처럼 아르곤은 전문 업무 평가 일부에서 비교 모델보다 높은 점수를 나타냈다.
다만 다른 코딩 관련 벤치마크에서는 경쟁 모델에 뒤진 항목도 있었다. 장기 소프트웨어 엔지니어링 평가인 'FrontierSWE v2'에서는 55.0%를 기록해 GPT-6 아스트라의 65.5%를 하회했다. 에이전트 코딩 평가인 'Terminal-bench 4.0'에서는 57.4%를 기록해 클로드 오푸스 5.5의 66.4%를 하회했으며, 코딩 벤치마크 일부에서 경쟁 모델 열세를 보였다.
구글은 먼저 제한된 이용자층에 제공하면서 초기 이용자 피드백 반영을 통한 안전장치 보완에 나설 계획이다. 접근 권한도 단계적으로 확대할 예정이며, 제공 시작 대상은 유료 응용프로그램 인터페이스(API) 이용자와 구글 AI 울트라(Google AI Ultra) 구독자다.
이후 제공 대상은 개발자, 기업, 일반 이용자 순이다. 구글은 함께 출시 기념 가격도 제시했으며, 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러로 책정했다. 캐시된 입력 토큰에는 입력 토큰 가격 대비 95% 할인이 적용된다.
출처: 아이티데일리 (IT DAILY) · 김병주 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=241960
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 아이티데일리 (IT DAILY)
원문 확인이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.