AI

구글, 제미나이 3.8 플래시 공개…3주 만에 또 성능 끌어올려

아이티데일리 (IT DAILY) ·

구글은 2일 인공지능(AI) 모델 ‘제미나이 3.8 플래시’와 보안 특화 모델 ‘제미나이 3.8 플래시 사이버’를 공개했다. (사진: 구글)

✦ AI 요약

구글은 2일 AI 모델 '제미나이 3.8 플래시'와 사이버 보안 특화 모델 '제미나이 3.8 플래시 사이버'를 공개했다.

'제미나이 3.8 플래시'는 3.7 플래시와 토큰당 가격이 같지만 복잡한 작업에 더 많은 토큰을 쓰도록 설계돼 추론·코딩·에이전트 성능이 강화됐다.

'제미나이 3.8 플래시 사이버'는 취약점 탐지·패치 생성에 맞췄고, 일반 이용자 공개 대신 '페어윈드 프로그램'으로 우선 제공된다.

구글은 2일 AI 모델 '제미나이 3.8 플래시'를 공개했다. 구글은 같은 날 사이버 보안 특화 모델 '제미나이 3.8 플래시 사이버'도 함께 공개했다. 이번 발표는 플래시 제품군의 비용 효율 강조 기조를 유지하면서도 성능 강화 비중을 확대한 데 초점이 맞춰졌다.

'제미나이 3.8 플래시'는 이전 모델과 토큰당 가격이 동일한 가운데, 복잡한 작업을 대상으로 더 많은 토큰을 사용하도록 설계됐다. 이를 바탕으로 추론·코딩·에이전트 성능이 강화됐다. 플래시 제품군이 비용 효율을 강조해 온 흐름을 유지하면서, 같은 가격 조건 아래 성능을 높이는 방향이 반영됐다.

성능 비교 기준은 전작 '3.7 플래시'다. '제미나이 3.8 플래시'는 전작 '3.7 플래시' 대비 소프트웨어 엔지니어링 성능이 향상됐고, 에이전트 작업 성능도 향상됐다. 다단계 추론 성능 역시 전작 '3.7 플래시'보다 향상됐다. 기사 제목 기준으로 구글의 성능 상향 공개 시점 간격은 3주다.

3.8 플래시는 복잡한 작업 시 추가 추론 수행, 도구 반복 호출을 위해 설계됐다. 높은 추론 수준 특성상 성능 향상 목적의 토큰 사용량 확대가 가능하다. 개발자는 작업별로 추론 수준을 하향할 수 있고, 기존 3.7 플래시를 활용해 토큰 사용량을 조절할 수도 있다.

출시 기념 가격은 100만 입력 토큰당 0.75달러, 출력 토큰당 3.75달러다. 3.8 플래시의 가격 책정은 3.7 플래시와 동일하지만, 동일 토큰 단가가 실제 작업 비용의 동일성을 뜻하지는 않는다. 아티피셜 애널리시스 평가는 높은 추론 수준 3.8 플래시의 작업당 비용을 0.58달러, 3.7 플래시의 작업당 비용을 0.40달러로 봤다. 이에 따라 높은 추론 수준 3.8 플래시는 3.7 플래시 대비 약 40% 높았다. 이는 평균 출력 토큰 사용량 약 30% 증가와 에이전트 평가 과정의 작업 단계 증가의 영향이다.

아티피셜 애널리시스에 따르면 높은 추론 수준 3.8 플래시는 3.7 플래시보다 작업당 비용이 높고, 성능 점수도 더 높다. 성능 개선이 나타났고, 아티피셜 애널리시스 인텔리전스 인덱스에서 높은 추론 수준 3.8 플래시는 59점을 기록했다. 이는 3.7 플래시 대비 3점 우위다. 7월 공개 3.6 플래시는 당시 같은 평가에서 50점을 받았고, 비교 결과 플래시 제품군 성능의 빠른 향상이 확인됐다.

구글은 자체 평가 기준에서 '제미나이 3.8 플래시'가 여러 벤치마크에서 3.7 플래시보다 높은 성능을 보였다고 제시했다. 장시간 소프트웨어 엔지니어링 성능은 'DeepSWE v1.1'에서 3.7 플래시를 상회했고, 금융·법률 분야 에이전트 벤치마크 성능도 3.7 플래시를 상회했다.

구글은 이와 함께 '제미나이 3.8 플래시'의 HLE-Verified 점수가 54.9%라고 공개했다. HLE-Verified는 전문지식·추론 능력을 평가하는 대상이다.

이어 구글은 같은 기반 모델의 사이버 보안 특화 버전인 '제미나이 3.8 플래시 사이버'를 공개했다. 이 모델의 초점은 취약점 탐지·패치 생성 등 방어 업무에 맞춰졌다.

다만 '제미나이 3.8 플래시 사이버'는 일반 이용자에게 즉시 공개하는 대상에서는 제외됐다. 대신 우선 제공 경로로 새 프로그램인 '페어윈드 프로그램'이 마련됐다.

'페어윈드 프로그램'의 우선 제공 대상은 신뢰할 수 있는 정부기관·주요 인프라 운영기관·소프트웨어 유지관리 담당자다. 이 제공 방식은 일반 모델 대비 사이버 보안 분야 안전 제한 완화와 이용 대상 제한을 병행하는 특징이 있다.

구글의 3.8 플래시 사이버는 외부 패치 생성 벤치마크 'CWE-Bench' 평가에서 pass@1 47.2%를 기록했다. 이는 평가 대상 최고 모델 pass@1 47.8%와 비교되는 수치다. 또 성능 수치 기준은 구글 내부 평가·적용 사례이며, 구글 자체 평가 대상 20개 프로그래밍 언어 코드베이스에서 취약점 탐지 성공률 70% 초과를 보였다.

이와 함께 구글은 해당 모델을 내부 보안 업무에 적용했다고 밝혔다. 크롬 보안팀은 취약점 패치 테스트를 진행했고, 기존 대형 상용 모델 대비 정확한 패치 코드 생성량 2.6배라는 결과가 제시됐다. 구글 클라우드 취약점 연구팀 활용 사례도 공개됐으며, 구글 클라우드 취약점 연구팀 발표에 따르면 모델 활용으로 핵심 기반 기술의 중대한 취약점을 2시간 이내 발견했다.

다만 플래시 성능 향상에도 최상위 모델과의 격차 지속이라는 점도 함께 제시됐다. 외부 벤치마크 'CWE-Bench' 평가에서 3.8 플래시 사이버가 pass@1 47.2%를 기록했지만, 평가 대상 최고 모델 pass@1 47.8%에는 미치지 못하는 상태다.

한편 구글은 플래시 제품군 출시 주기 대폭 단축 흐름도 이어갔다. 7월 3.6 플래시 출시 이후 8월 3.7 플래시 출시, 9월 3.8 플래시 출시로 후속 모델을 연이어 내놨다. 특히 3.8 플래시는 3.7 플래시 공개 3주 후 후속 모델 출시 사례로 제시됐다.

제미나이 3.8 플래시는 독립 평가에서 이전 플래시 모델 대비 고득점을 기록했고 성능도 향상됐다. 다만 높은 추론 수준에서는 토큰 사용량이 증가하고 작업당 비용도 늘어난다. 이에 구글은 비용 효율 중시 작업에 추론 수준 하향 선택지를 제공하고, 비용 효율 중시 작업에 3.7 플래시를 지속 사용 가능하게 했다.

한편 플래시 제품군은 빠른 고도화를 진행하고 있지만 최상위 '프로' 제품군 공백은 지속되고 있다. 이번 발표에는 새로운 프로 모델이 미포함됐고, 최상위 모델 경쟁 대응용 프로 제품군 출시 시점 미확인 상태도 이어졌다. 구글은 7월 차기 프로 모델을 파트너 시험 중이라고 밝혔으며, 준비 완료 후 차기 프로 모델을 출시한다는 방침도 언급했다.

제미나이 3.8 플래시는 구글 AI 스튜디오, 안드로이드 스튜디오, 제미나이 API, 제미나이 엔터프라이즈에서 이용 가능하다. 구글 AI 프로·울트라 구독자는 제미나이 앱, 구글 검색 AI 모드, 구글 스프레드시트에서도 사용할 수 있다. 출시 기념 가격은 12월 31일까지 적용되며, 2027년 1월부터 입력 가격은 100만 토큰당 1.50달러, 출력 가격은 100만 토큰당 7.50달러다.

출처: 아이티데일리 (IT DAILY) · 김병주 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=241377

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 아이티데일리 (IT DAILY)

원문 확인

이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.