프런티어 AI 신모델 잇단 출격…성능·비용·에이전트 경쟁 본격화
테크월드뉴스 ·
✦ AI 요약
글로벌 AI 기업들의 신모델 경쟁 축이 벤치마크 고득점보다 비용과 실제 업무 수행 능력으로 옮겨가고 있다.
메타는 '뮤즈'를 출시해 이메일 발송, 여행 예약, 상품 구매 같은 실제 업무를 수행하게 했지만 아마존과의 충돌도 발생했다.
스페이스XAI, 앤트로픽, 오픈AI는 각각 '그록 4.7', '클로드 오퍼스 5.5', 'GPT-6 솔'·'GPT-6 루나'를 공개하며 장시간 코딩·전문 업무와 비용 효율을 강조했다.
글로벌 AI 기업의 신모델 경쟁 축이 성능 중심에서 비용·실제 업무 수행 능력 중심으로 이동하고 있다. 프런티어 AI 시장 경쟁이 재가열되는 가운데 경쟁 방향도 벤치마크 고득점 중심에서 탈피해 코딩·전문 업무를 장시간 수행하고 총작업비를 절감하는 쪽으로 바뀌고 있다.
주요 AI 기업들은 사흘 연속 신모델을 발표했다. 스페이스XAI는 지난 21일(현지시간) '그록 4.7'을 공개했고, 앤트로픽은 22일 '클로드 오퍼스 5.5'를 출시했다. 오픈AI는 같은 날 'GPT-6 솔'·'GPT-6 루나'를 추가하며 GPT-6 제품군을 확대했다.
최근 공개된 모델들의 공통점은 단발성 질의응답보다 다단계 실제 업무 수행에 초점을 맞춘다는 점이다. 에이전트의 업무 범위는 코드 수정, 외부 도구 호출, 컴퓨터 조작으로 넓어지고 있고, 에이전트의 작업 시간도 장기화되고 있다. 이에 따라 비용 효율의 결정 요소도 토큰 단가뿐 아니라 작업 단계, 캐시 활용, 처리 속도를 포함하는 방향으로 확대되고 있다.
메타는 8일 개인 AI 에이전트 '뮤즈(Muse)'를 출시했다. '뮤즈'는 단순한 질의응답에 그치지 않고 외부 서비스에서 사용자를 대신해 실제 업무를 수행하도록 설계됐다. 수행 업무 사례로는 이메일 발송, 여행 예약, 상품 구매가 제시됐다.
메타는 이를 위해 '뮤즈'를 '뮤즈 스파크(Muse Spark)' 기반으로 구축했다. 또 '뮤즈'는 전용 가상환경인 '뮤즈 시큐어 VM(Muse Secure VM)'에서 작동한다. 이용자는 연결할 애플리케이션을 설정할 수 있고, 접근 범위도 설정할 수 있다.
메타는 이메일 발송·구매 등 민감 행동에 대해서는 실행 전에 승인 절차를 거치도록 했다. 다만 실서비스 연동 과정에서는 플랫폼 사업자와의 충돌이 발생했다.
아마존은 사전 승인 없는 자사 쇼핑몰 접근을 이유로 '뮤즈'의 상품 검색·구매 기능을 차단했다. 아마존 측은 이 과정에서 '뮤즈'가 AI 에이전트인지 식별이 미흡할 가능성이 있다고 문제를 제기했다. 또 사이트 접근 상태에서 계정 데이터를 처리할 가능성도 우려 사항으로 제시했다.
에이전트 경쟁력은 모델 자체 추론 성능만으로는 결정되지 않는다. 실제 업무 수행 조건에서는 외부 서비스의 에이전트 접근 허용 문제가 있고, 이용자 권한 위임 방식도 해결이 필요하다.
이런 맥락에서 스페이스XAI는 21일 '그록 4.7'을 공개했다. '그록 4.7'의 목표는 코딩·전문 지식 업무다. '그록 4.7'은 '그록 4.6'보다 더 큰 기반 모델을 사용했다.
학습 방식에서는 여러 시간이 걸리는 고난도 작업의 비중을 확대한 강화학습을 기반으로 했다. 이를 통해 '그록 4.7'은 긴 작업 과정의 문맥 유지 능력을 강화했고, 자기 결과 재확인 능력도 강화했다. 스페이스XAI는 대화·일반 지식 업무에서도 '그록 봇(Grok Bot)' 실행 환경을 모델이 직접 이해하도록 학습시켰다.
성능 평가는 장시간 코딩 성능 평가 지표인 CursorBench 4.0과 장시간 사무 업무 평가인 AA Briefcase를 통해 제시됐다. '그록 4.7'은 CursorBench 4.0에서 46.3%를 기록했고, '그록 4.6'은 40.4%를 기록했다. 이에 따라 '그록 4.7'은 CursorBench 4.0에서 '그록 4.6' 대비 성능이 개선됐다.
AA Briefcase에서도 '그록 4.7'은 이전 모델보다 높은 성능을 보였다. 다만 세부 평가 결과에서는 경쟁 모델별 강점이 상이했다.
스페이스XAI는 개별 벤치마크 최고점보다 장시간 작업의 비용 대비 성능을 강조했다. 스페이스XAI는 장시간 작업의 비용 대비 성능을 중시한다고 밝혔다.
그록 계열 모델의 가격은 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러부터로 제시됐다. 이 가격 수준은 그록 4.6과 유사하다. 패스트 모델은 출력 속도가 2배이며, 가격은 기본 대비 2배다.
그록 4.7은 커서, 그록 빌드, 그록 API, 외부 코딩 도구, 모델 라우터, 클라우드 플랫폼에서 이용할 수 있다.
앤트로픽은 22일 '클로드 오퍼스 5.5'를 출시했다. '클로드 오퍼스 5.5'는 클로드 5.5 제품군의 첫 모델이다. 이 모델은 여러 단계 추론과 도구 활용이 필요한 복잡한 코딩, 컴퓨터 사용, 전문 지식 업무를 개선 대상으로 삼았다.
앤트로픽은 '클로드 오퍼스 5.5'가 기존 오퍼스 5 대비 성능과 효율이 개선됐다고 설명했다. 외부 평가에서도 성능 향상이 확인됐다. 아티피셜 애널리시스 종합 지능지수(AAII)에서는 최대 추론 설정 오퍼스 5.5가 58점을 기록했다. 전문 업무 평가와 에이전틱 코딩 평가에서도 기존 오퍼스 5보다 높은 성능을 보였다.
앤트로픽은 모델 간 벤치마크 점수 차이가 실제 사용 경험을 대변하는 데 한계가 있다고 강조했다. 앤트로픽은 실제 업무에서 중요한 요소로 높은 점수보다 적은 토큰과 적은 단계로 작업을 완료하는 점을 제시했다.
이런 기준에 맞춰 오퍼스 5.5의 API 가격은 입력 100만 토큰당 4달러, 출력 100만 토큰당 20달러로 책정됐다. 이는 기존 오퍼스 5 대비 입력·출력 각각 20% 인하한 수준이다. 캐시 읽기 가격은 100만 토큰당 0.20달러로 60% 인하했다. 캐시 읽기 가격은 장시간 에이전틱·코딩 업무에 다용도로 쓰인다.
앤트로픽은 기본 설정의 일반적 워크로드에서 토큰 사용량 감소를 반영하면 전체 작업 비용이 기존 오퍼스 5 대비 약 40% 절감된다고 발표했다. 출력 속도도 30% 이상 빨라졌다.
앤트로픽은 장시간 업무 대응을 위한 안전장치도 강화했다. 오퍼스 5.5는 이전 모델 대비 되돌리기 어려운 행동이 감소했고, 주어진 범위를 이탈하는 행동도 감소했다. 프롬프트 인젝션 방어 성능도 향상됐다.
앤트로픽은 수주 내 Sonnet 5.5·Haiku 5.5를 공개할 예정이다. 앤트로픽의 계획은 Opus에서의 성능·비용 효율 개선을 Claude 전체 제품군으로 확대하는 데 있다.
같은 날 오픈AI는 GPT-6 Sol·GPT-6 Luna를 출시했다. 앞서 GPT-6 Astra의 공개 시점은 이달 초였다.
오픈AI는 업무 난도·속도·예산별로 모델을 선택할 수 있도록 GPT-6 제품군을 세분화했다. GPT-6 Sol·Luna는 Astra와 유사한 방식으로 학습됐다.
GPT-6 Sol·Luna의 개발 초점은 Astra의 전문 업무·사실 정확성·코딩·컴퓨터 사용·정렬 성능을 더 빠르고 저비용 모델로 확장하는 데 맞춰졌다. 기업 업무용 포지셔닝에서는 비용 대비 성능이 강조됐다.
기업 업무 평가에서는 AutomationBench 수치 비교가 제시됐다. AutomationBench는 영업·마케팅·운영·고객지원·재무·인사 등에서 47개 도구를 활용하는 업무를 수행하는 특성을 지닌다. GPT-6 Sol은 AutomationBench xhigh 추론 수준에서 33.2%를 기록했고, 비교 대상인 GPT-6 Astra low 설정은 30.3%였다. 비교 결과 GPT-6 Sol의 수치가 GPT-6 Astra low 설정보다 높았다.
GPT-6 솔은 장시간 전문 업무 수행 능력 평가 사례인 '에이전트의 마지막 시험(Agents' Last Exam, ALE)'에서 max 추론 수준 56.4%의 성과를 냈다. ALE는 55개 세부 산업을 평가 대상으로 삼아 컴퓨터 기반 전문 업무의 장시간 수행 능력을 평가한다.
코딩·컴퓨터 사용 부문에서는 이전 세대 대비 비용 효율 향상이 나타났다. 실제 코드베이스를 기준으로 장시간 소프트웨어 개발 능력을 측정하는 딥SWE(DeepSWE) v1.1과 컴퓨터 조작 능력을 평가하는 OS월드(OSWorld) 2.0에서, 오픈AI는 GPT-6 솔이 경쟁 프런티어 모델과 유사한 성능을 보이면서도 작업당 비용을 절감했다고 설명했다.
사실 정확성도 개선됐다. 이 평가는 이용자들이 과거 모델의 사실 오류를 지적한 비식별 챗GPT 대화를 기반으로 이뤄졌으며, GPT-6 솔의 오류 수준은 GPT-5.6 솔 대비 약 절반으로 제시됐다.
오픈AI는 오류 발생 가능성이 높은 대화만 골라 평가한 결과라고 설명했다. 그러면서 해당 수치는 일반적 챗GPT 사용 환경의 사실 오류율을 의미하는 것은 아니라고 밝혀, 일반적인 챗GPT 사용 전체의 오류율로 받아들여선 안 된다고 선을 그었다.
이어 오픈AI는 GPT-6 솔·루나의 토큰 가격을 낮췄다. GPT-6 솔 가격은 입력 100만 토큰당 2달러, 출력 10달러이며, GPT-6 루나 가격은 입력 0.10달러, 출력 0.50달러다. GPT-6 솔·루나 가격은 각각 GPT-5.6 솔·루나 프로모션 가격 대비 50% 인하됐다.
오픈AI는 장시간 에이전트 작업 비용과 관련한 요소로 프롬프트 캐싱도 개선했다. GPT-6에서는 반복 문맥의 기본 캐시 적중률이 상승했고, 캐시된 입력 토큰 가격에는 90% 할인이 적용된다. 또한 추론 수준·사용 도구가 달라도 이전 문맥을 재사용할 수 있다.
깃허브는 최근 수개월간 관련 캐싱 개선을 적용했다고 발표했다. 적용 대상은 수십억 건의 오픈AI 모델 요청이었으며, 그 결과 새로 처리할 필요가 있는 프롬프트 토큰 비중이 50% 이상 감소했다고 전했다.
오픈AI의 GPT-6 솔·루나는 플러스·프로·비즈니스·엔터프라이즈·에듀 이용자에게 제공된다. 제공 위치는 챗GPT 워크·코덱스다. 무료·Go 이용자는 데스크톱 앱의 GPT-6 루나를 사용할 수 있다.
최근 신모델 경쟁에서는 개별 벤치마크 최고점 못지않게 실제 업무 완료 비용·시간의 중요성이 확대되고 있다. 발언 요지는 프런티어 경쟁 기준이 최고점 중심에서 작업 완료 비용 중심으로 이동하고 있다는 데 있다.
이 같은 변화는 에이전트 환경의 특성과 맞물려 있다. 에이전트 환경은 다회 도구 호출·긴 문맥 반복 읽기가 이뤄지는 특성이 있다. 이 때문에 입·출력 토큰 가격만으로는 전체 비용을 판단하기 곤란하다.
동일한 결과를 내더라도 실제 운영비용은 작업 단계 수·토큰 사용량·캐시 활용률·처리 시간에 따라 달라질 수 있다. 이에 따라 모델 평가 방식도 변화하고 있다.
모델 평가는 정답 산출 능력보다 장시간 실제 업무 수행의 평가 비중이 확대되고 있다. 장시간 작업 평가 사례로는 실제 코드베이스를 읽고 수정하는 방식과 여러 애플리케이션을 오가며 업무를 끝까지 처리하는 방식이 제시됐다.
AI 기업들은 단일 최고 성능 모델 중심 대신 업무 성격별 성능·속도·비용을 분리한 제품군을 확대하는 방향으로 움직이고 있다. 오픈AI는 GPT-6의 세분화 대상으로 아스트라·솔·루나를 두고 있다. 앤트로픽은 오퍼스 이후 소넷·하이쿠 5.5를 예고했다.
메타의 뮤즈는 모델 내부 변화의 실제 서비스 확장 사례로 제시된다. 모델은 외부 사이트 접속을 시작했고, 구매 수행을 시작했으며, 예약 수행도 시작했다. 이는 프런티어 AI 경쟁이 최고점 모델 1개 제작 중심에서 변화하고 있음을 보여준다.
이에 따라 경쟁 기준은 실제 업무 수행 능력과 적은 비용, 장시간 수행, 끝까지 완수 여부로 옮겨가고 있다. 향후 에이전트 경쟁력 판단 요소로는 추론 성능, 타 서비스와의 안정적 연결 정도, 필요한 권한 관리 방식이 제시된다.
출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=407176
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 테크월드뉴스
원문 확인이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.