AI

AI 난제 해결, 속도보다 검증 필요…수학계 “벤치마크 경쟁 경계”

테크월드뉴스 ·

AI 에이전트가 수학 난제 해결에 나서고 인간 연구자가 이를 검증하는 과정을 형상화한 이미지. [사진=챗GPT]

✦ AI 요약

AI 기업들은 수학 난제 해결 사례를 모델 성능 경쟁 지표로 활용하고, 학계는 검증과 지식 축적을 더 중시하며 경계하고 있다.

오픈AI는 8일 다중 AI 에이전트 시스템으로 나비에-스토크스 방정식 해법을 제시했다고 발표했고, 약 1만개의 AI 에이전트와 88시간, 17시간, 메시지 270만건, 출력 토큰 약 1300억개가 사용됐다고 밝혔다.

허준이, 테런스 타오, 페터 숄체 등 필즈상 수상자 25명은 AI의 수학 활용 가능성은 부정하지 않지만 유명 난제 해결 경쟁을 벤치마크로 삼는 방식에는 경고를 보냈고, 이후 앤트로픽과 마이크로소프트도 속도조절론과 안전·검증 원칙을 제시했다.

AI 기업들이 수학 난제 해결 사례를 모델 성능 경쟁 지표로 활용하면서, 이를 둘러싼 학계의 경계도 함께 확대되고 있다. 특히 속도보다 검증이 필요하다는 인식과 함께 벤치마크 경쟁을 경계하는 시선이 커지고 있다.

AI는 인간 수학자들이 오래 풀지 못한 문제에 해법을 제시하는 단계에 도달했지만, 실제 수학적 성과로 인정되려면 학계의 검증이 필요하다. 이 때문에 기업은 문제 해결 속도와 에이전트 규모를 기술력으로 내세우는 반면, 수학계는 검증과 지식 축적을 맡는 구조가 만들어지고 있다는 지적이 나온다.

오픈AI는 지난 8일 다중 AI 에이전트 시스템을 활용해 밀레니엄 문제 중 나비에-스토크스 방정식에 대한 해법을 제시했다고 발표했다. 오픈AI는 약 1만개의 AI 에이전트가 서로 다른 접근법을 병렬로 탐색하는 방식이라고 설명했다.

또 첫 에이전트를 투입한 뒤 해법에 도달하기까지 걸린 시간은 약 88시간이라고 밝혔다.

GPT-6 아스트라를 활용해 린(Lean) 기반 형식화·검증을 추가하는 데에는 17시간이 들었다. 문제 해결 과정에서는 에이전트 간 메시지 270만건이 오갔고, 출력 토큰은 약 1300억개가 사용됐다.

이런 수치들은 AI 기업이 기술력을 부각할 때 활용하는 항목으로 제시된다. 기술력 부각 수치 활용 항목에는 에이전트 수·연산량·토큰 사용량·문제 해결 시간이 포함된다. AI 기업 입장에서는 인간이 장기간 못 푼 문제의 해결 속도가 모델 추론 능력의 지표가 되며, 기업은 해법 도출 사실·처리 속도·투입 자원을 기술력 강조 수단으로 내세울 수 있다.

다만 AI가 해법을 제시했다고 해서 수학적 성과가 즉시 인정되는 것은 아니다. 특히 밀레니엄 문제는 증명 오류·숨은 가정·기존 정리와의 정합성에 대한 검토가 필요하다. 밀레니엄 문제의 성과를 인정받기 위해서는 학계의 장기간 검토가 전제되며, 실제 성과 인정까지는 별도의 검증 과정이 필요하다.

검증이 완료되기 전에도 난제 해결 사실은 AI 기업의 성능 경쟁에 활용될 수 있다. 기업은 해결 사실과 속도, 자원 투입을 앞세워 경쟁할 수 있지만, 수학적 성과 인정 절차를 담당하는 주체는 학계다.

허준이 미국 프린스턴대 교수, 테런스 타오 UCLA 교수, 페터 숄체 독일 막스플랑크 수학연구소장 등 필즈상 수상자 25명은 11일 공동성명을 발표했다. 공동성명 제목은 '수학에서 AI의 심각한 목표 불일치(A Severe Misalignment of AI in Mathematics)'였다.

공동성명에 참여한 수학자들은 AI의 수학 능력 자체를 부정하지는 않는다는 취지를 밝혔다. 공동성명은 AI의 수학 활용 가능성을 부인하기보다 난제 해결을 둘러싼 평가 기준의 차이에 주목했다.

이들은 AI 기업이 유명 난제 해결 경쟁을 모델 성능 벤치마크로 삼는 방식에 경고를 보냈다. 성명은 AI 기업과 수학계의 난제 해결 목표에 차이가 있다고 지적했다.

기업 관점에서는 문제 해결 속도와 모델 성능 척도 활용이 중요하게 다뤄진다. 반면 수학계 관점에서는 새로운 개념·구조 이해와 지식 축적 과정을 더 중시한다.

성명은 문제 풀이의 위치를 개념적 이해·통찰 달성을 위한 도구·대리 수단으로 규정했다. 또 성명은 AI의 답 생성과 새 개념·연구 방법 축적은 별개라고 설명했다.

12일에는 수학계 경고 다음 날, AI 업계에서도 속도조절론이 제기됐다. 다리오 아모데이는 앤트로픽 최고경영자(CEO)다.

다리오 아모데이는 이날 공개 글에서 프론티어 AI 모델 능력 향상 속도 둔화가 필요하다고 주장했다. 아모데이는 AI의 소프트웨어 개발 참여와 AI 연구 자체 참여를 지적했다.

아모데이는 향상된 AI 능력이 다음 세대 모델 개발을 다시 가속하는 재귀적 자기개선(RSI)을 제시했다. 그는 재귀적 자기개선(RSI)을 위험 요인으로 지목했다. 또 아모데이는 AI 발전 속도가 인간의 안전 연구·검증 능력을 추월할 수 있다고 설명했다.

샘 올트먼 오픈AI CEO와 일론 머스크 스페이스X AI CEO는 아모데이 제안 공개에 동조했다. 데미스 허사비스 구글 딥마인드 CEO도 프론티어 AI의 안전·개발 속도와 관련한 유사한 문제의식을 표명했다.

이 같은 관련 논의는 선언 수준을 넘어 실제 모델 운영 원칙으로 확장되고 있다. 마이크로소프트는 14일 마이크로소프트 AI(MAI) 자체 모델용 '휴머니스트 AI 행동강령' 초안을 공개했다.

'휴머니스트 AI 행동강령' 초안에는 무기 제조 금지, 위험물질 조달 금지, 공격적 사이버 작전 지원 금지가 담겼다. 또 원칙에는 모델의 독자적 목표 설정 금지와 잘못된 행동 은폐 금지, 사고 과정 또는 다른 AI와의 소통에서 인간이 해석하기 어려운 내부 표현인 '뉴럴리즈(neuralese)' 사용 금지, 인간이 이해 가능한 형태의 추론 요구, 인간이 이해 가능한 형태의 의사소통 요구가 포함됐다.

프론티어 AI 개발을 주도하는 기업들 내부에서도 과제가 부상하고 있다. 모델 성능 향상 속도와 검증·통제 능력 간 격차가 커지고 있기 때문이다. 이에 따라 쟁점은 AI 개발 중단 여부보다 성능 경쟁 속도와 검증 체계 속도의 정합에 맞춰지고 있다.

AI 업계 관계자는 최근 제기되는 속도조절론의 취지가 AI 개발 중단 주장은 아니라고 밝혔다. 그는 성능 향상 속도에 맞춘 안전성·검증 체계의 동시 강화가 필요하다고 설명했다. 또 프론티어 모델 경쟁은 지속될 가능성이 크다고 말했다.

AI는 연구 보조를 넘어 직접 증명을 생성하고 과학적 발견에 참여하기 시작했다. 이 같은 AI의 역할 확대는 성능 경쟁의 속도와 안전성·검증 체계의 속도를 함께 맞춰야 한다는 요구를 더 키우고 있다. 앞으로의 경쟁은 더 어려운 문제의 신속 해결 능력과 결과의 신뢰 가능한 검증·통제 능력에 달릴 전망이다.

출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=406863

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 테크월드뉴스

원문 확인

이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.