[칼럼] 수학 올림피아드는 왜 AI의 시험대가 됐을까?
테크월드뉴스 ·
✦ AI 요약
오픈AI는 9월8일 내부 모델이 나비에-스토크스 방정식 해의 존재성과 관련된 문제를 해결했다고 발표했다.
국제수학올림피아드(IMO)에서는 2025년 구글 딥마인드 모델이 6문제 중 5문제를 풀어 42점 만점에 35점을 받았고, OpenAI도 비공식으로 35점을 기록했다고 밝혔다.
글은 수학이 AI 추론 역량을 학습·평가하는 핵심 시험대로 부상했으며, 수학 난제 해결로 이어지는 흐름을 설명한다.
지난 9월8일 오픈AI는 내부모델이 나비에-스토크스(Navier-Stokes) 방정식 해의 존재성과 관련된 문제를 해결했다고 발표했다. 이 문제는 7대 밀레니엄 난제 중 하나에 해당한다. 필자는 이를 AI가 수학 분야에서 인간의 추론 역량을 능가했음을 보여주는 상징적 순간으로 평가했다.
이 같은 장면의 배경으로는 국제수학올림피아드(IMO)에서 확인된 AI 성능 향상이 있다. 2025년 7월에는 구글 딥마인드 모델이 IMO에 공식 참가했다. 이 모델은 6문제 중 5문제를 해결했고, 42점 만점에 35점을 받았으며, 이는 실제 대회 금메달에 해당하는 성적이었다.
2024년 기준으로는 IMO 문제를 해결하려면 문제를 형식화된 프로그래밍 언어로 변환할 필요가 있었고, 장시간의 풀이 탐색도 필요했다. 그러나 2025년에는 LLM 기반 AI가 다른 방식으로 문제를 풀었다. 이 AI는 자연어로 된 문제를 직접 처리했고, 제한 시간 안에 풀이했다.
그 결과 2025년의 LLM 기반 AI는 세계 최고 수준의 고등학생들과 비교 가능한 성과에 도달했다. 이는 구글 딥마인드 모델이 금메달권 성적을 기록한 사실과 함께, AI의 수학 문제 해결 능력이 빠르게 높아졌음을 보여주는 사례로 제시됐다.
구글·오픈AI 등 AI 기업들은 자사 AI의 수학 성능 향상을 위해 대규모 자원을 투입하고 있다. 필자는 수학 종사자다. 필자는 수학이 흥미롭고 깊이 연구할 가치가 있는 학문이라고 본다. 다만 그 가치만으로는 기업들의 막대한 투자와 당장 수익과 거리가 있어 보이는 수학 도전의 이유를 설명하기에 부족하다고 판단한다.
이 글은 수학이 AI 추론 역량 학습·평가의 핵심 시험대로 부상한 이유를 다룬다. 또한 해당 기술적 도전의 현재 도달 지점을 점검한다.
이를 설명하는 전제로 LLM의 학습 방식을 볼 필요가 있다. LLM은 대규모 데이터셋 기반으로 학습한다. 이때 LLM의 예측 단위는 단어보다 정확히는 토큰이다. LLM은 앞선 토큰 나열을 바탕으로 다음 토큰 출현 확률을 학습한다.
예를 들어 '나는 오늘 점심으로 김치'라는 문맥이 주어지면, 뒤에는 '찌개'·'전'·'볶음밥'·'만두전골' 같은 후보가 올 수 있다. LLM은 이런 후보들이 뒤따를 확률을 학습한다. 그리고 이렇게 학습한 확률을 바탕으로 문장을 생성한다. 이런 구조적 특성 때문에 LLM은 통계적으로 그럴듯한 문장 생성에 적합하다.
추론의 타당성은 그럴듯함만으로는 보장되지 않는다. 핵심 기준은 선행 사실들로부터 결론이 논리적으로 도출되는지 여부다.
LLM의 학습 목표는 다음 토큰 예측이다. 다음 토큰 예측 중심의 LLM 학습 목표는 본질적으로 논리적 타당성을 지향하는 것은 아니다.
20212022년경 등장한 GPT 등 초기 모델은 다른 분야에서 괄목할 성과를 보였다. 그러나 20212022년경 등장한 GPT 등 초기 모델의 수학 추론 능력은 초등학생·중학생과 경쟁하는 수준이었다. 초기 LLM이 추론에 취약했던 원인은 별도 학습·검증 장치가 부족했기 때문이다.
초기 LLM에는 별도 학습·검증 장치가 부족했다. LLM 기반 인공지능이 인간과의 고차원 업무를 수행하기 위해서는 추론 역량이 중요하다.
학교 교육에서는 수학을 논리적 사고를 함양하고 평가하는 데 오랫동안 활용해 왔다. AI 기업들이 수학에 주목한 이유는 수학의 논리적 사고 훈련·평가 기능에 있다.
수학 문제 풀이에는 조건 분석과 다단계 논리 연결, 결론 도출, 결과 재확인의 요소가 포함된다. 또한 수학 문제는 정답이 명확하고 과정의 적정 수행 여부를 객관적으로 평가할 수 있는 특성이 있다.
이 같은 특성 때문에 수학은 AI 분야에서 추론 역량을 학습·테스트하기에 적합한 통제 환경으로 여겨진다. 글로벌 AI 기업들의 수학 도전도 이러한 수학의 특성에서 출발했다. 이들이 설정하는 도전 목표는 매우 어려우면서도 달성 가능성이 있고, 달성 의미가 직관적이어야 한다.
국제수학올림피아드(IMO)는 이런 조건에 부합하는 시험이다. IMO는 세계 최고 수준 고등학생들의 실력 경쟁 무대다. 시험은 6개 문제로 구성되며, 이틀간 9시간에 걸쳐 치러진다. 문항 배점은 문제당 7점이고 총점은 42점이다.
이 같은 형식의 IMO 가운데 2025년 IMO 출제 문제 1개가 시험 난도를 체감하기 위한 목적으로 소개될 예정이다.
2025년 IMO 6번 문제는 단위 정사각형들로 이루어진 2025×2025 격자판에서, 변이 격자선 위에 놓이는 직사각형 타일들을 서로 겹치지 않게 배치할 때 필요한 타일 수의 최솟값을 계산하라고 묻는 문항이다. 이때 조건은 각 행마다 덮이지 않은 단위 정사각형이 정확히 1개이고, 각 열마다 덮이지 않은 단위 정사각형도 정확히 1개가 되도록 하는 것이다.
이 문제는 잠시 생각해도 대부분의 사람이 큰 난관에 직면하는 문제로 평가된다. 비교 대상으로 거론되는 대학수학능력시험 수학 영역 22번은 못 풀더라도 여러 시도를 해볼 수 있지만, 이 문제는 시작점조차 떠올리기 어려울 만큼 고난도라는 평가를 받는다.
풀이에서 결정적으로 쓰이는 성질은 2025가 45×45라는 사실이다. 다시 말해 2025는 완전제곱수이다.
이 사실을 빠르게 알아차리지 못하면 해결 가능성은 거의 없다고 평가된다. 결국 이 문제의 핵심은 2025×2025 격자판의 조건을 다루는 과정에서 2025가 45×45인 완전제곱수라는 점을 포착하는 데 있다.
대부분의 대학·대학원 수학 시험은 IMO 대비 추론 깊이가 더 얕다. IMO는 매우 높은 수준의 추론을 요구한다. 따라서 이 시험에서 인간 수준 이상의 성과를 낼 경우 LLM의 수학·추론 불가 주장은 약화될 수 있다. IMO 성적은 AI의 수학적 추론 능력을 입증하는 수단이 될 가능성이 있다.
IMO 문제는 데이터셋 오염에 안전하다. IMO는 매년 인간이 창의적으로 만든 새로운 유형의 문제들로 구성된다. IMO 유사 문제는 다른 시험 기출문제·인터넷에 부재한다. 이런 점 때문에 LLM의 데이터 학습만으로 IMO 문제를 해결할 가능성은 희박하다.
이 같은 판단은 직접 고차원 추론 없이 해결하는 경우를 기준으로 한다. 그 전제 아래 IMO는 AI의 실제 추론 여부를 확인할 수 있다. 다시 말해 IMO는 단순 학습이 아니라 실제 추론이 있었는지를 살피기에 적합하다.
또한 IMO 결과는 점수로 명확한 평가가 가능하다. 이 점들로 IMO는 인공지능 기업들의 중요한 목표가 됐다. 높은 난도와 명확한 채점 가능성을 함께 갖춘 점이 그 배경으로 제시된다.
AI 기업들은 수학 추론의 1차 목표로 IMO 금메달 수준 도달을 삼았다. 금메달 수준의 기준은 응시생 약 12분의 1이다. 그러나 초기에는 해당 목표의 달성 전망이 불투명했고, 2024년 IMO에서는 LLM으로 문제를 해결했다고 발표한 인공지능 기업이 없을 만큼 출발점이 낮았다.
이 같은 배경에는 LLM을 수학 올림피아드에 적용하는 과정에서 여러 병목이 존재했다는 점이 있었다. 수학 올림피아드의 특성에 따라 양질의 학습 데이터가 부족했고, 인터넷 데이터도 풀이의 완결성이 미흡했으며 무오류성도 충족하지 못했다. 또 데이터를 확보한 이후에도 사후 학습과 강화학습을 수행할 방법이 충분히 알려지지 않았다.
이후 2024~2025년에는 데이터 확보 노력이 진행됐고, 새로운 강화학습 기법이 등장했으며, 검증기(verifier)도 발달했다. 이런 데이터 확보 노력과 강화학습 기법, 검증기 발달이 맞물리면서 상황이 변화하기 시작했다.
2025년에는 구글 딥마인드 모델이 IMO에 공식 참가해 35점을 기록했고, 성과 수준은 금메달이었다. OpenAI도 IMO에서 비공식으로 동일한 점수인 35점을 기록했다고 발표했으며, 풀이도 공개했다.
이 같은 추론 역량은 모델 규모 확대만으로는 획득할 수 없고, 문제 풀이 전략을 자율적으로 탐색하는 능력과 여러 단계를 거쳐 논리를 연결하는 능력, 도출한 결과를 다시 검증하도록 만드는 요소가 필요하다. 이를 위해서는 별도의 학습·설계가 필요하다.
IMO 금메달 수준 성과가 처음 등장한 뒤 1년이 경과했지만, 현재까지 이를 안정적으로 구현한 모델은 다수가 아니다. 미국·중국 기업이 개발한 모델을 제외하면, IMO 금메달 기준 충족을 공표한 사례는 SKT의 독자 AI 파운데이션 모델 A.X K2만 해당한다.
A.X K2는 2026년 IMO 문제 평가에서 42점 만점 중 29점을 받아 2026년 해당 금메달 기준을 충족했다. 또 2025년 IMO 기출문제에서는 42점 만점 중 35점을 기록해 금메달 수준 성능을 보였고, 고난도 수학적 추론 능력을 평가하는 'MathArena AIME 2026'에서는 정확도 97.1%로 공동 최고점을 기록했다.
A.X K2는 서로 다른 유형·난도 수학 평가에서 연속 고득점을 기록했다. 이를 통해 A.X K2는 글로벌 최정상급 모델과 견줄 수준의 수학적 추론 역량을 드러냈다.
이와 함께 LLM의 방대한 지식 체계 추론 능력이 주목된다. 이런 능력은 실제 수학 연구 공략의 출발점 역할을 하는 것으로 제시된다.
이 같은 맥락에서 수학 인공지능 성과 사례가 제시된다. 2026. 5. 20.에는 폴 에르되시(Paul Erd?s)의 평면 단위거리 문제 관련 추측의 반례 구성이 이뤄졌다.
이어 2026. 8. 1.에는 비소픽 군(non-sofic group)의 구성이 이뤄졌다. 또 2026. 9. 8.에는 나비에?스토크스(Navier?Stokes) 방정식 해의 존재성과 관련한 해법이 공개됐다. 나비에?스토크스(Navier?Stokes) 방정식은 밀레니엄 난제다.
다만 IMO 문제 풀이와 실제 수학 난제 해결 사이에는 큰 간극이 있다. IMO 17세 금메달리스트가 이후 10년 안에 실제 수학 난제를 해결하는 경우는 흔치 않다.
실제 난제 해결에는 추론 능력 외에도 폭넓은 지식과 통찰이 필요하다. 따라서 앞서 열거된 사례와 별개로, IMO급 문제 해결과 실제 난제 해결은 다르다는 점이 함께 설명된다.
수학 난제를 해결하는 데에는 '긴 사고(long thinking)'와 장시간 추론의 역량이 필요하다. 인간이 IMO 문제를 푸는 데에는 평균 1.5시간이 걸리지만, 하나의 난제를 해결하는 데에는 1.5년도 부족한 경우가 다수다. 이를 두고 수학 올림피아드는 사활 문제 1개를 푸는 일에, 난제 해결은 신진서 9단과의 대국에 비유할 수 있다.
이 같은 격차 때문에 인공지능 기업들은 더 나은 파운데이션 모델 도입, 에이전트 개발, 아키텍처 개선, 대규모 강화학습에 대응해 왔다. 목표는 LLM의 수학 역량 강화와 장시간 추론 가능한 에이전트 구축이다.
이러한 노력으로 LLM이 IMO 금메달급 성적에 도달하기까지는 2년 이상 연구개발이 필요했다. 다만 그 성과를 바탕으로 실제 수학 난제 해결에 착수하기까지는 장기간이 불필요했다.
2025년 IMO 이후 1년 사이에 벌어진 사례들은 AI의 수학 능력이 빠르게 고도화되고 있음을 보여줬다. AI는 IMO 금메달 수준 성능을 드러냈고, 이어 인간이 풀지 못한 수학 난제 해결로까지 나아갔다.
OpenAI는 2026년 9월 8일 내부 모델이 나비에?스토크스 문제의 증명 발견에 이르렀다고 발표했다. 나비에?스토크스 문제는 인류 미해결 밀레니엄 난제로 꼽히는 문제다.
이 같은 흐름을 두고 수학 분야에서는 이른바 알파고 모먼트(AlphaGo moment)가 도래했다는 평가와 함께, 초인적 능력(superhuman)의 시점이 도래했다는 평가가 나왔다. 이는 AI가 수학에서 인간 최고 수준을 따라잡는 단계를 넘어섰다는 인식과 맞닿아 있다.
다만 일부 인간 대비 AI의 부족한 부분은 여전히 존재한다. 그러나 그 영역에서도 인간 초월은 시간문제라는 전망이 뒤따른다.
이처럼 AI 기업들이 수학 분야에 막대한 자원을 투입하는 이유는 수학 난제 해결 자체가 궁극적 목표이기 때문은 아니다. 이들은 수학을 활용해 AI의 논리적 사고 한계를 확인하고 있으며, 궁극적으로는 인간 수준을 넘어서는 추론 능력 구현을 지향하고 있다.
출처: 테크월드뉴스 · 서인석 서울대학교 수리학과부 교수
원문: https://www.epnc.co.kr/news/articleView.html?idxno=407888
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 테크월드뉴스
원문 확인이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.