AI

앤트로픽 연구원 퇴사하며 경고…“AI 재귀적 자기개선, 통제 불능 우려”

테크월드뉴스 ·

[사진=챗GPT]

✦ AI 요약

AI가 AI 연구개발을 가속하고, 향상된 역량이 다시 개발에 쓰이는 재귀적 자기개선(RSI) 개념이 주목받으며 관련 우려가 커지고 있다.

월스트리트저널(WSJ)은 AI 연구 역량의 빠른 향상과 함께 인간의 개발 속도·행동 통제 가능성 문제가 다시 제기됐다고 9일(현지시간) 보도했다.

앤트로픽 연구원 제이컵 콕슨은 스스로 성능을 높이는 AI 시스템 개발 경쟁에 대한 우려를 제기한 뒤 회사를 떠났고, 오픈AI와 앤트로픽 모두 책임감 있게 행동하지 않는다고 주장했다.

AI가 AI 연구개발을 가속하고 향상된 역량이 다음 AI 개발에 다시 쓰이는 개념인 재귀적 자기개선(RSI)이 주목받으면서 RSI 관련 우려가 커지고 있다. AI 연구 역량의 빠른 향상과 함께 인간의 개발 속도·행동 통제 가능성 문제가 다시 제기됐다고 월스트리트저널(WSJ)이 9일(현지시간) 보도했다.

이런 흐름 속에서 앤트로픽 연구원 제이컵 콕슨은 스스로 성능을 높이는 AI 시스템 개발 경쟁에 대한 우려를 제기한 뒤 회사를 떠났다. 제이컵 콕슨의 연구 분야는 대규모 데이터를 활용해 신규 AI 모델을 학습시키는 사전학습이며, 그는 오픈AI와 앤트로픽에서 지난 3년간 근무했다.

제이컵 콕슨은 소셜미디어 엑스(X)를 통해 퇴사 사실과 AI 업계에 대한 문제의식을 공개하면서 오픈AI와 앤트로픽을 지목했다. 그는 두 회사 모두 책임감 있게 행동하지 않고 있다고 주장했으며, 스스로 개선하는 초지능을 향한 질주가 생명을 건 도박이라는 우려를 나타냈다.

글은 '스스로 개선하는 초지능'을 AI가 AI 연구개발에 참여하는 것을 뜻하는 개념으로 설명한다. 이는 높아진 연구 역량을 더 강한 AI 개발에 다시 재투입하는 구조이며, 재귀적 자기개선과 연결된다. 이런 과정이 반복되면 모델 발전 속도가 가속될 수 있다.

동시에 이런 반복은 새 능력과 위험을 확인하는 시간을 줄일 가능성이 있으며, 안전장치를 마련하는 시간도 감소시킬 가능성이 있다. 이어 콕슨은 AI 능력을 과소평가해서는 안 된다고 주장했다. 그는 향후 AI가 해킹 분야에서 인간 초과 수준에 도달할 가능성과 연구 분야에서 인간 초과 수준에 도달할 가능성, 실제 자원을 확보할 가능성, 권한을 확보할 가능성이 있으며, 이런 가능성을 배제하기는 어렵다고 판단했다.

아울러 그는 AI 업계가 위험을 모른 채 개발 경쟁을 벌이고 있는 것은 아니라고 지적했다. 콕슨은 AI 개발자들이 2030년 이전 인류 전체에 대한 위협 가능성을 실제로 우려하고 있다고 말했다. 그는 이를 단순한 홍보나 마케팅용 주장으로 간주해서는 안 된다고 강조했다.

콕슨은 오픈AI와 앤트로픽이 경쟁을 지속하는 이유를 각각 다르게 설명했다. 그는 오픈AI 내부에는 AI의 문명적 영향을 충분히 수용하지 못하는 구성원이 다수 있다고 봤다. 반면 그는 앤트로픽은 위험을 인식하고 있으나, 다른 기업이 더 강력한 AI를 먼저 개발할 수 있다는 우려 때문에 속도를 늦출 수 없다고 말했다. 이와 관련해 오픈AI·앤트로픽 경쟁 배경을 둘러싼 상이한 평가가 제기됐다.

이어 쟁점은 AI 성능 향상 속도에 상응하는 안전 기술의 고속 발전이 가능한지로 제시됐다. 콕슨은 초지능 개발을 가속하면서 단기간에 안전 문제 해결을 병행하는 방식에는 한계가 있다고 봤다. 그는 더 강력한 AI를 개발하기 전에 모델의 판단·행동 방식에 대해 충분히 이해할 필요가 있다고 말했다.

다만 그는 최근 AI 시스템과 관련한 사이버보안 문제가 경고 신호로 작용하고 있다고 평가했다. 이에 따라 기업들이 공동으로 개발 속도를 조절할 수 있는 여지가 있으며, 미국 AI 연구소들 사이에서도 속도 조절에 합의할 가능성이 커졌다고 콕슨은 봤다. 아울러 그는 국가 간 경쟁을 관리하기 위해 일정 기간 모델 능력 향상을 제한하는 방안을 검토할 필요가 있다는 견해를 밝혔다.

WSJ 보도에 따르면 콕슨은 개별 기업의 자율적 노력만으로는 고성능 AI의 위험을 관리하기 어렵다고 판단했다. 올해 초 안전 연구를 중시하는 앤트로픽으로 이직한 콕슨은 정부 개입 또는 업계 공동 대응이 필요하다는 결론에 이르렀다.

콕슨은 위험이 현실화하는 시점이 예상보다 빠를 수 있다고 판단했다. 그는 WSJ에 가장 공격적인 AI 발전 시나리오의 상당수가 현실화하는 방향으로 가고 있다고 밝혔고, 2027년 말에는 상황이 통제하기 어려운 단계에 이를 가능성을 제기했다. 아울러 그는 자기개선 능력을 가진 AI가 급속히 발전하고, 해당 AI가 인간의 명령을 거부할 가능성을 우려했다.

이 같은 문제의식은 앤트로픽 내부에서도 유사하게 제기됐다. AI 정렬 연구 총괄인 에번 휴빙거는 콕슨의 X 게시물에 동의한다는 입장을 보였다. 에번 휴빙거는 개인적으로 향후 10년 안에 AI가 인류 전체에 치명적 결과를 초래할 가능성이 10% 이상이라고 전망했다.

휴빙거는 앤트로픽이 AI 위험 감소 연구를 진행하고 있다고 밝히면서도, 초지능을 인간 의도에 맞게 통제하는 방법은 아직 확보하지 못했다고 짚었다. 이어 AI의 연구개발 역할이 확대되는 가운데, 모델 능력의 급속 향상에 맞춰 이를 이해하고 감독하는 기술이 함께 발전할 수 있는지가 남은 과제로 제시된다.

이런 흐름 속에서 안전 논의도 개별 모델의 위험에서 개발 속도와 통제 문제로 확장되고 있다. 특히 AI가 자신의 연구 역량을 개발에 재투입하는 재귀적 자기개선 단계가 조건부 단계로 거론되며, 이 단계에서 모델 능력 평가와 행동 감독용 안전 체계를 확보하는 속도가 관건으로 제시된다.

출처: 테크월드뉴스 · 김승기 기자
원문: https://www.epnc.co.kr/news/articleView.html?idxno=406771

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 테크월드뉴스

원문 확인

이 기사는 테크월드뉴스 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.