앤트로픽, 내부 상주형 AI 안전평가 체계 시동
인공지능신문 ·
✦ AI 요약
AI 기업 내부에 독립 평가자 배치…모델 학습·배포 과정 검증하고 안전장치 레드팀 평가
인공지능신문에 따르면 앤트로픽은 9월 18일 액센추어와 손잡고 향후 5년간 각각 약 1조원씩 투입해, 외부 평가자가 회사 안에서 모델 개발과 배포를 들여다보는 AI 안전성 검증 체계를 만들겠다고 밝혔다. 이번 협력의 핵심은 사후 점검에 머물던 평가를 학습과 출시 전반으로 넓히는 데 있다. 독립 평가자는 내부 접근권한을 바탕으로 학습 과정과 의사결정, 안전장치 운영이 실제 기준대로 이뤄지는지 살피게 된다. 양사는 레드팀 테스트와 정렬 평가, 안전장치 검증을 함께 진행할 계획이다. 다만 어떤 정보까지 볼 수 있는지, 결과를 어떻게 공개할지 같은 공통 규칙은 아직 정립되지 않았다. 앤트로픽은 이를 기업 책임을 대신하는 장치가 아니라, 책임 이행을 더 검증 가능하게 만드는 실험으로 설명했다.
관점
이 협력은 AI 안전성 평가의 무게중심을 결과물 검사에서 개발 현장 감시로 옮기려는 시도로 읽힌다. 평가가 기업 밖의 의견 제시에 그치지 않고 내부 절차와 출시 판단까지 비추게 되면, 안전성 논의는 선언보다 운영의 문제로 바뀔 수 있다. 동시에 공통 규칙이 아직 없다는 점은 앞으로 이 방식이 업계 표준으로 자리 잡으려면 독립성과 공개 범위를 둘러싼 합의가 핵심 변수가 될 것임을 보여준다.
이 관점은 비즈크러시가 작성한 자체 의견이며, 인공지능신문의 보도 내용과 무관합니다.
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 인공지능신문
원문 확인이 기사는 인공지능신문 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.