인사이트

판결서 문맥 남기고 개인정보만 가리는 한국어 AI

인공지능신문 ·

이재진 교수(사진:서울대)

✦ AI 요약

판결서 5,872건·개인정보 영역 19만3천여 건으로 학습…개인정보 경계 분리율 99.7%...법원 판결서 넘어 행정·기업 문서로 확장

인공지능신문에 따르면 서울대 이재진 교수팀이 9월 29일 한국어 문서에서 개인정보만 정밀하게 가리고 문맥은 최대한 남기는 비식별화 모델 'Thunder-DeID+'를 공개했다. 판결서 5872건으로 학습한 이 모델은 개인정보 경계 분리율을 99.7%까지 끌어올리며 한국어 조사와 어미가 붙는 표현을 더 정확히 가려내는 데 초점을 맞췄다. 이번 기술의 핵심은 이름이나 기관명에 붙은 조사까지 함께 지우는 대신, 개인정보가 시작되고 끝나는 지점을 더 세밀하게 나눠 필요한 부분만 처리하는 데 있다. 연구팀은 판결서로 학습한 뒤에도 소량의 추가 학습만 거치면 일반 민감문서에 적용될 가능성을 확인했다고 밝혔다. 이에 따라 법률 문서를 넘어 행정문서와 기업 업무문서처럼 외부 공유나 AI 입력 전 비식별화가 필요한 영역으로 활용 범위를 넓히려 한다. 자동화 성능을 높였더라도 위험도가 높거나 판단이 애매한 부분은 사람의 검토를 함께 두는 방향을 전제로 한다.

관점

이 기술이 중요한 이유는 개인정보 보호와 문서 활용이 늘 충돌하던 지점에서 둘 중 하나를 크게 포기하지 않는 선택지를 보여줬기 때문이다. 문맥을 살린 채 필요한 부분만 가리는 방식이 자리 잡으면 공개 문서의 활용도와 내부 업무 효율이 함께 올라갈 수 있다. 특히 한국어처럼 조사와 어미가 의미를 좌우하는 환경에서는 단순 삭제보다 정밀한 경계 처리의 가치가 더 크다. 결국 민감문서를 AI에 연결하려는 조직들에겐, 무조건 차단과 전면 개방 사이의 실무적 중간 해법이 될 수 있다.

이 관점은 비즈크러시가 작성한 자체 의견이며, 인공지능신문의 보도 내용과 무관합니다.

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 인공지능신문

원문 확인

이 기사는 인공지능신문 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.