보안

[인터뷰] “요약하고 답하던 AI에서 분류·처리하는 AI로”

아이티데일리 (IT DAILY) ·

국현우 에이씨엔에스 상무

✦ AI 요약

에이씨엔에스 국현우 상무는 생성형 AI 확산과 함께 전자문서 활용이 문서 설명에서 문서 처리 판단으로 이동하고 있다고 밝혔다.

그는 N2SF 기반 C/S/O 분류에서 문서 전체 분석, 적용 기준·원문 근거 탐색, 등급 후보와 판단 근거 제시가 필요하다고 설명했다.

또 에이씨엔에스는 민감·비공개 문서를 별도 벡터 검색 데이터로 축적하는 방식보다 현재 문서를 기준에 따라 직접 판단하는 방식을 택한다고 밝혔다.

인터뷰 형식 기사에서 에이씨엔에스 국현우 상무는 생성형 AI의 기업·공공기관 확산과 함께 전자문서 활용 방식이 변화하고 있다고 밝혔다. 그는 기존 LLM의 문서 활용 대표 기능으로 내용 요약, 필요 정보 검색, 사용자 질문 응답을 들었다고 전했다. 또 최근에는 RAG 기반 업무지원 시스템이 확산하고 있으며, 이 시스템의 주된 초점은 조직 보유 문서의 쉬운 검색·활용에 맞춰져 있다고 설명했다.

국현우 상무는 생성형 AI가 실제 업무 프로세스에 진입하면서 요구도 달라지고 있다고 밝혔다. 그는 이제 전자문서 활용이 문서 설명 단계에서 문서 처리 판단 단계로 이동하고 있다고 전했다.

그는 이 판단 단계에서는 문서 내 중요정보 포함 여부, 외부 공개 가능 여부, 내부 보호 수준, AI 서비스 활용 가능 여부를 가려야 한다고 설명했다. 아울러 이러한 판단은 문서 내용과 기관 기준의 종합 고려를 바탕으로 이뤄진다고 밝혔다.

국가 망 보안체계(N2SF)는 기관 업무 정보를 대상으로 C(Classified, 기밀)·S(Sensitive, 민감)·O(Open, 공개) 3개 등급 분류를 요구한다. 등급 기준은 중요도·민감도다. 이에 따라 기관에서는 방대한 전자문서를 실제로 어떻게 식별·관리할지가 과제로 부상했다.

전자문서 처리 기술 개발 기업인 에이씨엔에스(ACNS)는 이런 상황을 문서 AI의 역할이 정보 활용 도구에서 업무 판단 도구로 확장되는 과정으로 보고 있다. 이번 인터뷰는 국현우 에이씨엔에스 상무를 대상으로 진행됐으며, 개발 중인 제품인 다큐에이아이(Docu AI, 전자문서 분류 및 처리 엔진)의 N2SF C/S/O 문서 분류 기능에 초점을 맞췄다.

인터뷰에서는 문서를 판단·처리하는 AI와 기존 문서 검색·RAG의 차이도 비교 주제로 다뤘다. 아울러 N2SF에 따른 C/S/O 분류가 대표적 사례인지 여부를 묻는 질문도 제시됐다.

기관 내에서는 문서가 대량으로 생성·저장되고 있으며, N2SF 체계의 업무정보 등급 구분을 위해서는 문서 내용 확인이 필요하다. 향후 생성 문서와 기존 문서 모두가 검토 대상이지만, 담당자가 문서별로 개별 확인을 거쳐 C/S/O를 판단하는 것은 사실상 불가능하다.

이에 에이씨엔에스는 AI의 문서 전체 분석 후 적용 가능 기준·원문 근거 탐색 및 등급 제안 구조를 검토 사항으로 두고 있다. 이 방식은 AI에 C/S/O 중 하나를 단순 지정하도록 묻는 방식이 아니며, 기관 업무와 적용 기준의 선구조화가 필요하다. 또한 AI가 기준에 기반해 문서를 분석할 필요가 있으며, 현재 개발 중인 기능의 목표는 단순 분류가 아닌 C/S/O 등급·적용 기준·원문 근거 설명을 포함한 자동 분류다.

이 가운데 명확한 문서는 자동 분류 대상이 된다. 반면 기준이 충돌하는 문서 또는 필요한 사실 확인이 불가한 문서는 담당자 검토 대상이 된다.

질문 주제인 민감·비공개 문서 기반 벡터DB 구성·유사도 비교 방식과 관련해 발언자는 자사 접근법이 상당히 다른 접근이라고 평가하면서, 최대 차이 2가지를 제시했다. 우선 첫 번째 차이로 보호 대상 정보를 별도 검색 데이터로 재축적할 필요가 있는지의 문제를 짚었다. 벡터DB 방식은 기존 비공개·민감 문서와 새 문서의 유사도 비교를 전제로 하며, 이를 위해 기관 문서의 임베딩을 수행하고 검색 가능 형태로 관리할 필요가 있다고 설명했다.

이어 원문을 저장하지 않는 경우에도 임베딩과 검색 인덱스는 비공개·민감정보에서 파생된 데이터의 성격을 가진다고 밝혔다. 이에 따라 임베딩·검색 인덱스에 대해서도 접근통제·보관·삭제·백업 등 추가 관리가 필요하다고 설명했다. 이 과정에서 추가 관리 대상이 발생한다고 덧붙였다.

발언자는 이런 이유로 공공기관 관점에서는 민감 문서를 탐지하기 위해 민감 문서를 다시 모아두는 구조가 부담이 될 수 있다고 연결했다. 민감 문서 탐지를 위해 보호 대상 정보를 별도 검색 자산으로 다시 만들어 관리해야 하는 구조 자체가 부담이라는 취지로 설명했다.

마지막으로 다큐에이아이는 C/S/O 분류에서 과거 비공개·민감 문서를 별도 벡터 검색 데이터로 축적하는 방식을 기본 구조로 사용하지 않는다고 밝혔다. 발언자는 이를 자사 접근법과 벡터DB 기반 유사도 비교 방식의 차이로 제시했다.

이미지 설명은 Docu AI-N2SF C/S/O 분류 처리 구조이며, 사진 출처는 에이씨엔에스다. 보안등급 분류에서는 문서 유사성과 보안등급 동일성이 일치하지 않는다. 유사한 내용을 담은 문서라도 이미 공개된 자료일 수 있고 공개 전 내부 검토자료일 수 있어 상태 차이가 가능하다. 입찰자료도 업무가 진행 중인지 종료됐는지에 따라 판단 기준이 가변적이다. 또한 공개 가능한 본문과 비공개 첨부가 한 문서 안에 함께 존재할 수 있다.

이에 대해 에이씨엔에스는 유사한 문서를 찾는 것보다 기준에 따라 현재 문서를 판단하는 것이 중요하다고 본다. 이에 따라 과거의 비공개 문서와 얼마나 비슷한지를 보는 것보다 현재 문서가 기관이 정한 기준의 어떤 요건에 해당하는지를 직접 판단하는 방식을 택했다. 이 과정에서는 현재 문서의 내용, 구조, 업무 맥락, 기존 관리정보를 분석 요소로 삼고, 기관 정책과 판단 기준을 적용 요소로 반영한다.

이 같은 방식의 출력으로는 C/S/O 등급 후보와 그 근거를 제시한다. 추가 판단이 필요한 문서만 담당자 검토 대상으로 분리한다.

실제 문서 분석·등급 판단에서의 LLM 처리 방식과 관련해 발언자는 LLM이 중요한 역할을 맡지만, 문서 전체를 LLM 하나에 맡겨 등급을 결정하는 방식은 아니라고 설명했다. 보안등급 판단에는 몇 개 문장만으로는 불충분하며, 본문과 제목, 표, 문서 구조, 앞뒤 문맥, 기존 관리정보, 업무 상태, 첨부문서까지 함께 살펴봐야 한다고 밝혔다.

에이씨엔에스는 문서를 분절한 뒤 일부 문장만으로 판단하는 접근을 지양하고, 전체 구조와 맥락을 유지한 상태에서 필요한 정보를 종합적으로 확인하는 관점으로 문서를 분석한다고 설명했다. 문서 보안등급 판단은 일부 문장만 읽는 방식이 아니라 문서를 둘러싼 다양한 요소를 함께 확인하는 흐름으로 이뤄진다는 취지다.

이 과정에서 LLM은 문장 의미를 분석하고, 전후 관계 등 문맥적 판단이 필요한 영역을 분석하는 역할을 맡는다. 반면 주민등록번호처럼 형식이 명확한 정보나 문서 내 기존 관리정보처럼 LLM의 추론이 불필요한 대상은 적합한 방식으로 확인하고, 문맥과 의미의 판독이 필요한 부분에만 LLM을 활용한다고 설명했다.

최종 처리 단계에서는 기관의 C/S/O 판단 기준과 결과를 종합한다. 이를 바탕으로 최종 산출물로는 등급 후보와 판단 근거를 제시하는 구조라고 밝혔다.

발언자는 C/S/O 분류 기능이 LLM에 문서 등급을 직접 질의하는 방식은 아니라고 설명했다. C/S/O 분류 기능의 개발 방향은 문서 구조와 업무 맥락을 확인하고, 적용 가능 기준과 근거를 분석하며, 문서 전반의 상충 정보와 예외 여부를 점검하는 데 있다고 밝혔다.

이어 발언자는 LLM 활용의 핵심으로 문서를 누락 없이 분석하고 기관 기준에 부합하는 근거를 정확하게 탐색하는 점을 제시했다. 이는 C/S/O 분류를 단순한 등급 판정이 아니라 문서 구조와 맥락, 기준과 근거, 예외와 충돌까지 함께 점검하는 방식으로 설명한 것이다.

기관별로 상이한 분류 기준을 AI에 어떻게 반영할 것이냐는 질문에 대해서는 공통 기준과 기관별 기준을 분리할 필요가 있다고 답했다. N2SF·관련 법령의 공통 적용 기준은 기본 정책으로 구성할 수 있다고 했고, 실제 적용 단계에서는 기관 업무 특성·자체 세부기준·문서 유형을 반영한 기관 정책을 별도로 설계할 필요가 있다고 밝혔다.

또한 기관 기준 반영 방식으로는 기관 문서를 대량으로 축적한 뒤 재학습하는 방식보다 정책과 판단 지침을 조정하는 점을 중시한다고 설명했다. 다큐에이아이는 공통 정책과 기관별 정책을 구분하고 있으며, 개발 방향도 실제 적용 단계에서 기관 기준과 지침을 반영한 정책 조정에 두고 있다고 밝혔다.

등급 분류의 성격은 출발점이며 자체 목적은 아니다. 중요 요소는 분류 판단의 후속 업무처리 연계다. 문서의 C/S/O 등급을 확인할 수 있고, 보호 대상 존재 여부도 확인할 수 있다. 확인된 분류 결과는 시스템에서 활용할 수 있다.

분류 결과의 활용처로는 외부 반출 여부 검토, DRM 정책 차등 적용, DLP 정책 차등 적용, 개인정보 포함 영역 마스킹, 내부 RAG 사용 가능 문서 판단, 생성형 AI 사용 가능 문서 판단이 있다. 등급과 보호 대상 정보는 문서의 보안·활용 판단 이후 처리의 기준으로 쓰이도록 설계된다.

다만 원칙은 분류와 실제 조치의 분리 필요다. 부적절한 구조의 예시로는 AI의 O 제안만으로 외부 반출을 자동 승인하는 방식이 있다. 기관의 승인 절차를 별도로 적용해야 하며, 실제 보안정책도 별도로 적용해야 한다.

C/S/O 분류 기능이 제공하는 정보는 문서 등급, 판정 상태, 적용 기준, 원문 근거다. 판정 상태 항목으로는 자동 분류 완료와 담당자 검토 필요가 있다. 이 같은 정보 제시는 분류 결과가 곧바로 실행 조치로 이어지지 않도록 하면서 후속 판단의 근거로 활용되게 한다.

필요시 다큐에이디(Docu AD, 전자문서 개인정보 마스킹 솔루션)와의 연계가 가능하다. 연계 목적은 출력 시점 마스킹 등 후속 처리 연결이다. 개발 방향은 C/S/O 분류 기능과 후속 처리 연계 구조를 개발 중인 것이다.

국 상무는 에이씨엔에스의 문서 AI 관점이 AI를 문서에 덧붙이는 방식이 아니라고 밝혔다. 그는 에이씨엔에스가 문서 중심으로 AI를 적용한다고 설명했다.

국 상무는 에이씨엔에스가 이 분야에 집중하는 이유로 문서 AI에서 중요한 요소 2가지를 인식하고 있기 때문이라고 밝혔다. 그는 첫째 요소로 AI의 문서 이해를 사람의 이해 방식과 최대한 유사하게 구현하는 점을 제시했다.

그는 문서가 단순한 텍스트 집합이 아니라고 설명했다. 문서는 제목·본문·표·첨부·문서 구조·작성 맥락으로 구성되며, 이 요소들은 상호 연결된다고 밝혔다. 또 같은 문장도 문서 내 위치나 업무 상태에 따라 의미가 달라진다고 설명했다. 이어 문서의 올바른 활용은 텍스트 추출이나 일부 문장 판독 수준을 넘어서는 것이라고 덧붙였다. 이를 위해 문서 AI에는 문서 전체 구조와 맥락을 동시에 이해하는 역량이 필요하다고 밝혔다.

국 상무는 둘째 요소로 문서 이해 결과를 실제 업무 처리 방식과 연결하는 점을 제시했다. 그는 사람의 문서 활용이 열람으로 끝나지 않는다고 설명했다. 문서를 확인한 뒤에는 분류, 승인, 공개 여부 판단, 보안등급 지정 업무를 수행하고, 필요 시에는 일부 정보를 보호하거나 다른 시스템에 전달한다고 밝혔다.

문서 AI의 지향점은 문서 내용을 설명하는 수준을 넘어 실제 업무 처리를 지원하는 데 있다. 에이씨엔에스가 해당 분야에 관심을 둔 이유도 문서 AI의 이 같은 업무 처리 지원 방향성에 있다.

에이씨엔에스는 창사 이래 전자문서 기반 솔루션을 지속 개발·공급해 왔다. 전자문서 처리 범위는 변환·검증·열람·보호에 걸쳐 있다.

이 과정에서 에이씨엔에스의 지속 과제는 전자문서 구조 이해와 문서 내 정보의 업무상 정확한 활용에 있었다. 에이씨엔에스 측은 AI를 독립 기술보다 전자문서 처리의 새로운 기술 요소로 인식한다고 밝혔다.

이어 에이씨엔에스 측은 모델 성능 경쟁보다 전자문서 구조·특성에 맞춘 AI 적용과 실제 문서업무 처리 방식의 연계가 더 중요하다고 판단한다고 설명했다. 또한 AI를 문서에 덧붙이는 방식이 아니라 문서 중심 적용을 지향하며, 이것이 자사의 문서 AI 관점이라고 덧붙였다.

발화자는 문서 AI가 단순 질의응답을 넘어 기존 업무시스템의 판단 과정 편입 확대 방향으로 발전한다고 전망했다. 생성형 AI의 초기 활용은 사람 질문 응답 중심이었다고 설명했다.

이어 향후 문서 AI의 기능으로는 문서를 읽고, 포함 내용을 탐지하고, 적용 기준을 판단하고, 관리 등급을 제안하고, 다음 시스템에 적용할 정책을 안내하는 역할을 제시했다. 문서 AI의 역할도 '요약하고 답하는 AI'에서 '판단을 지원하고 처리를 연결하는 AI'로 변화한다고 밝혔다.

발화자는 이 단계에 이르기 위해서는 모델 규모·종류만으로 불충분하다고 설명했다. 실제 업무 적용을 좌우하는 요소로는 AI에 부여하는 기준, 문서 누락 없는 분석 수준, 예외·충돌 처리 방식, 판단 결과의 사람 검증 가능성을 꼽았다.

그동안 기업·기관의 문서 AI 도입에서 핵심 질문은 문서 탐색·설명 성능이었지만, 이제는 기준에 따른 문서 처리 판단 가능성으로 핵심 질문이 확장된다고 설명했다. 이에 따라 도입의 초점도 문서를 잘 찾고 설명하는 능력에서 정해진 기준에 맞춰 문서를 어떻게 처리할지 판단하고 다음 처리와 연결하는 능력으로 옮겨간다고 밝혔다.

N2SF 기반 C/S/O 분류는 문서 AI 변화의 대표 사례다. 문서 AI에서 필요한 체계는 과거의 비공개 문서와 유사 문서 탐색만으로는 불충분하며, 현재 문서 전체를 분석하고 명확한 기준·예외에 따라 판단하며 그 판단 근거까지 설명할 수 있어야 한다.

문서 AI의 1단계는 문서 요약·검색이었으며, 다음 단계는 문서 판단과 실제 업무 처리 연계다.

출처: 아이티데일리 (IT DAILY) · 김호 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=241898

참고자료

이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.


출처 아이티데일리 (IT DAILY)

원문 확인

이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.