[AI 레디 데이터③] AI가 직접 판단·실행…데이터 관리도 ‘상시 체계’로
아이티데일리 (IT DAILY) ·
✦ AI 요약
생성형 AI와 AI 에이전트 활용이 확산하면서 데이터 관리에는 수집·정제·분석을 넘어 의미, 최신성, 접근권한까지 관리하는 AI 레디 데이터가 필요해졌다.
데이터스트림즈, 위세아이텍, IBM 등은 데이터 품질 자동 점검과 상시 운영 체계, 민감 데이터와 활용 경로 통제, 정책의 실시간 적용 필요성을 제시했다.
가트너는 AI 레디 데이터에서 에이전트 레디 데이터로의 확장을 말했고, 실제 사례에서는 상시 품질관리와 GraphRAG, AI 에이전트 적용이 진행됐다.
생성형 인공지능(AI)·AI 에이전트 활용이 기업 실무 전반으로 확산하면서 데이터 관리에 새로운 기준이 요구되고 있다. 기업들이 기존에 구축한 데이터 체계는 수집·정제·분석을 중심으로 마련돼 왔지만, 기존 데이터는 AI 활용에 부적합할 가능성이 제기된다. 이는 데이터가 다중 시스템에 분산돼 있고 동일한 정보라도 업무별로 의미와 관리 기준이 서로 다르기 때문이다.
이 같은 환경에서 AI는 데이터를 직접 탐색·해석하고 업무에 활용하는 역할을 맡게 되면서, 데이터 관리의 필요 요소도 확대되고 있다. 데이터 품질뿐 아니라 의미와 최신성, 접근권한까지 일관되게 관리할 필요성이 커지고 있다. 이에 대한 대응 개념으로 'AI 레디 데이터(AI Ready Data)'가 주목받고 있다. AI 레디 데이터의 핵심은 단순한 수집·정제를 넘어서는 데 있으며, 목표는 AI가 데이터의 의미와 맥락을 이해할 수 있게 하고 데이터를 신뢰할 수 있게 하는 데 있다.
이번 기사는 AI 레디 데이터③으로, 3편으로 구성된 연재의 한 축이다. 연재는 AI 활용 확대에 따른 데이터 관리 요건 변화를 짚고, AI 레디 데이터 구축 과정의 과제와 기술적 접근 방식, 실제 적용 사례를 다룬다.
[AI 레디 데이터①] AI 시대 '좋은 데이터' 기준 변화, [AI 레디 데이터②] AI가 기업 데이터 이해 위해 '업무 맥락' 연결 필요, [AI 레디 데이터③] AI의 직접 판단·실행 확대, 데이터 관리의 '상시 체계' 필요를 다루는 기사다.
이미지는 AI로 제작했다.
일회성 정비에는 한계가 있어 데이터 품질 자동화 기반의 상시 관리가 필요하다는 내용이다.
AI 대상 데이터 실시간 공급 체계를 구축하는 것만으로는 신뢰성을 상시 보장할 수 없으며, 그 원인으로는 업무 시스템 변경 가능성과 신규 데이터 추가 가능성이 제시됐다.
데이터 생성 즉시 AI 전달 환경이 확산하는 가운데, 해당 환경에서는 오류를 조기에 발견하고 개선하기 위한 상시 관리 체계가 중요하다는 흐름이다.
데이터스트림즈는 이런 이유로 데이터 생성·변경 과정의 품질 자동 점검 운영 체계를 강조했다.
데이터스트림즈는 이 운영 체계의 관리 대상으로 데이터 수집 실패와 데이터 수집 지연, 기존 데이터 구조 변경, 이상값 발생을 포함해야 한다고 제시했다.
데이터스트림즈는 데이터 파이프라인 운영에서 품질 자동 점검이 필요하다고 밝혔다. 또 탐지 대상으로는 갱신 지연·수집 실패·이상치·스키마 변경을 제시했다. 아울러 품질이 기준 이하로 하락할 경우 경고 또는 AI 활용 제한이 가능한 운영체계가 필요하다고 설명했다.
데이터스트림즈는 데이터 변화뿐 아니라 이를 설명하는 관리 정보도 함께 갱신할 필요가 있다고 밝혔다. 이어 데이터스트림즈는 해당 방향으로 기술을 확장하고 있다고 설명했다. 이 회사는 기존 품질관리 솔루션인 '퀄리티스트림(QualityStream)'을 보유하고 있다.
데이터스트림즈는 AI 데이터 플랫폼의 'AI 퀄리티 엔진(AI Quality Engine)'을 제시했다. AI 퀄리티 엔진은 데이터 특성 기반 품질 검증 규칙 생성, 오류 탐지, 개선방안 제시 기능을 갖췄다. 이를 통해 기존에 사람이 개별 설정하던 품질관리 작업의 일부를 자동화하는 접근을 제시했다.
위세아이텍은 데이터 품질관리를 일회성 평가나 시스템 구축 시점에 집중하는 방식에 머무르지 않고, 품질 진단 이후 개선·재검증까지 잇는 상시 운영 체계에 주목하고 있다. 위세아이텍 관계자는 데이터 품질관리가 평가·시스템 구축 시점 집중 방식에서 상시 운영 체계로 전환될 필요가 있다고 밝혔고, 품질 진단 이후 개선·재검증이 지속돼야 한다고 설명했다. 또 중요 데이터가 변경될 때는 관련 품질 기준과 AI 활용 데이터셋을 함께 점검할 필요가 있다고 전했다.
이를 위해 위세아이텍은 데이터 품질관리 솔루션 '와이즈디큐(WiseDQ)'를 활용하고 있다. 와이즈디큐는 데이터 특성 분석 프로파일링 기능과 업무 규칙 기반 품질 진단 기능, 점검 일정 관리 기능, 오류 개선 관리 기능을 제공한다. 아울러 AI의 데이터 특성 분석을 기반으로 적합한 검증 규칙을 추천하는 기능을 갖췄으며, 담당자의 반복적 진단 설정 작업을 줄이는 데 초점을 맞추고 있다.
AI 서비스 운영 중 발견된 오류는 원천데이터 개선으로 연결될 필요가 있다. 개별 AI 서비스에서 수정해도 원천데이터의 오류가 잔존하면 다른 서비스에서 동일한 문제가 반복될 가능성이 있다. 이에 따라 관리 범위는 원천데이터에 한정되지 않는다.
이 같은 흐름 속에서 데이터 거버넌스의 관리 범위는 확대되고 있다. 그 배경에는 AI 에이전트의 기업 시스템 연결이 있다.
AI 에이전트 환경에서는 데이터 활용 목적과 실행 가능 작업을 검토할 필요가 있다는 의견이 제기된다. 이 환경에서 우선 관리 대상은 AI에 전달되는 정보다. 접근 방식도 시스템 접근 가능 여부뿐 아니라 실제 데이터 단위별 활용 범위를 구분하는 방향으로 제시된다.
데이터스트림즈는 민감 데이터를 발견·분류하고, 사용 목적별 정책·접근권한을 적용하며, 이용 이력을 추적하는 방안을 제시했다. 이는 데이터 자체를 넘어 활용 목적과 접근, 이용 이력까지 관리하는 방향과 맞닿아 있다.
데이터스트림즈는 민감 데이터 관리의 핵심을 로그인 권한 통제만이 아니라 민감 데이터 식별과 사용자별 목적, 사용 수준의 데이터 단위 통제로 본다고 밝혔다. 또 민감 데이터 전체를 AI에 제공한 뒤 LLM에서 통제하는 방식은 채택하지 않고, AI에 전달하기 이전인 데이터 플랫폼 단계부터 통제하는 형태로 관리한다고 설명했다.
다만 데이터 플랫폼의 접근 제한만으로는 AI 에이전트 활용의 전 과정을 관리할 수 없다고 짚었다. 에이전트는 검색 결과를 기반으로 답변을 생성할 뿐 아니라 이전 작업 정보를 기억할 수 있고 외부 시스템 도구도 호출할 수 있어, 원천 데이터에 적용된 권한이 이후 정보 활용 과정에서도 지속되는지가 중요 쟁점이라고 밝혔다.
지티원은 AI 환경에서는 권한 관리 대상을 AI 활용 전체 경로로 확대할 필요가 있다고 판단했다. 지티원 관계자는 원천 데이터·데이터베이스 권한만이 아니라 프롬프트·벡터 DB·RAG 컨텍스트·에이전트 메모리·도구까지 포함한 전체 활용 경로를 통제할 필요가 있다고 밝혔다. 또 통제 기준으로는 목적·권한·규제를 제시했다.
지티원은 과제로 권한 관리와 AI 에이전트 판단 과정 추적을 함께 제시했다. 기존 데이터 계보 관리는 데이터 생성·변환·활용 경로 확인에 중점을 뒀지만, 에이전트 환경 변화에 따라 데이터 활용 이후 과정까지 추적 범위를 확대해야 한다는 것이다. 지티원은 데이터 계보 관리 솔루션 '데이터호크(DataHawk)'를 제공하고 있으며, '데이터호크(DataHawk)'는 데이터 생성 지점·거친 과정·활용 경로를 추적하는 기능을 지원한다. 여기에 더해 AI 에이전트 판단 결과와 도구 실행 이력까지 연결하는 관리 체계가 추가로 요구된다고 봤다.
이 같은 기록은 AI가 수행한 작업의 근거를 설명하는 데 활용된다. 또 문제 발생 시에는 판단 과정을 재현하는 데 쓰인다.
데이터 거버넌스에서는 정책 적용 시점의 중요성이 커지고 있다. 데이터의 AI 전달 전 접근권한 확인과 별도로, AI의 실제 정보 조회·판단 시점에도 정책 적용이 필요하다는 지적이다. 김용민 한국IBM CSE는 AI의 데이터 조회·판단 순간에 정책이 적용돼야 한다고 밝혔다.
이와 관련해 IBM은 데이터 생성 원천부터 관리하는 접근을 제시했다. 이 방식은 메타데이터·계보·정책의 데이터 동반 이동을 전제로 한다. 김용민 한국IBM CSE는 실시간 환경에서 데이터가 생성되면 즉시 AI 에이전트가 이를 읽고 판단하고 실행하는 만큼, 정책도 그 흐름에 맞춰 작동해야 한다는 취지로 설명했다.
김용민 한국IBM CSE는 거버넌스가 사후 점검에서 벗어나 데이터와 같은 속도로 움직이는 상시 체계로 전환될 필요가 있다고 밝혔다. 그는 거버넌스의 사후 점검 탈피와 데이터와 같은 속도로 움직이는 상시 체계화가 필요하다고 설명했다.
이 같은 흐름은 AI 레디에서 '에이전트 레디'로의 전환이라는 방향과도 맞닿아 있다. 가트너는 지난 8월 보고서 'AI 레디 데이터에서 에이전트 레디 데이터로의 확장(AI-Ready Data Needs to Expand to Agent-Ready Data)'을 발표했다. 가트너는 AI 에이전트 확산에 맞춘 기업 데이터 관리 체계의 확장이 필요하다고 주장했다.
가트너는 기존 AI 레디 데이터와 에이전트 레디 데이터의 차이를 검증 대상과 적용 범위의 확장이라는 흐름으로 제시했다. 가트너는 AI 레디 데이터와 에이전트 레디 데이터의 차이를 설명하는 기준으로 데이터 정렬·지속적 검증·거버넌스의 3가지를 제시했다.
기존 AI 레디 데이터는 특정 AI 활용 목적에 대한 적합성을 지속적으로 검증하는 개념이다. 반면 에이전트 레디 데이터는 여러 에이전트의 상호작용 전 과정에서 데이터의 신뢰성을 확인하는 방향으로 검증 범위를 확대하는 개념이다.
가트너는 에이전트 환경에서는 여러 에이전트 간 데이터 교환 시 의미와 맥락의 일치가 필요하다고 봤다. 또 각 에이전트의 판단과 작업 단계마다 데이터의 적합성을 확인할 필요가 있다고 설명했다.
이를 위해 가트너는 데이터를 사용하는 에이전트가 필요 조건을 명확히 정의할 것을 권고했다. 아울러 데이터 제공 측은 해당 조건을 충족했다는 사실에 대해 기계적으로 검증 가능한 증거를 제시해야 한다고 권고했다. 데이터 계약과 메타데이터는 이런 검증을 지원하는 수단이다.
가트너는 에이전틱 AI 활용에서 맥락·의미 관리가 중요하다고 밝혔다. 다만 가트너는 맥락·의미 관리만으로 데이터 준비 상태를 입증하기는 불충분하다고 봤다. 가트너는 데이터 요구사항을 에이전트 업무 흐름의 모든 단계에서 동적으로 정의·검증할 필요가 있다고 밝혔다.
AI 레디 데이터 구축은 실제 사업에서 다양한 형태로 진행되고 있다. 구축 방식으로는 현장 전문가의 경험을 데이터로 전환하는 방식이 있고, 여러 시스템에 분산된 업무 기록을 연결하는 방식도 있다. 사례로는 기존 AI 서비스의 검색 정확도를 개선하는 경우와 데이터 관리 체계를 정비하는 경우가 제시됐다.
대표 사례로는 빅밸류와 정부가 추진한 고병원성 조류인플루엔자(HPAI) 위험도 예측 사업이 있다. 빅밸류는 현장 방역 전문가의 역학 경험을 기반으로 감염 위험 관련 조건을 정의했다. 이어 해당 조건을 환경·방역·차량 이동 등 측정 가능한 변수로 구체화했다.
빅밸류는 과거 발생 사례를 활용했다. 또 해당 변수의 실제 발생 패턴 설명력을 검증했다. 이 사례는 방역 현장의 경험을 측정 가능한 변수로 바꾸고, 과거 사례를 통해 그 유효성을 검증하는 흐름을 보여줬다.
농지 정보와 실제 토지 이용 상태 간 불일치를 줄이기 위해 외부 공간정보로 보완이 이뤄지고 있다. 예측 결과와 방역관 현장 판단이 불일치할 경우에는 관련 데이터·변수를 재검토한다. 새 발생 사례와 현장 확인 결과를 지속 반영하는 작업도 함께 진행되고 있다.
빅밸류 관계자는 시스템 운영 중 매일 새 데이터를 수집하고 품질 검사를 진행한다고 밝혔다. 또 새 발생 사례를 반영해 모델을 재학습하고, 과거 발생 사례와 비교한 성능 검증 후 현장에 적용한다고 설명했다. 이어 방역관의 현장 확인 결과는 다음 학습에 반영된다고 전했다.
이와 함께 공공기관의 기존 데이터 품질관리 방식이 개선된 사례도 있다. 서울시설공단은 위세아이텍의 데이터 품질관리 솔루션 와이즈디큐를 도입했다. 이를 통해 상시 데이터 품질관리 체계를 구축했다.
서울시설공단의 사례는 공공데이터 품질관리 수준진단·평가 시점에 집중되던 관리 업무를 일상적 진단·개선 체계로 전환한 내용으로 제시된다. 사진 출처는 위세아이텍이다.
위세아이텍은 품질관리를 특정 평가 시기에만 수행하던 방식에서 상시 관리 체계로 전환한 의미가 있다고 설명했다. 또 이 같은 체계를 통해 향후 AI 활용에 필요한 원천데이터의 신뢰도를 지속 확보하는 기반으로 활용할 수 있다고 밝혔다.
이어 생성형 AI 서비스 고도화 과정에서 데이터 관리 기술을 활용한 사례로 데이터스트림즈가 수행한 한 공공기관 AI 검색서비스 고도화 사업이 제시됐다. 해당 기관은 기존에 RAG 기반 서비스를 운영했지만 법령·사규의 잦은 변경과 내부 데이터 구조의 복잡성으로 검색 결과의 최신성과 정확성을 유지하는 데 어려움을 겪었고, 단순 질의응답을 넘어 실제 업무로 연결하는 데도 한계가 있었다.
이에 데이터스트림즈는 데이터 기준을 정비하고 데이터 의미를 정비했으며, 품질 관리 체계와 메타데이터 관리 체계를 개선했다. 이후에는 데이터 간 관계를 활용하기 위한 벡터 DB·지식그래프 결합 그래프RAG(GraphRAG)를 적용했고, 랭그래프(LangGraph) 기반 AI 에이전트를 도입해 질의 분석, 정보 검색, 문서 작성, 기존 업무 시스템 연계로 기능 범위를 확대했다.
데이터스트림즈 관계자는 기존 단발성 질의응답형 AI가 업무 맥락 유지와 실제 결과 도출을 지원하는 AI로 발전하고 있다고 밝혔다. 또 AI의 고도화 방향은 AI 모델 고도화만이 아니라 데이터 패브릭과 데이터 품질, 거버넌스, 그래프RAG, 에이전틱 AI를 연결하는 데 있다고 설명했다.
플리토는 언어 데이터 구축·검증 기술을 바탕으로 산업 현장과 금융권에서 AI 통번역 서비스를 활용하고 있다. 플리토는 한화오션에 소음 제거 기능을 탑재한 AI 통번역 솔루션 '오톡'을 공급했으며, '오톡'은 고소음 환경을 지원하고 태국어·인도네시아어·베트남어를 포함해 최대 42개 언어를 지원한다. 또한 작업 지시와 보고를 지원하며, 플리토는 하나은행·우리은행을 포함한 국내외 10개 주요 금융사에도 AI 통번역 솔루션을 제공하고 있다.
엔코아는 여러 산업을 대상으로 AI 레디 데이터 구축 PoC와 프로젝트를 진행하고 있다. 엔코아는 데이터 거버넌스와 온톨로지의 기업 AI 사업 결합을 위해 한화시스템과의 전략적 협력 방향도 구체화하고 있다. 이와 함께 고객사 데이터 준비 상태를 먼저 진단하고, 실제 업무에 필요한 데이터의 의미와 관계를 구조화한 뒤, 구조화한 데이터를 AI 에이전트 등에 적용해 검증하는 방식으로 AI 레디 데이터 구축과 협력을 추진하고 있다.
엔코아 관계자는 온톨로지 확대 자체가 목적은 아니며, 고객 상담·재무 분석·제조 품질·설비 관리 등에서 명확한 업무 문제를 해결할 수 있는 최소 범위부터 검증할 필요가 있다고 설명했다.
지티원은 기존 데이터 관리 기술을 AI 활용 환경에 연결하는 방향으로 제품군을 발전시키고 있다. '디큐마이너(DQMiner)'는 오류 데이터를 진단·개선하고, '메타카탈로그(MetaCatalog)'는 정형·비정형 데이터의 통합 검색·관리를 지원하며, '메타마이너(MetaMiner)'는 표준용어·데이터 구조를 관리한다. 데이터호크는 데이터 흐름을 추적한다.
지티원 관계자는 회사가 개별 데이터 관리 기능 제공에 머무르지 않고 품질·맥락·식별·추적성의 연결을 추진하고 있다고 설명했다. 이어 AI의 기업 데이터 신뢰성 활용을 위한 AI 레디 데이터 거버넌스 기반을 구축하는 방향으로 기술을 발전시키고 있다고 밝혔다.
IBM 왓슨x.데이터는 데이터 패브릭·메타데이터·거버넌스·오픈소스 데이터 형식·하이브리드 인프라 통합을 통해 AI 활용을 지원하는 개요를 제시했다.
한국IBM은 록히드마틴의 여러 데이터 레이크와 46개의 데이터 관리·분석·비즈니스 인텔리전스(BI) 시스템을 단일 통합 플랫폼으로 대체한 사례를 소개했다. 이 과정에서 데이터 및 AI 도구를 50% 축소했고, 약 1만 명 엔지니어용 AI 개발·배포 가능 AI 팩토리를 구축했다. 김용민 한국IBM CSE는 이를 통해 전사 차원의 신뢰 가능한 데이터 기반을 마련했고 AI 응답 정확도도 20% 이상 향상됐다고 설명했다.
한국IBM은 동일한 데이터를 보유하는 것만으로는 AI 활용에 한계가 있다고 설명했다. 업무 판단 기준과의 연결이 없을 경우 AI 활용이 제약되고, 변화한 현장 상황이 반영되지 않을 경우에도 AI 활용이 제약된다고 봤다.
이에 따라 기업은 AI 활용 업무를 명확히 할 필요가 있으며, 필요한 데이터가 실제로 준비돼 있는지 확인하는 과정이 중요하다고 설명했다. 또 AI 레디 데이터 수준은 데이터 보유량보다 실제 업무 연결 역량에 좌우되며, 다양한 AI 서비스에서의 안정적 활용 역량에도 좌우된다고 밝혔다.
출처: 아이티데일리 (IT DAILY) · 양승갑 기자
원문: https://www.itdaily.kr/news/articleView.html?idxno=242092
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 아이티데일리 (IT DAILY)
원문 확인이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.