[강좌] AI는 정말 일을 끝냈을까
아이티데일리 (IT DAILY) ·
✦ AI 요약
전현상은 MS 글로벌 블랙 벨트팀에서 에이전트·지식 검색·AI 평가 체계의 운영 환경 정착 업무를 맡고 있다고 밝혔다.
그는 생성형 AI의 시연과 실무 사이에 성능, 비용, 청구서 간극이 있으며 이것이 도입의 큰 걸림돌이라고 짚었다.
이번 강좌는 그 간극을 측정으로 검증하기 위해 AI 청구서 분석과 AI 성과 채점을 공개 실험으로 진행한다고 설명했다.
[강좌] 'AI는 정말 일을 끝냈을까'는 마이크로소프트 글로벌 블랙 벨트팀의 AI 앱 솔루션 엔지니어 전현상이 [아이티데일리]에 연재를 시작하며 쓴 글이다. 전현상은 마이크로소프트(MS) 글로벌 블랙 벨트팀에서 에이전트·지식 검색·AI 평가 체계의 운영 환경 정착 업무를 수행하고 있다고 밝혔다.
전현상은 신호처리 연구 경력으로 시작해 신호처리 연구 이후 15년 이상 현장 경험을 쌓았다고 소개했다. 또 SK에서 1200만 사용자 규모 서비스 개발에 참여했고, SK에서 ML 플랫폼 구축 사업에도 참여했다고 밝혔다.
이어 아마존웹서비스(AWS)에서는 기업 AI 도입 지원을 담당했다고 설명했다. 이런 경력과 현재 역할을 바탕으로 실제 운영 환경에서 AI를 정착시키는 실무 경험을 토대로 연재를 시작한다고 밝혔다.
전현상은 생성형 AI가 시연 단계를 넘어 실제 업무 시스템에 도입 중이라고 진단했다. 다만 도입 현장에서는 가장 자주 들리는 말이 기대보다 걱정이며, 추론 모델 평가는 좋지만 비용 예측이 어렵고, 벤치마크 점수는 높지만 실제 업무 수행에는 한계가 있다는 반응이 빈번하다고 전했다.
그는 성능 지표와 청구서 사이 간극, 데모와 실무 사이 간극이 존재한다고 짚었다. 또 이 간극이 생성형 AI 도입의 가장 큰 걸림돌이라고 제시했다.
이번 강좌의 목적은 AI 활용의 간극 검증을 감각 아닌 측정으로 시도하는 데 있으며, 필자는 이를 위해 공개 실험 2갈래를 진행한다. 실험 1은 reasoning effort 단계별 조정을 바탕으로 동일 작업을 대상으로 품질·비용·응답 시간을 반복 측정하는 방식이며, 캐시·재시도·요금제 등 운영 변수의 청구서 영향이 어떻게 달라지는지까지 검토하는 AI 청구서 분석이다. 실험 2는 문서 작성·검토 등 실제 업무 과제에서 AI가 수행한 결과물을 채점하는 AI 성과 채점이다.
두 실험을 결합한 핵심 질문은 토큰 사용량 아닌 성과 1건 획득 비용이다. 이를 위해 모든 수치는 공개 저장소에 게시하며, 게시 범위에는 원자료·분석 코드·수정 이력이 포함된다. 목적은 누구나 같은 방법으로 재확인 가능하게 하는 데 있으며, 실패한 호출 기록과 빗나간 예상 기록도 유지한다.
이 글은 도입 검토 엔지니어·아키텍트와 예산 결정 관리자를 대상으로 한다.
목적은 슬라이드 대체와 검증 가능한 근거 제시 희망에 있다.
연재 구성을 제시한다.
8월호 주제는 추론 모델 비용 정당화 시점과 다단계 작업의 모델·강도 비교다.
9월호(이번호) 주제는 GDPVal RealWorks와 벤치마크 성공률과 실제 업무 성공 간 간극이다.
10월호 주제는 도구 호출 시 필요한 추론량과 에이전트 반복 루프와 숨은 비용이며, 11월호 주제는 GDPVal RealWorks와 파일 읽기 AI 채점기 신뢰도·비용이다.
12월호 주제는 추론 비활성화가 기본값으로 남은 이유와 짧은 사실형 작업과 PAYG·PTU 비용·처리량이다.
2027년 1월호 주제는 샌드박스·멀티모달·장시간 실행 환경 필요성과 두 실험군 종합이다.
이 글은 필자 개인 기술 기고이며 소속 회사 공식 입장을 대변하지 않는다. 수치 기준은 공개 저장소 게시 실험 결과[2][3]다.
지난호에서는 모델·추론 강도 선택에 앞서 업무의 합격선을 먼저 정하자고 제안했다. 정답이 1개인 작업은 검증이 비교적 쉽고, 예시 날짜 정답이 2026-04-05처럼 정해져 있으면 대조도 간단하다.
반면 엑셀·프레젠테이션 같은 문서·파일 생성 업무는 합격 판단이 더 복합적이다. 이런 작업의 판단 기준은 파일 생성 여부, 정상 열림 여부, 요청 내용 포함 여부, 현업 신뢰 사용 가능 여부의 4가지로 나뉜다.
이에 따라 AI 업무의 합격선 점검도 실행, 파일, 요구사항, 전문가 품질로 구분해 봐야 한다. 이는 AI 도구를 실무에 사용할 때 빈번하게 마주치는 장면과 맞닿아 있다.
실제로 보고서를 요청했는데 결과로 작성 계획만 반환되는 사례가 있고, PDF를 요청했는데 편집 중인 DOCX만 남는 사례도 있다. 문장이 매끄러워 보여도 숫자 출처를 추적할 수 없는 사례가 있으며, 재실행 시에도 동일한 빈칸이 발생하는 사례도 있다.
또 완료 표시가 점등된 뒤에도 사람의 후속 작업이 남는 경우가 있다. 이런 사례들은 단순한 실행 성공 표시만으로는 업무의 합격 여부를 가릴 수 없고, 앞선 기준을 단계적으로 확인해야 한다는 점을 보여준다.
첫 전체 실행 결과는 220개 중 219개 success였다. 그러나 219개 success 중 1개 과제에서는 요청한 엑셀이 없었고, 후속 실행에서 S&P 500 워크북을 확인한 결과 500개 회사 중 35개만 수록돼 있었다.
GDPVal RealWorks는 모델이 답을 맞히는지만 보는 방식에서 벗어나, 모델 응답 여부 집계보다 실제 업무 요청 수령 시 생성 파일·중단 지점·근거 기록을 관찰하는 데 출발점을 둔 평가다. 실험 목적은 모델 순위 산정이 아니며, 220개 업무 수행과 결과 파일 직접 확인이 이뤄졌다. GDPVal은 정답 한 줄 대신 업무 결과물 생성을 요구하는 실무형 평가 세트다.
오픈AI(OpenAI)는 미국 국내총생산 기여도 큰 9개 산업, 44개 직종에서 실제 업무와 유사한 과제를 모아 이 평가 세트를 만들었다. 전체 과제 수는 1320개다. 이 가운데 공개 범위는 전문가 제작 220개 과제와 채점 자료다.
이 평가 세트는 과제별로 참고 파일, 업무 상황, 세부 채점 기준을 제공하며, 법률 문서, 엑셀, 프레젠테이션, 도면, 보고서, 미디어를 요구 산출물 유형으로 둔다. 따라서 이 기록의 핵심은 점수 한 줄이 아니라 각 업무의 산출물과 수행 과정 확인이다.
이 시스템은 GDPVal RealWorks의 220개 업무 처리 과정을 별도로 기록하며, 설정 파일 기반으로 과제를 실행한다. 보관 항목은 모델 답변, 생성 파일, 오류, 재시도, 응답 시간, 자체 점검, 외부 채점 근거로 구성되며, 성공 집계 대상 직접 검증 목적의 구조를 갖췄다. 또 대시보드에서 숫자를 클릭하면 개별 과제·파일 단위로 확인할 수 있어 각 과제의 실행부터 평가 근거까지 따로 남기고 성공으로 잡힌 결과를 개별 파일 수준까지 확인할 수 있게 한다.
모델 호출에는 Microsoft Foundry에서 Azure에 배포한 모델을 사용하며, 여러 모델의 공통 엔드포인트 호출도 가능하다. 이는 이후 에이전트 기반 처리·모델 라우팅을 통한 실험 범위 확대를 용이하게 하기 위한 것이다. 다만 실행 완료·파일 검증·요구사항 확인·독립 평가를 분리하는 방식의 검증 구조는 특정 제품에 비종속적이며, 어떤 AI 플랫폼이든 결과물이 파일이면 동일한 질문이 가능하다.
2026년 3월, 첫 전체 실행 결과가 공개됐다. GPT-5.2 Chat·코드 실행 도구로 공개 과제 220개를 처리했으며, 운영 상태상 success에 도달한 과제는 219개였고 오류는 1개였다. 재시도 경험 과제는 21개였으며 운영 성공률은 99.5%였다.
파일이 필요한 과제는 185개였다. 이 가운데 파이프라인 파일 생성 성공 상태를 통과한 과제는 184개였다. 평균 응답 시간은 39.1초였다.
다만 같은 결과를 모델이 스스로 점검한 Self-QA 평균은 5.54/10으로 집계됐다. Self-QA는 산출물 생성 모델의 원요청·자기 결과 대조 기반 내부 점검 점수이며, 모델 자체 점검 점수 수준은 중간이었다. 이에 따라 운영 성공률과 내부 품질 점검 수준은 서로 다르게 나타났다.
Self-QA의 용도는 이상 조기 탐지다. 이 지표는 독립 평가자 품질 점수가 아니며, 현업 전문가 품질 점수도 아니다.
낮은 점수 과제 1건 대시보드 확인 결과, 대상 과제는 재무관리였고 상태 표시는 success였다. 그러나 상태 표시와 실제 산출물 사이의 차이를 직접 열어 확인한 결과 생성 파일 수는 0개였고, Self-QA는 2/10이었다.
점검 기록 내용에는 요청한 엑셀 워크북 없음이 남아 있었고, 설명 내 자리표시자 문장 잔존 상태도 확인됐다. 작성된 Python 코드도 필요한 계산표 생성 실패 상태였다. 파일 확인 결과로는 네 가지 미완성이 발견됐다.
이후 전체 실행 관찰은 실제 산출물 검수까지 하향하는 방식으로 진행됐다. 실행 상태 집계 후 이상 신호 탐지를 했고, 이후 파일·로그 분석을 진행했으며, 관찰 기준 보완 후 대표 산출물 직접 확인으로 이어졌다. 이 과정에서 과제별 실행 기록·자체 점검 로그 열람도 이뤄졌다.
그 결과 큰 오류보다 끝난 듯 보이는 미완성이 더 자주 포착됐다. 이는 치명적 오류보다 완료처럼 보이지만 미완성인 사례가 더 자주 드러났다는 흐름으로 확인됐다.
한편 99.5%는 틀린 수치 아님으로 제시됐다. 다만 99.5%의 기준은 전문가가 일을 받아 바로 쓸 수 있는가가 아니었고, 99.5%가 답한 질문은 파이프라인 종료 상태 도달 여부였다.
초기 관찰로는 파일 형식 불일치가 확인됐다. 요구 형식은 PDF였지만 생성물은 DOCX 또는 PPTX인 경우가 있었고, 요구 결과물은 최종 음원·영상이었지만 반환물은 제작 계획·소스 파일에 그친 사례도 있었다. 변환·렌더링은 겉보기엔 마지막 단계처럼 보이지만 수신자 기준으로는 업무 범위에 포함되며, 결과물은 미제공한 채 계획만 반환한 사례도 나타났다.
이와 함께 일부 응답은 시트·계산표·문서 목차를 어떻게 구성할지에 대한 설명은 명확했지만 실제 파일 내용에는 자리표시자가 잔존하거나 미완성 코드가 남아 있었다. 이는 무엇을 할지 설명하는 능력과 실제 완료 능력 사이의 차이를 보여주는 유형으로 정리된다.
또 다른 문제는 겉모양은 그럴듯하나 근거 없는 결과물이다. 보고서·표는 전문적으로 보이는 외형을 갖췄지만 내부에는 예시 숫자가 사용되거나 확인되지 않은 정보가 실제 데이터를 대체한 경우가 있었다. 이런 결함은 문법 오류보다 발견이 어렵고, 별도로 글 가독성뿐 아니라 중요한 숫자 추적 가능성, 가정 추적 가능성, 인용의 원자료 추적 가능성까지 점검할 필요가 있다.
파일 1개 개방만으로 업무 묶음 전체 완성 보장 안 된다. 보고서 정상이어도 동반 워크북 누락 가능하고, 프레젠테이션 정상이더라도 하위 분석 파일 부재 가능하다. 파일 유효성과 업무 묶음 완전성은 별개 조건이다.
재시도도 만능은 아니다. 형식 오류·일시적 실행 문제는 재실행으로 수정 가능하지만, 원자료 미독해 경우에는 재시도 시 동일 실수 반복이 가능하다. 최종 렌더링 도구 부재 경우에도 재시도 시 동일 실수 반복이 가능하고, 요구 산출물 오해 경우에도 재시도 시 동일 실수 반복이 가능하다.
이 때문에 재시도 전 실패 원인 분류가 필요하다. 실패 원인 분류 항목은 파일 누락, 잘못된 형식, 빈 계산 범위, 근거 없음이다.
마지막으로 성공 숫자 외부 관찰을 시작했다. success 지표 폐기는 불필요하지만, success 숫자가 답하는 질문 범위는 축소된다. 판독 신호는 실행 종료 여부, 예상 파일 존재·개방 가능 여부, 모델 자체 점검 지적 사항, 독립 평가 존재 여부로 분리해 보고, 결과 단일 칸 통합은 배제한다. 미확인 품질은 미확인 상태로 유지한다.
90.9%는 두 번째 초록불이다. 2026년 7월의 후속 실행 exp026에는 sandbox, 문서·데이터 도구, 파일 종류별 기본 검사가 포함됐다. sandbox는 생성 코드의 다른 시스템과 분리 실행 공간이다. 기본 검사는 파일 존재, 크기, 형식, 열기 여부, 시트 수 또는 페이지 수 등 구조를 확인하는 방식으로 산출물의 실행 가능성과 구조를 먼저 살폈다.
다만 이 단계의 검사는 파일 열기 가능 여부와 형식 적합 여부를 보는 수준이다. 파일 열기 가능 여부와 내용의 시장 데이터·분석 판단 정확성은 별개다.
또한 2026년 3월의 첫 실행 exp010과 2026년 7월의 후속 실행 exp026의 관계는 조건 하나만 바꾼 인과 실험이 아니다. exp010·exp026은 모델, 프롬프트, 도구, 실행 환경 모두 상이하다. 따라서 99.5%와 90.9%를 직접 비교해 성능 상승·하락을 판단할 수 없다. 두 수치는 서로 다른 조건에서의 관측 기록이다.
exp026의 전체 실행 결과는 220개 과제 중 200개 success, 14개 qa_failed, 6개 error였다. qa_failed는 실행 완료했으나 자체 점검 기준 미달을 뜻한다. 재시도 과제 수는 105개로, 적어도 1회 재시도했다. Self-QA 대상은 214개 결과였고 Self-QA 평균은 6.24/10이었다.
90.9%는 전문가 즉시 사용 가능 결과 비율을 뜻하는 것이 아니라 후속 실행 exp026의 상태 규칙 통과 비율을 가리킨다. qa_failed도 외부 전문가의 실패 판정을 의미하는 것이 아니라 산출물 생성 모델의 자체 점검이 설정 기준을 통과하지 못한 상태를 뜻한다. 상태 값과 전문가 품질 점수는 별개이며, 당시에는 독립 외부 품질 평가에 관한 공개 자료가 부재했다.
exp026의 실행 상태 분포는 success 200개, qa_failed 14개, error 6개다. 따라서 90.9%와 qa_failed를 전문가의 외부 품질 판단으로 해석해서는 안 된다는 구분이 필요하다.
공개 대시보드는 두 번째 초록불을 산업별 성공률과 Self-QA로 분리해 확인할 수 있도록 하고, 단일 수치에서 산업별 차이를 확인할 수 있게 하며, 개별 과제로 하향 확인도 가능하게 한다. 2026년 8월 13일 시점의 GDPVal RealWorks 공개 대시보드 exp026 산업별 화면은 전체 성공률을 산업별 성공률과 Self-QA로 분리 제공하고, 표·차트에서 개별 과제로 추가 하향할 수 있는 기능을 제공했다. 해당 URL은 https://hyeonsangjeon.github.io/gdpval-realworks/experiments/exp026 다.
작성자는 220개라는 총량만으로 판단하는 해석을 지양하기 위해 대시보드에서 실제 파일 2개를 직접 확인했다. 확인 대상은 금융·투자 분석가 직군 산출물이었으며, 사례 1은 S&P 500 분석 워크북, 사례 2는 라틴아메리카 핀테크 전략 브리핑이었다. 두 사례는 전체 220개를 대표하는 표본은 아니었다.
이들 사례의 선정 이유는 '완료'에 포함된 단계 중첩을 점검하기 위해서였다. 작성자는 완료로 집계된 작업 안에 어떤 세부 단계가 들어 있는지 확인하는 차원에서 두 결과물을 골라 열어봤다.
첫 사례로는 첫 과제 업무 시점인 2025년 4월 11일의 과제가 제시됐다. 당시 첫 과제 역할은 주식자본시장(ECM) 투자은행 분석가였고, 요청 과업은 공개 웹 데이터 기반 S&P 500 전체 기업 정리 엑셀 작성이었다.
이 엑셀은 정렬 가능해야 했고, 포함 항목으로는 과거 12개월 주가수익비율(P/E), 향후 12개월 주가수익비율(P/E), 배당수익률, 연간 주당순이익(EPS), 분기 주당순이익(EPS), 시가총액, 회사 수, 종목별 지수 비중, 하위 업종별 지수 비중이 제시됐다. 자료 용도는 선배·고객의 업종 밸류에이션 비교 검토였으며, 비교 기준은 역사적 평균 대비 비싼 업종·싼 업종 파악이었다. S&P 500 워크북의 진행 상태는 35개에서 중단으로 언급됐다.
처리 절차상 누락 없어 보였고, 시스템의 산출물 형식 분류는 .xlsx였다. 외부 시스템과 분리된 Docker 환경에서 pandas와 표와 엑셀을 다루는 Python 라이브러리인 openpyxl을 사용해 생성 파일명 sp500_pe_deep_dive.xlsx가 만들어졌다. 기본 검사 항목인 파일 존재 여부, 파일 크기 0 초과 여부, 엑셀 파서로 열림 여부를 모두 확인한 결과 파일은 정상 열림 상태였고, 분석 워크북 형태 충족으로 판단됐다.
워크북은 시트 수 5개로 확인됐고, 시트 구성에는 Company Detail, 하위 업종·업종 요약, Read Me, Data Provenance가 포함됐다. 또 필터 적용과 첫 행 고정 적용도 돼 있어 엑셀 편의 설정을 갖춘 상태였다. 그러나 실제 내용 점검에서는 Company Detail의 고유 종목 수가 35개에 그쳐 요청 수량 대비 비율이 500개 중 7%로 집계됐고, 수식 셀 수는 0개였다. 공개 시장 데이터 출처 확인도 불가했다.
아울러 업종 분류에는 NVIDIA가 헬스케어·제약으로, JPMorgan이 유틸리티·전력으로 들어간 항목도 있었다. 그럼에도 파일 열림 상태에서 465개 회사 누락 경고 부재가 확인됐다.
이전 과제는 1회 재시도 후에도 qa_failed 상태였다. Self-QA 점수는 2/10이었다. Self-QA에서는 회사 수 부족, 업종 분류 오류, 공개 웹 데이터 미사용·임시 데이터 포함이 지적됐다. 자체 점검은 문제를 정확히 식별했다.
해당 결과물은 파일 생성 검사 통과 결과물이었고 파일 열기 검사 통과 결과물이기도 했다. 그러나 결과물의 업무 핵심 범위는 공란이었다.
이어 두 번째 과제는 라틴아메리카 진출 소비자 인터넷 기업 대상 핀테크 전략 브리핑이었다. 관점은 투자은행에서 고객 관계·거래 담당 매니징 디렉터였다. 브리핑 내용은 거시 환경 정리, 기술·벤처 시장 정리, 핀테크 지형 정리로 제시됐다. 분량은 약 30장이었고, 고객 회의용 산출물로 파워포인·PDF 동시 제작이 요구됐다.
생성물은 32장 PPTX와 32쪽 PDF였다. 두 파일 모두 정상 열림 상태였고 빈 페이지는 없었다. 구성은 시장 개요→국가 우선순위→핀테크 가치사슬→실사 질문 순이었다. Self-QA 점수는 9/10이었고 실행 상태는 success였다.
같은 금융·투자 분석가 직군의 두 산출물을 비교한 결과, 문서는 기본 구조 완성과 문서 한계 명시를 통해 기본 틀은 갖췄지만 고객 전달 준비 미완료 상태로 평가됐다. 파일 열림 여부, 요구 범위 충족 여부, 전문가의 신뢰·실사용 여부는 서로 다른 단계라는 점도 함께 구분됐다.
방법론 페이지 총 32번째 마지막 페이지에서는 실행 환경에서 실시간 인터넷 데이터 사용 불가가 명시됐다. 이에 따라 고객 제시 전 보강 필요 항목으로 최신 자금조달 통계, 상장사 비교, 국가별 규제 동향이 제시됐다.
이와 별도로 별도 전문가 검토 필요 사항으로는 주요 주장 최신성, 출처 최신성, 국가 우선순위 타당성, 실제 회의 활용 신뢰성이 남았다. 이는 문서의 기본 구조 완성과 한계 명시와는 별개로, 고객 제시 이전에 추가 검토가 필요한 영역으로 정리됐다.
자기평가에서는 2/10 평가가 명백한 결함 적절 지적을 보여 줬고, 9/10 평가는 자기 결과를 일관된 문서로 판단한 것으로 나타났다. 다만 양쪽 평가 모두 독립 평가 대체 불가라는 점이 확인됐다.
완료 여부는 단일 상태로 판정할 수 없고 완료 판정 불가라는 전제 아래, 완료 확인에는 최소 네 차례가 필요하다. 이 순서는 S&P 500 워크북 상태 판단에 적용된다.
1단계 기준은 실행 완료 여부, 오류 없음, 종료 상태 확인이다. 2단계 기준은 요청 형식 파일 존재 여부와 정상 개방 여부 확인이다.
3단계 기준은 요구사항 충족 여부 점검이다. 요구사항 항목은 필요한 항목 수, 데이터, 계산식, 출처, 문서 구조다.
4단계 기준은 전문가 품질 검토다. 전문가 품질 검토자는 내용을 이해한 사람이며, 전문가 품질 검토 항목은 정확성과 유용성이다. 전문가 품질 기준은 업무 인수 후 사용 가능 여부다.
이 기준으로 보면 S&P 500 워크북은 실행 완료 상태이고 파일 개방 가능 상태여서 앞의 두 단계는 통과했다. 그러나 핵심 요구 미충족 상태이며, S&P 500 워크북 핵심 요구는 500개 회사와 검증된 시장 데이터다. 또한 전문가 품질 미확인 상태다.
핀테크 브리핑은 파일 구조 통과 상태다. 다만 최신 근거 미확인 상태이고 전략 판단 미확인 상태여서, 구조 확인은 됐지만 최신 근거와 전략 판단은 아직 검토되지 않았다.
Self-QA는 네 단계와 분리된 보조 신호로 다뤄야 한다. Self-QA의 장점은 적은 비용으로 문제 후보를 신속 탐지할 수 있다는 점이지만, 한계는 동일 모델의 자기 응답을 검사하는 방식이어서 독립성이 없다는 데 있다. 이 때문에 자체 점검과 외부 평가의 동일 점수 열은 통합하면 안 되며, 동일 점수 열을 통합할 경우 관측값과 추정값이 재혼합된다.
현업에서 확인할 사항은 다섯 가지이며, 시작점은 산출물 계약이다. 산출물 계약은 모델이 반드시 남길 결과물·통과 조건 목록을 뜻한다. 업무 파일 생성 전에 사전 규정해야 할 대상은 파일 종류·개수, 필수 시트·페이지, 필요한 항목 수, 데이터 기준일, 출처, 계산식이다.
이 사전 규정 조건의 성격은 기계적 확인 가능이어야 한다. 좋은 보고서보다 PDF 1개, 20쪽 이내, 표 3개, 모든 숫자에 출처라고 정하는 편이 검사하기 쉽다.
실행 상태는 구분 저장해야 한다. 구분 저장 대상은 실행 오류, 재시도, 파일 생성, 파일 열기, 자체 점검, 독립 채점이다. 실행 상태를 하나의 성공 열로 합치지 않아야 하며, 그 이유는 초록불의 확인 단계를 설명할 수 있기 때문이다.
문서는 파일 종류와 제출 형태에 맞춰 점검 기준을 달리해야 한다. 검사 항목은 파일 형식별 상이하며, 엑셀 점검 요소는 시트 이름·행 수·수식·합계·출처이고 프레젠테이션 점검 요소는 슬라이드 수·빈 페이지·주요 주장·최신 근거다. 오디오·영상 점검 요소는 파일 존재 여부 외 길이·코덱·샘플링·최종 렌더 여부이며, 여러 파일 요구 업무에서는 묶음 전체 존재 여부 점검과 파일 간 정합성 점검도 필요하다.
이후 재시도는 진단으로 원인을 구분한 뒤 진행해야 한다. 재시도 실행 시점은 진단 종료 후이며, 수정 방법은 누락 파일·형식 오류·빈 계산 범위·근거 부재에 따라 상이하다. 원인 미확정 상태의 동일 요청 반복은 비용·시간 증가 가능성이 있고 동일 결함 잔존 가능성도 있다.
품질 판단과 지표 집계가 왜곡되지 않도록 확인된 사실과 아직 확인하지 못한 부분을 나눠 기록해야 한다. 끝까지 확인 불가한 품질은 미확인 처리해야 하며, 파일 열림만으로 내용 정확성까지 성공 처리 금지이고 외부 평가 부재만으로 실패 처리 금지도 필요하다. 관찰 사실과 미확인 부분 분리 필요성이 제기되며, 관찰 사실과 미확인 부분 분리는 대시보드 숫자 정직성 확보와도 연결된다.
결론은 초록불이 인수인계 시작이라는 점이다. 벤치마크 성공률 자체는 문제가 아니며, 문제 조건은 단일 수치에 과도한 질문이 집중될 때다. 99.5%·90.9%는 각 실행의 운영 상태 판독에 유용하다.
다만 파일 완전성을 설명하려면 별도 근거가 필요하고, 요구사항 충족을 설명하려면 별도 근거가 필요하며, 전문가 품질을 설명하려면 별도 근거가 필요하다. 성공률 수치는 운영 상태를 읽는 데는 도움이 되지만 산출물의 완전성·요구 충족·전문가 수준 판단까지 대신할 수는 없다.
이에 따라 GDPVal RealWorks에서 가장 유용한 단서는 높은 성공률 자체보다 파이프라인 상태·실제 파일·모델 자체 점검의 불일치 지점이다. 이 불일치 지점을 바탕으로 파일 검사 투입 위치, 출처 확인 투입 위치, 차단할 재시도, 전문가 인계 대상을 결정할 수 있다.
AI 산출물이 사람의 일과 유사해질수록 완료는 결승선보다 인수인계에 가까워진다. 초록불의 의미도 변화한다. 초록불은 이제 믿어도 된다는 의미가 아니며, 남은 사항을 확인하라는 신호다.
다음 호에서는 검색·계산기 등 외부 도구 사용 AI 에이전트의 추론·반복 호출 비용을 다룰 예정이며, 이어지는 GDPVal RealWorks 편에서는 220개 파일 전수 확인 부담 감소 목적의 파일 읽기 AI 채점기를 다룬다. GDPVal RealWorks 편의 검토 항목은 항목별 적합도 차이와 신뢰도·비용이다.[6][7]
이 글의 범위는 220개 전체의 전문 품질 순위를 작성하는 데까지는 미치지 않는다. 분석 방식은 서로 다른 조건의 두 실행을 시간 순서대로 검토하는 것이며, 직접 열람 범위는 같은 직군 산출물 2개다. 제한점은 두 사례의 전체 결과 대표성 없음이다.
엑셀·프레젠테이션 검사 기준은 파일 구조·가시적 요구사항 중심이다. 금융 분석 정확성의 독립 전문가 검증 결과는 당시 공개 근거 부재 상태였고, 금융 분석 정확성 상태도 미확인이다.
따라서 90.9%에 대해서는 모델 일반 성능으로의 확대 해석을 해서는 안 되며, 90.9%의 실제 업무 자동화율 확대 해석도 금지된다.
참고 문헌 3건을 제시했다.
첫 번째 항목은 아이티데일리 기사 '추론 모델은 언제 제값을 할까'로, 날짜는 2026-07-29이며 URL은 https://www.itdaily.kr/news/articleView.html?idxno=240660이다.
두 번째 항목은 OpenAI 문서 'Measuring the performance of our models on real-world tasks'로, 날짜는 2025-09-25이며 URL은 https://openai.com/index/gdpval/이다.
세 번째 항목은 Patwardhan et al. 논문 'GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks', arXiv:2510.04374, OpenAI GDPVal public dataset으로 구성됐으며 URL은 https://huggingface.co/datasets/openai/gdpval이다.
GDPVal RealWorks 관련 공개 자료로는 GDPVal RealWorks 공개 저장소와 GDPVal RealWorks 근거 대시보드가 있으며, 공개 저장소 URL은 https://github.com/hyeonsangjeon/gdpval-realworks 이고 근거 대시보드 URL은 https://hyeonsangjeon.github.io/gdpval-realworks/ 이다.
이어 특정 실행 사례 가운데 첫 전체 실행 exp010 보고서가 존재하며, exp010 보고서 기준 commit은 d8b74ae 이다. exp010 보고서 URL은 https://github.com/hyeonsangjeon/gdpval-realworks/blob/d8b74ae4a13bb10d3e9e02eb4c7d7a485ecc6ad1/batch-runner/results/exp010_GPT52Chat_resume2_elicit_v2/report/report.md 이다.
또 다른 실행 사례로 exp026 실행 보고서가 존재하며, exp026 보고서 기준 commit은 52e38e1 이다. exp026 보고서 URL은 https://github.com/hyeonsangjeon/gdpval-realworks/blob/52e38e172d664155f0fb90f94daa14c2667c86de/batch-runner/results/exp026_sandbox_skills_multimodal/report/report.md 이다.
exp026 성공 단계를 뒷받침하는 근거 대상으로는 계약 및 고정 산출물 존재가 제시됐다. 이 근거는 관련 commit 85e21b3와 관련 revision 47aed3c에 연결되며, 출처로는 근거 문서 위치인 https://github.com/hyeonsangjeon/gdpval-realworks/blob/85e21b30dc02c624c303c56f51a4d4ee9a54e047/data/notes/success-layers.yaml과 관련 데이터셋 위치인 https://huggingface.co/datasets/HyeonSang/exp026_sandbox_skills_multimodal/tree/47aed3c0b13eaa90eb02803bec9d5c75e559f416가 제시됐다.
출처: 아이티데일리 (IT DAILY) · 전현상
원문: https://www.itdaily.kr/news/articleView.html?idxno=241294
참고자료
이 기사는 자동생성 알고리즘의 도움을 받아 작성되었습니다.
출처 아이티데일리 (IT DAILY)
원문 확인이 기사는 아이티데일리 (IT DAILY) 원문을 바탕으로 비즈크러시가 요약 정리했습니다. 정확한 인용과 세부 내용은 원문을 확인해 주세요.