logo
|
Blog
  • 전체IT·통신금융제조·물류커머스공공·교육엔터테인먼트
  • 인사이트팀 문화뉴스
  • 홈페이지
데이터고객 성공사례

기술 도면, 어떻게 챗봇 검증 데이터로 바꿨을까: Golden Set 구축기

기술 도면에 흩어진 식별 정보와 속성, 객체 간 연결 관계를 구조화해 약 5.5만 건의 관계형 Golden Set을 구축한 과정을 소개합니다. 가변형 데이터 구조 설계부터 전문가의 판단 기준을 AI 검증 데이터로 전환한 방법, 구축 과정에서 마주한 문제와 해결 원칙까지 살펴봅니다.
TEXTNET's avatar
TEXTNET
Sep 20, 2026
기술 도면, 어떻게 챗봇 검증 데이터로 바꿨을까: Golden Set 구축기
Contents
핵심 과제 : 어떻게 전문가의 판단을 데이터로 구조화할까핵심 방법론: 가변형 데이터 구조 설계이슈 대응 : Golden Set 구축 과정에서 마주한 3가지 문제자동 추출만으로 정확도를 확보하기 어려웠습니다자료가 순차적으로 들어와도 작업이 멈추지 않아야 했습니다실제 도면을 적용할수록 새로운 예외가 나타났습니다실행 전략 : 전문가의 판단 기준을 작업 기준으로 전환구축 결과 : 단계적 검증을 거친 5.5만 건의 Golden Set마치며 : 좋은 Golden Set은 ‘정답’만 모아놓은 데이터가 아닙니다

기술 도면처럼 전문 문서를 활용하는 AI 시스템의 품질을 검증하려면 ‘정답’ 역할을 하는 데이터가 필요합니다. 그런데 정답이 문장이나 텍스트로 명확하게 정리되어 있지 않다면 어떨까요?

기술 도면에서는 하나의 답을 찾기 위해 도면 곳곳에 흩어진 식별 정보와 세부 속성, 객체 간 연결 관계를 함께 살펴봐야 하는 경우가 많습니다. 여기에 해당 정보를 어떻게 해석할지 결정하는 전문가의 판단도 필요합니다. 이런 정보를 AI가 제대로 찾고 답했는지 검증하려면 도면의 텍스트를 그대로 추출하는 것만으로는 부족합니다.

TEXTNET은 AI 시스템 평가를 위해 비정형 기술 도면과 전문 문서에 담긴 정보를 구조화해 약 5.5만 건 규모의 관계형 Golden Set을 구축하는 프로젝트를 수행한 경험이 있습니다. 이번 글에서는 TEXTNET이 기술 도면을 Golden Set으로 만들기 위해 어떤 데이터 구조를 설계했는지, 실제 구축 과정에서는 어떤 문제를 마주했고 어떻게 해결했는지 소개하겠습니다.

핵심 과제 : 어떻게 전문가의 판단을 데이터로 구조화할까

기술 도면과 전문 문서를 활용하는 AI 시스템에서는 일반적인 텍스트 정답만으로 결과의 정확성을 검증하기 어렵습니다. 이유는 전문가가 도면에서 답을 찾는 방식에 있습니다.

전문가는 특정 문구나 숫자 하나만 보고 답을 판단하지 않습니다. 어떤 객체에 대한 정보인지 확인하고, 해당 객체의 세부 속성과 조건을 살펴본 뒤, 주변의 다른 정보와 어떻게 연결되어 있는지까지 종합적으로 확인합니다.

Golden Set 역시 단순히 정답 문장을 모아놓는 방식으로는 만들 수 없습니다. 챗봇이나 검색·파싱 알고리즘이 필요한 정보를 제대로 찾고 구조화했는지 정량적으로 평가할 수 있는 기준점이자, 실제 질의 상황을 기준으로 결과를 검증할 수 있는 Baseline 데이터가 필요했습니다.

어떤 정보가 무엇과 연결되어 있고, 그 관계를 어떤 기준으로 판단해야 하는가.

이번 프로젝트의 핵심은 전문가가 기술 도면을 읽고 답을 도출하는 판단 구조 자체를 AI의 결과와 비교할 수 있는 데이터로 만드는 것이었습니다. 이를 위해 TEXTNET은 모든 도면을 하나의 고정된 양식에 맞추는 대신, 공통적인 데이터 구조를 유지하면서도 도면의 정보 유형과 복잡도에 따라 필요한 항목을 추가하거나 줄일 수 있는 가변형 컬럼 구조를 설계했습니다.

실제 고객사의 도면 및 데이터와 무관합니다

핵심 방법론: 가변형 데이터 구조 설계

비정형 전문 문서를 데이터로 만들 때 모든 문서에 동일한 양식을 적용하면 문제가 생길 수 있습니다. 문서마다 담고 있는 정보가 다르고, 정보 사이의 관계도 다르기 때문입니다. 어떤 문서에서는 사용하지 않는 컬럼이 생기는 반면, 복잡한 문서에서는 기존 컬럼만으로 필요한 정보를 충분히 담지 못할 수도 있습니다.

그래서 이번 프로젝트에서는 도면에 있는 정보를 그대로 옮겨 담는 방식으로 데이터 구조를 만들지 않았습니다. 대신 먼저 AI의 결과에서 무엇을 검증해야 하는지 정하고, 그 검증에 필요한 정보를 기준으로 데이터 구조를 설계했습니다.

📌Golden Set을 구성하는 5가지 데이터 요소

구성 요소

역할

검증 관점

식별 정보(Tag)

문서 내 특정 객체나 정보를 구분하기 위한 기준

무엇에 대한 정보인가

세부 속성(Spec)

해당 객체를 설명하는 세부 정보

어떤 속성을 가지고 있는가

추출 값(Value)

실제 문서에서 확인한 텍스트 또는 값

무엇이 실제로 기재되어 있는가

연관 관계(Relation)

서로 다른 정보 사이의 연결 관계

어떤 정보와 어떻게 연결되는가

입력 규칙(Rule)

동일한 기준으로 구축하기 위한 판단·표기 규칙

어떤 기준으로 정답을 판정하는가

중요한 것은 각각의 정보를 따로 기록하는 데 그치지 않는다는 점입니다. 예를 들어 도면에서 특정 값을 찾았다면 그 값만 Golden Set에 넣는 것이 아니라, 그 값이 어떤 객체의 정보인지, 어떤 속성을 나타내는지, 다른 정보와 어떤 관계를 맺고 있는지까지 함께 구조화했습니다. 또한 이렇게 정의한 정보 구조를 AI의 검색·파싱 결과와 비교할 수 있도록 맞춰, 단순 문자열 일치 여부를 넘어 정보 항목과 관계 단위로 결과를 검증할 수 있도록 설계했습니다.

예를 들어 AI가 도면에 있는 특정 값을 제대로 찾았는지만 확인하는 것이 아니라 아래 내용까지 하나의 검증 체계 안에서 확인할 수 있도록 했습니다.

  • 올바른 대상에서 찾은 값인지

  • 필요한 속성까지 함께 찾았는지

  • 다른 정보와의 관계를 정확하게 연결했는지

이를 위해서는 Golden Set과 검증 대상이 되는 AI의 출력 결과를 가능한 한 같은 정보 단위로 비교할 수 있도록 구조를 맞추는 것이 중요했습니다.

모든 문서에 동일한 컬럼을 강제로 적용하지 않은 것도 같은 이유입니다. 공통적으로 필요한 정보 체계는 유지하되, 도면의 복잡도와 정보 유형에 따라 필요한 속성과 관계 항목을 추가하거나 제외할 수 있도록 설계했습니다. 동시에 여러 작업자가 같은 데이터를 보고 서로 다르게 판단하지 않도록 각 항목의 입력 조건과 표기 방법도 세부 규칙으로 만들었습니다.

📌

도면별 컬럼 예시

평면도
식별 정보(Tag) / 세부 속성(Spec) / 추출 값(Value) / 입력 규칙(Rule)

단면도
식별 정보(Tag) / 세부 속성(Spec) / 추출 값(Value) / 연관 관계(Relation) / 입력 규칙(Rule)

구조도
식별 정보(Tag) / 세부 속성(Spec) / 추출 값(Value) / 연관 관계(Relation) / 입력 규칙(Rule) + α
* α에는 특정 도면에서만 등장하는 정보값이 속함

이해를 돕기 위해 작성한 예시로, 실제 도면별 데이터와 무관합니다.

이 과정에서 가장 중요했던 원칙은 명확했습니다.

비정형 문서를 데이터화할 때는 문서에 무엇이 있는지보다, 최종적으로 무엇을 검증할 것인지부터 정해야 한다는 것입니다.

검증 항목이 명확해야 어떤 정보를 데이터로 만들어야 하는지, 정보 사이의 관계를 어떻게 표현해야 하는지를 결정할 수 있습니다. 그리고 이 구조가 정해져야 여러 작업자가 동일한 기준으로 데이터를 구축할 수 있는 작업 규칙도 만들 수 있습니다.

이슈 대응 : Golden Set 구축 과정에서 마주한 3가지 문제

데이터 구조를 설계했다고 바로 대규모 구축에 들어갈 수 있었던 것은 아닙니다. 실제 도면에 구조와 규칙을 적용하고 구축 범위를 확대하면서 자동 추출의 정확도, 자료 확보 시점, 문서마다 다른 구조와 복잡도 같은 문제가 나타났습니다.

자동 추출만으로 정확도를 확보하기 어려웠습니다

기술 도면은 일반적인 텍스트 문서와 다릅니다. 문자뿐 아니라 기호와 선, 객체의 위치와 배치, 서로 연결된 상태에 따라 의미가 달라집니다. 초기에는 실제 데이터 구축에 OCR과 자동 추출 방식을 활용할 수 있는지 검토했습니다. 하지만 이미지 품질이 낮거나 여러 정보가 한 영역에 밀집된 도면에서는 자동 추출만으로 필요한 정확도를 확보하기 어려웠습니다.

특히 이번에 구축하는 데이터는 AI를 평가하는 기준이 되는 Golden Set이었습니다. 기준 데이터가 잘못되면 AI의 결과가 맞는지 틀리는지도 정확하게 판단하기 어렵습니다. 그래서 자동화 방식보다는 전담 인력이 도면을 직접 확인해 데이터를 구축하는 방식으로 진행했습니다.

도면에 적힌 텍스트뿐만 아니라 객체의 배치와 연결 관계, 주변 정보와 앞뒤 맥락까지 함께 살펴보며 데이터를 정제했습니다. 자동화율을 높이는 것보다 AI 평가의 기준이 되는 데이터의 정확성과 신뢰도를 확보하기 위한 결정이었습니다.

자료가 순차적으로 들어와도 작업이 멈추지 않아야 했습니다

대규모 데이터 구축 프로젝트에서는 필요한 자료가 시작 시점에 모두 준비되지 않는 경우가 많습니다. 특정 자료가 늦게 들어올 때마다 전체 작업이 멈춘다면 일정에 문제가 생길 수 있습니다. 이번 프로젝트에서는 이런 영향을 줄이기 위해 작업 대상을 서브셋(Subset) 단위로 나눴습니다.

먼저 확보된 자료부터 독립적으로 작업을 시작하고, 각 데이터의 특성과 난이도에 따라 작업 순서와 투입 리소스를 조정했습니다. 이를 통해 일부 자료의 확보 시점이 달라져도 전체 공정이 함께 지연되지 않도록 했고, 입력 자료의 변동이 전체 일정에 미치는 영향을 최소화했습니다.

실제 도면을 적용할수록 새로운 예외가 나타났습니다

초기에 데이터 구조와 작업 규칙을 만들었지만, 구축 범위가 넓어지면서 기존 규칙만으로 처리하기 어려운 유형도 나타났습니다. 같은 종류의 기술 문서라도 담고 있는 정보의 양과 배치가 다르고, 정보 사이의 관계가 훨씬 복잡한 경우도 있었기 때문입니다.

이때 새로운 데이터를 기존 양식에 억지로 맞추기보다 공통적인 데이터 구조는 유지하되, 필요한 속성과 관계 항목을 추가할 수 있도록 구조를 조정했습니다. 새로운 예외가 발견되면 전문가의 의견을 바탕으로 판단 기준을 정리하고, 그 내용을 다시 작업 가이드에 반영하는 구조였습니다.

처음부터 모든 예외를 예상해 완성된 규칙을 만드는 것이 아니라, 실제 데이터를 적용하면서 규칙이 유효한지 확인하고 새로운 유형이 발견될 때마다 데이터 구조와 가이드를 함께 보완하는 방향이었습니다. 중요한 것은, 정해진 구조에 데이터를 맞추는 것이 아니라 데이터의 특성에 맞춰 구조와 공정을 유연하게 바꿀 수 있는 운영 체계였습니다.

실행 전략 : 전문가의 판단 기준을 작업 기준으로 전환

전문 지식 데이터를 대규모로 구축하려면 전문가의 판단 기준을 여러 작업자가 동일하게 적용할 수 있어야 합니다. 전문가가 모든 데이터를 직접 가공하고 검수하는 방식으로는 데이터 규모가 커질수록 대응하기 어렵기 때문입니다.

따라서 전문가의 지식을 단순히 작업자에게 전달하기보다, 전문가가 무엇을 보고 어떻게 판단하는지를 여러 작업자가 동일하게 적용할 수 있는 기준으로 만드는 데 집중했습니다. 구축 과정에는 크게 아래의 세 가지 원칙을 적용했습니다.

실행 전략

적용 방식

목적

유연한 아키텍처 운영

문서의 복잡도에 따라 필요한 속성·관계와 입력 규칙을 확장

비정형 정보의 누락 최소화

선제적 리스크 통제

병목 가능성을 사전에 확인하고 작업 순서와 검증 범위를 조정

재작업과 일정 영향 최소화

지식 동기화

전문가 판단을 작업 가이드로 만들고 사례와 Q&A를 지속 축적

작업자 간 판단 편차 최소화

이 가운데 작업자 간 판단 편차를 줄이기 위해 전문가의 판단 기준을 작업 가이드로 구체화하는 작업을 지속적으로 진행했습니다.

전문가의 설명을 바탕으로 어떤 정보를 찾아야 하는지, 어떤 정보끼리 연결해야 하는지, 무엇을 기준으로 판단해야 하는지를 정리하고 이를 실제 문서에 적용했습니다. 적용 과정에서 발생하는 질문과 예외 사례도 계속 축적했습니다.

특히 작업자의 질문을 그때그때 답하고 끝내지 않고 Q&A 형태로 아카이빙했습니다. 새로운 판단 기준이 만들어지면 작업 가이드에도 반영해 모든 작업자가 최신 기준을 동일하게 적용할 수 있도록 했습니다.

새로운 유형이 나타날 때마다 개별 작업자의 경험이나 판단에 맡기는 것이 아니라, 해당 사례를 다시 모든 작업자가 사용할 수 있는 공통 규칙으로 바꾼 것입니다. 이를 통해 전문가 개인에게 있던 판단 기준을 프로젝트 전체에서 반복적으로 적용할 수 있는 작업 기준으로 전환할 수 있었습니다.

구축 결과 : 단계적 검증을 거친 5.5만 건의 Golden Set

전체 데이터를 처음부터 한 번에 구축하지는 않았습니다. 초기에 설계한 데이터 구조와 판단 기준이 실제 도면에서도 일관되게 적용되는지 먼저 확인하고, 복잡도를 높인 뒤, 적용 범위를 확대하는 방식으로 구축을 진행했습니다. 새로운 유형이나 예외가 발견되면 앞서 정립한 작업 기준과 가이드에 반영한 뒤 다음 범위로 확대했습니다.

단계

주요 목적

핵심 작업

1단계: 기준 설계

데이터 구조와 판정 기준 검증

전문가 규칙 정리, 작업 시트 구조 및 초기 가이드 검증

2단계: 복잡도 확장

복잡한 문서에서도 기준이 일관되게 적용되는지 확인

복잡한 문서 유형 적용, 예외 및 정합성 분석

3단계: 범위 확대

검증된 기준을 다양한 문서 유형으로 확대

관계형 데이터 구조 보완 및 가이드 고도화

4단계: 최종 검증

검증 데이터로서의 활용 가능성 확인

시나리오 기반 검증, 전수 검수 및 전문가 최종 검증

이 과정을 거쳐 최종적으로 약 5.5만 건 규모의 관계형 Golden Set을 구축했으며, 현업 전문가의 판정 기준을 모두 충족했습니다. 이번 프로젝트에서 중요한 성과는 데이터의 양만이 아니었습니다. 구축 규모가 커지고 문서의 난이도가 달라져도 같은 정보 구조와 판단 기준을 유지하며 데이터를 구축할 수 있는 체계를 마련했다는 점에 의미가 있었습니다.


마치며 : 좋은 Golden Set은 ‘정답’만 모아놓은 데이터가 아닙니다

이번 프로젝트에서 가장 먼저 해결해야 했던 문제는 기술 도면에서 얼마나 많은 정보를 추출할지가 아니라 AI의 답변에서 무엇을 정답으로 판단할 것인지를 정하는 것이었습니다.

이 기준이 있어야 무엇을 하나의 정보로 볼 것인지, 어떤 정보끼리 연결해야 하는지 결정할 수 있고, AI의 결과와 비교할 수 있는 Golden Set을 만들 수 있기 때문입니다. 결국 좋은 Golden Set은 단순히 ‘정답을 많이 모아놓은 데이터셋’이 아닙니다.

전문가가 무엇을 근거로 정답을 판단하는지까지 구조화한 데이터셋입니다.

따라서 기술 도면이나 전문 문서를 AI 서비스에 활용한다면 “얼마나 많은 데이터를 만들 것인가”보다 먼저 “우리는 무엇을 기준으로 AI의 답변이 맞다고 판단할 것인가?”라는 질문을 해볼 필요가 있습니다. 이 기준이 명확해지면 문서에 담긴 정보뿐 아니라 전문가가 정보를 해석하고 판단하는 방식까지 AI 서비스의 품질을 검증하는 데이터 자산으로 전환할 수 있습니다.

TEXTNET은 다양한 비정형 데이터와 도메인 전문 지식을 AI가 활용하고 평가할 수 있는 형태로 구조화하고 있습니다. 전문 문서와 기술 데이터에 맞는 Golden Set 구축이나 AI 평가 데이터 설계가 필요하다면, TEXTNET과 함께 데이터 구조부터 검증 기준까지 설계해보시기 바랍니다.

Share article
Contents
핵심 과제 : 어떻게 전문가의 판단을 데이터로 구조화할까핵심 방법론: 가변형 데이터 구조 설계이슈 대응 : Golden Set 구축 과정에서 마주한 3가지 문제자동 추출만으로 정확도를 확보하기 어려웠습니다자료가 순차적으로 들어와도 작업이 멈추지 않아야 했습니다실제 도면을 적용할수록 새로운 예외가 나타났습니다실행 전략 : 전문가의 판단 기준을 작업 기준으로 전환구축 결과 : 단계적 검증을 거친 5.5만 건의 Golden Set마치며 : 좋은 Golden Set은 ‘정답’만 모아놓은 데이터가 아닙니다

텍스트넷 공식 블로그

RSS·Powered by Inblog