logo
|
Blog
  • 전체IT·통신금융제조·물류커머스공공·교육엔터테인먼트
  • 인사이트팀 문화뉴스
  • 홈페이지
고객 성공사례데이터

건설 도메인 Ranking Dataset 구축 사례, AI 검색 성능은 어떻게 평가해야 할까?

TEXTNET's avatar
TEXTNET
Sep 22, 2026
건설 도메인 Ranking Dataset 구축 사례, AI 검색 성능은 어떻게 평가해야 할까?
Contents
AI 검색 평가에 Ranking Dataset이 필요한 이유검색 결과의 관련성을 판단하기 어려운 도메인 복잡성LLM 자동 평가의 한계Ranking Dataset을 통한 휴먼 평가 방법0~3점 4단계 평가 척도난이도별 평가 순서 설계Argilla 기반 동일 휴먼 평가 환경 구축2인 독립 평가총 3,202건의 평가, 25.64%의 최초 판단 불일치마치며 : AI 검색 평가의 핵심은 ‘정답’보다 ‘판단 기준’

전문 도메인의 문서는 용어 자체가 어렵고, 하나의 정보를 이해하기 위해 여러 조항이나 문서를 함께 확인해야 하는 경우가 많습니다. 그렇기 때문에 단순히 검색 결과에 특정 키워드가 포함되어 있는지만으로는 AI 검색 성능을 정확히 평가하기 어렵습니다.

저희와 함께한 고객사의 경우 사내 문서를 평가 데이터로 활용하는 데 데이터 보안 및 컴플라이언스 제약이 있었습니다. 또한 LLM 자동 평가만으로는 건설 도메인의 특화 용어와 미묘한 문맥 차이를 정밀하게 검증하기 어려웠습니다.

TEXTNET은 이러한 문제를 해결하기 위해 라이선스 제약이 없는 공개 건설 전문 문서를 기반으로 AI 검색 성능을 평가하기 위한 Ranking Dataset을 구축하였습니다. 이를 통해 단계별 난이도 커리큘럼과 0~3점의 4단계 평가 척도를 적용한 휴먼 평가 파이프라인을 구축하고, AI 검색 성능을 일관된 기준으로 평가할 수 있었습니다. 이번 글에서는 전문 도메인의 AI 검색·Retrieval 성능을 평가하기 위해 어떤 기준을 만들고, 실제 데이터를 어떻게 검증했는지 소개합니다.

AI 검색 평가에 Ranking Dataset이 필요한 이유

검색 결과의 관련성을 판단하기 어려운 도메인 복잡성

건설 EPC 분야의 문서는 표준 계약 조건과 기술 시방서, 복잡한 프로젝트 현장 사양 등이 서로 연결되어 있습니다. 따라서 일반적인 문서보다 문맥을 해석하거나 조항 간 교차 참조 관계를 파악하기 어렵습니다.

예를 들어 사용자가 특정 시공 기준이나 품질 시험 조건을 검색했을 때 같은 공종을 설명하는 문서가 검색됐다고 해서 반드시 정답이라고 할 수는 없습니다. 질문과 동일한 주제를 다루지만 필요한 수치나 조건이 빠져 있을 수도 있고, 질문에 필요한 정보 중 일부만 포함되어 있을 수도 있습니다.

전문 도메인의 AI 검색을 평가하려면 Query와 Document Chunk의 관련도를 단계별로 구분할 수 있는 기준 데이터가 필요합니다. Ranking Dataset을 활용하면 검색 모델이 사용자의 질문에 더 적합한 정보를 더 높은 순위에 보여주고 있는지 평가할 수 있습니다.

LLM 자동 평가의 한계

대규모 AI 평가에서는 LLM-as-a-Judge와 같은 자동 판정 방식을 많이 활용하곤 합니다. 하지만 전문 도메인에서는 용어와 조항의 의미, 문맥의 미묘한 차이까지 확인해야 하기 때문에 LLM의 자동 판정만으로 평가 오류나 편향을 통제하기 어렵습니다.

이번 건설 도메인 사례에서는 LLM을 평가 대상의 난이도를 구분하고 평가자가 데이터를 효율적으로 검토할 수 있도록 보조하는 역할로 활용했습니다. 휴먼 평가자는 Query와 Document Chunk, 원문을 직접 비교해 최종 관련도를 평가하여 엔터프라이즈 수준의 신뢰도를 확보하는데 주력했습니다.

Ranking Dataset을 통한 휴먼 평가 방법

고난도 건설 EPC 도메인에서 AI 검색 엔진의 Retrieval·Ranking 성능을 객관적으로 검증하려면 평가자마다 다른 기준으로 판단하지 않도록 일관된 평가 기준과 환경을 만드는 것이 중요합니다. 이번 프로젝트에서는 0점에서 3점까지의 4단계 평가 척도와 난이도별 평가 순서, Argilla 기반의 통합 평가 환경, 2인 독립 평가와 판단 근거 기록을 결합하는 방법을 활용했습니다.

0~3점 4단계 평가 척도

단순한 이진 분류만으로는 AI 검색 엔진이 가져온 결과의 미세한 품질 차이를 확인하기 어렵습니다. 따라서 이번 Ranking Dataset에서는 Query에 대한 Document Chunk의 관련성을 0점에서 3점까지 네 단계의 Graded Relevance로 구분했습니다.

점수 (Grade)

등급명 (Label)

상세 판정 기준

평가 핵심 질문

검색 성능에서 확인하는 것

Grade 3

Perfectly Relevant
(완전 일치)

Chunk가 Query에 대해 직접적이고 완전한 답변을 제공함. 요구하는 수치, 규격, 명확한 기준이 완전히 포함된 상태.

"이 청크만 읽으면 질의에 완전히 답할 수 있는가?" → Yes

검색 모델이 이러한 Chunk를 상위에 배치하는지 확인하면 완전한 정답을 우선적으로 검색하는 능력을 평가

Grade 2

Highly Relevant
(높은 연관/부분 일치)

주제를 직접 다루며 상당한 정보를 포함하나 불완전하거나, 앞뒤로 부연 설명 등 불필요한 정보가 다수 섞여 있는 경우. (예: 비교 질문 중 한쪽 대상만 설명된 경우)

"답의 일부가 포함되어 있으나 추가 정보가 필요한가?" → Yes

검색 모델이 완전한 정답을 찾지 못했을 때 얼마나 유용한 정보를 상위에 배치하는지 확인

Grade 1

Related
(주제 연관/답변 불가)

같은 도메인/주제 영역(Topic)의 키워드는 등장하지만, 질의가 요구하는 구체적인 해답을 제시하지 못함. (예: 단순 참조 코드만 나열, 너무 포괄적인 상위 규정만 언급)

"주제 영역은 맞지만, 사용자가 찾는 실질적 정보가 없는가?" → Yes

검색 모델이 단순한 키워드 일치를 의미적으로 적합한 결과로 잘못 판단하고 있지는 않은지 확인

Grade 0

Irrelevant
(무관)

Query와 논리적 연관성이 전혀 없음. 문서 출처가 같더라도 다른 섹션의 내용이거나, 텍스트가 깨져 의미 파악이 불가한 경우, 텍스트 대체가 없는 단순 이미지/그래프인 경우.

"이 청크가 질의와 실질적인 관계가 있는가?" → No

검색 모델이 관련이 없는 내용을 상위에 노출되는지를 확인하면 검색 노이즈를 걸러내는 능력을 평가

난이도별 평가 순서 설계

모든 데이터를 무작위로 검증하는 대신, 평가자가 태스크와 도메인 맥락에 자연스럽게 적응할 수 있도록 난이도 순으로 평가 데이터를 배치했습니다.

  • Phase 1. 판단이 명확한 데이터부터 평가

먼저 복수 LLM이 동일하게 극단값인 0점 또는 3점을 부여한 데이터를 평가했습니다. 0점은 Query와 Chunk 사이에 실질적인 관련성이 없는 경우이고, 3점은 Chunk만으로 Query에 충분히 답할 수 있는 경우로 구분했습니다. 상대적으로 판단이 명확한 데이터부터 평가하면서 작업자가 4단계 평가 기준과 전문 문서의 특성에 익숙해질 수 있었습니다.

0점 예시 - Query에 대한 Chunk가 완전 틀린 경우

Query에 대한 Chunk가 완전 틀린 경우
Query에 대한 Chunk가 완전 틀린 경우

3점 예시 - Query에 대한 Chunk가 완전 정답인 경우

Query에 대한 Chunk가 완전 정답인 경우
Query에 대한 Chunk가 완전 정답인 경우
  • Phase 2. 1점과 2점의 중간 난이도 데이터로 확대

이후 LLM의 판정이 일치하더라도 1점 또는 2점으로 분류된 데이터를 평가했습니다. 이 단계부터는 단순히 관련 여부를 판단하는 것이 아니라, 아래와 같은 관련도의 경계를 판단해야 합니다. 즉, 쉬운 데이터에서 평가 기준을 먼저 익힌 뒤 점차 판단이 어려운 데이터로 범위를 확대하는 방식으로 휴먼 평가를 진행했습니다.

  • 같은 주제를 다루지만 실제 답은 없는지

  • 질문에 필요한 정보가 일부 포함되어 있는지

  • 어느 수준까지 포함되어야 정답으로 볼 수 있는지

1점 예시 - Query와 관련된 주제로만 Chunk가 구성되어 있는 경우

Query와 관련된 주제로만 Chunk가 구성되어 있는 경우
Query와 관련된 주제로만 Chunk가 구성되어 있는 경우

2점 예시 - Query에 대한 Chunk의 정답 정보가 부족한 경우

Query에 대한 Chunk의 정답 정보가 부족한 경우
Query에 대한 Chunk의 정답 정보가 부족한 경우

이와 더불어 3평가자마다 관련도의 경계를 다르게 해석하지 않도록 Grade 3과 2, Grade 2와 1, Grade 1과 0 사이의 판단 기준을 별도로 마련하여 등급 간 경계가 생기는 일에 대비하였습니다.

Argilla 기반 동일 휴먼 평가 환경 구축

평가자 간 판단 편차를 줄이기 위해서는 기준뿐 아니라 평가 환경도 동일하게 제공할 필요가 있었습니다. 이번 프로젝트에서는 오픈소스 데이터 평가 플랫폼인 Argilla를 활용해 휴먼 평가 환경을 구성했습니다. 한국어와 영어 데이터셋은 분리해 언어별로 독립적인 평가를 진행했으며, 평가자가 한 화면에서 다음 정보를 확인할 수 있도록 구성했습니다.

평가자는 한 화면에서 Query와 Document Chunk, 출처 문서와 페이지, LLM의 사전 Grade와 판단 근거를 확인하고 Relevance Grade를 부여했습니다. 필요한 경우 원본 문서도 직접 조회해 비교했습니다. 특히 판단이 갈리기 쉬운 Grade 1과 Grade 2 데이터에는 점수와 함께 구체적인 판단 근거를 기록했습니다. 이를 통해 최종 점수뿐 아니라 어떤 기준으로 해당 Grade를 부여했는지도 추적할 수 있었습니다.

2인 독립 평가

동일한 데이터에 대해 두 명의 평가자가 각각 독립적으로 Grade를 부여했습니다. 두 평가자의 판단이 일치하면 해당 결과를 확인하고, 서로 다른 Grade를 부여한 경우에는 각 평가자의 최초 판정과 판단 근거를 보존했습니다. 이후 불일치 사례를 다시 검토하고 각 판단의 근거를 비교한 뒤 상호 검토를 거쳐 최종 Grade를 확정했습니다.

이 과정은 단순히 평가자의 점수를 하나로 통일하기 위한 것이 아니라 두 평가자가 어떤 데이터에서, 어떤 이유로 서로 다른 판단을 내리는지 확인하기 위한 과정이기도 했습니다.

총 3,202건의 평가, 25.64%의 최초 판단 불일치

최종적으로 한국어 1,410건과 영어 1,792건을 포함한 총 3,202건의 전문 건설 EPC Ranking Dataset에 대해 100% 휴먼 평가를 완료했습니다. 동일한 평가 기준과 환경에서 독립적으로 평가했음에도 결과는 전체 3,202건 중 821건에서 두 평가자의 최초 판단이 달랐습니다.

평가 데이터셋

전체 평가 건수

평가자 간 최초 판단 불일치

불일치율

한국어

1,410건

278건

19.72%

영어

1,792건

543건

30.30%

전체

3,202건

821건

25.64%

평가자 간 불일치 데이터가 AI 검색 평가의 자산으로

이러한 불일치는 단순히 노이즈로만 볼 필요는 없습니다. 두 평가자가 동일한 기준으로 독립 평가했음에도 판단이 달랐다면, 그중 일부는 검색 적합성의 경계가 모호한 데이터일 수 있습니다.

실제로 불일치 사례를 다시 확인해보니 특히 Grade 1과 2, Grade 2와 3처럼 검색 결과의 관련성을 어디까지 인정할 것인지 판단해야 하는 경계 데이터를 확인할 수 있습니다. TEXTNET은 이를 단순 오류로 처리하지 않고 각 평가자의 최초 판정과 판단 근거를 보존했습니다. 이를 통해 어떤 유형의 데이터에서 검색 적합성에 대한 판단이 달라지는지 확인하고, 이후 유사한 데이터를 평가할 때 적용할 수 있는 기준을 구체화할 수 있었습니다.

영어 데이터의 불일치율은 30.30%

언어별로 살펴보면 한국어 데이터의 최초 판정 불일치율은 19.72%였지만 영어 데이터에서는 30.30%로 더 높게 나타났습니다. 이번 결과만으로 원인을 단정하기는 어렵지만, 영문 표준 시방서에는 방대한 규격 인용과 다층적인 계약·기술 조항이 포함되는 경우가 많아, 문서 구조와 표현의 복잡성이 관련성 판단 난도를 높이는 요인 중 하나일 가능성을 확인할 수 있었습니다.

이러한 데이터는 AI 검색 시스템 단에서도 의미가 있습니다. 사람의 판단이 쉽게 일치하는 데이터뿐 아니라 관련성의 경계에 위치해 판단이 어려운 데이터가 무엇인지 식별할 수 있기 때문입니다.

마치며 : AI 검색 평가의 핵심은 ‘정답’보다 ‘판단 기준’

AI 검색 결과에는 정답과 오답만 있지 않습니다. 질문과 관련은 있지만 필요한 정보가 부족한 결과도 있고, 같은 주제를 다루지만 실제 질문에는 답하지 못하는 결과도 있습니다. 실제 서비스에서는 오히려 이런 결과를 어떻게 판단할지가 검색 품질을 평가하는 데 더 중요합니다.

따라서 Ranking Dataset을 구축할 때는 정답 데이터를 많이 확보하는 것보다 어디까지를 정답으로 인정하고, 부분적으로 관련된 결과를 어떻게 구분할 것인지 먼저 정의해야 합니다.

이 기준이 명확해야 검색 모델을 변경하거나 개선한 이후에도 같은 기준으로 성능을 비교할 수 있습니다. 또한 단순히 검색 성공 여부를 확인하는 데 그치지 않고, 완전한 답과 부분적인 답, 주제만 관련된 결과를 실제로 구분하고 있는지도 확인할 수 있습니다.

이번 프로젝트를 통해 다시 확인한 것은 AI 검색 평가에서 필요한 것은 하나의 정답을 만드는 일이 아니라, 좋은 검색 결과와 그렇지 않은 검색 결과를 일관되게 구분할 수 있는 기준을 만드는 일이라는 것입니다.

TEXTNET은 전문 도메인의 문서와 실제 서비스 목적에 맞춰 이러한 평가 기준을 정의하고, Ranking Dataset과 Golden Set 등 AI 평가 데이터를 구축하고 있습니다.

복잡한 전문 문서를 활용한 AI 검색의 성능을 검증해야 한다면, 먼저 “우리 서비스에서는 어떤 검색 결과를 좋은 답으로 볼 것인가?”부터 정의해볼 필요가 있습니다.

Share article
Contents
AI 검색 평가에 Ranking Dataset이 필요한 이유검색 결과의 관련성을 판단하기 어려운 도메인 복잡성LLM 자동 평가의 한계Ranking Dataset을 통한 휴먼 평가 방법0~3점 4단계 평가 척도난이도별 평가 순서 설계Argilla 기반 동일 휴먼 평가 환경 구축2인 독립 평가총 3,202건의 평가, 25.64%의 최초 판단 불일치마치며 : AI 검색 평가의 핵심은 ‘정답’보다 ‘판단 기준’

텍스트넷 공식 블로그

RSS·Powered by Inblog