정본

블로그

할루시네이션 없는 규정 안내는 어떻게 가능한가

생성형 챗봇은 질문을 받을 때마다 문장을 새로 만듭니다. 그래서 규정에 없는 말도 그럴듯하게 합니다. 규정 안내에서 이것은 사소한 결함이 아닙니다. 정본은 문장을 만들지 않는 쪽을 택했고, 그 선택이 나머지 구조를 결정했습니다.

1. 답을 생성하지 않고 고른다

정본의 답은 담당자가 검수한 안내 문장 가운데 상황에 맞는 것을 골라 보여 준 것입니다. 문장을 조합하거나 바꿔 쓰지 않습니다. 그래서 규정에 없는 문장이 화면에 나올 길이 처음부터 없습니다.

같은 이유로 결과가 흔들리지 않습니다. 같은 규정·안내 데이터와 같은 의사결정 모델 버전에서 입력 문장과 상황 선택이 같으면 언제나 같은 결과가 나옵니다. 담당자가 한 번 검수한 문장은 다음 질문에서도 그대로입니다.

2. 근거 없는 문장은 만들어질 수 없다

행동 카드의 모든 항목에는 근거 조문이 붙습니다. 예를 들어 제33조제4호나목처럼 조·항·호·목 단위로 적히고, 누르면 그 조의 원문 전체가 옆에 열리며 인용한 부분이 강조됩니다. 안내가 맞는지 사용자가 원문으로 바로 확인할 수 있습니다.

이것은 글쓴이의 성실함에 기대는 약속이 아닙니다. 업무 안내를 만들거나 고칠 때마다 자동 검사가 돕니다.

근거가 없는 항목이나 없는 조문을 가리키는 근거는 이 검사에서 걸려 안내에 들어갈 수 없습니다. 규정이 개정되어 조문 번호가 사라지면 같은 검사가 그 인용을 찾아냅니다.

3. 모르면 모른다고 한다

업무를 찾는 단계에서 확신의 정도에 따라 다르게 움직입니다.

상황동작
한 업무가 뚜렷하게 앞서고, 문장이 그 업무를 직접 가리킬 때그 업무의 상황 확인으로 바로 들어갑니다.
확신이 부족할 때후보 업무를 최대 4개 보여 주고 사용자가 고르게 합니다. ‘여기에 없어요’도 고를 수 있습니다.
자주 헷갈리는 두 업무일 때둘을 가르는 질문을 하나 하고, ‘둘 다예요’도 고를 수 있게 합니다.
규정 범위 밖으로 보일 때답을 만들지 않고, 업무 목록과 조문·양식 검색으로 안내합니다.

입력 — “수강신청 정정 기간이 언제예요”

연구비 규정에 없는 일입니다. 정본은 “딱 맞는 업무인지 확실하지 않아요”라고 알리고, 가장 가까운 업무 후보와 ‘여기에 없어요’를 보여 준 뒤, 그 문장으로 조문·양식 검색을 해 보라고 제안합니다. 학사 일정을 지어내지 않습니다.

상황 확인 질문에서도 하나만 고르는 질문에는 ‘모름’이나 ‘기타’ 선택지가 항상 있습니다. 사용자가 ‘모름’이라고 답한 조건에 걸린 항목은 지우지 않고 ‘해당되면’ 표시와 함께 보여 줍니다.

4. 업무 찾기는 작은 의사결정 모델이 한다

그렇다면 자연어로 적은 문장을 어떻게 업무로 잇는가. 여기에는 대형 언어 모델이 아니라 두 가지 점수를 쓰는 작은 의사결정 모델이 있습니다.

이 모델이 하는 일은 “어느 업무인가”를 가르는 것뿐입니다. 문장을 만들지 않으므로 틀려도 그럴듯한 오답을 쓰지 않고, 확신이 없으면 되묻습니다. 성능은 학습에 쓰지 않은 별도의 평가 문장으로 재며, 정해 둔 하한 아래로 떨어지면 테스트가 실패합니다.

실측 — 고려대 모델, 2026년 10월 2일

24개 업무를 대상으로 보고용 평가 세트의 문장 239개를 평가했습니다. 업무 범위 안 209개, 범위 밖 30개입니다.

측정 항목결과
올바른 업무로 바로 들어가거나, 첫 번째 후보가 정답89.5%
바로 들어간 업무 또는 제시한 후보에 정답 포함96.7%
잘못된 업무로 바로 들어감1.4%
범위 밖 문장에 업무를 바로 지정하지 않음100%

같은 문장을 Claude Opus 5.5에 주었을 때

사전지식 없는 Claude Opus 5.5에 업무 목록과 같은 문장을 주고 분류하게 한 실험(2026년 9월 30일, 검증 세트 5개 982문장)에서 업무를 찾는 정확도는 비슷했습니다. 다른 것은 속도와 비용, 그리고 틀리는 방식입니다.

지표정본Opus 5.5
1순위 정답89.9%91.0~91.6%
후보 3개 안에 정답97.6%98.4~98.8%
엉뚱한 업무로 바로 들어감 (낮을수록 좋음)1.4%2.4~3.9%
처리 시간, 100문장0.48초28~53초
토큰, 100문장02.0만~6.0만
같은 문장에 같은 답항상실행마다 달라질 수 있음
규정에 없는 문장이 나올 수 있는지없음있음

Opus의 범위는 effort 설정(low·medium·high)에 따른 값입니다. 재생되는 실험과 전체 표는 더 알아보기에 있습니다.

5. 마지막 관문은 사람이다

자동 검사는 근거가 있는지, 양식이 실제로 있는지, 구조가 맞는지를 봅니다. 안내 문장이 규정을 옳게 옮겼는지는 기관의 담당자가 검수용 화면에서 업무별로 확인하고 의견을 남깁니다. 검수를 마친 문장만 운영에 쓰입니다. 그래서 정본의 안내 품질은 모델의 똑똑함이 아니라 검수의 꼼꼼함에 달려 있고, 그것이 의도한 바입니다.

6. 그래서 못 하는 것

할루시네이션이 없다는 것은 더 많이 아는 것이 아니라, 모르는 것을 말하지 않는 것입니다. 규정 안내에서는 그쪽이 맞다고 봅니다.

직접 물어보면 가장 빠릅니다. 정본의 서비스 안내서를 이 방식으로 만든 모델이 홈에 있고, 세 대학의 연구비 규정 모델도 열어 볼 수 있습니다.

더 읽기

서비스 안내서 2장 작동 방식, 4장 구축 과정과 품질 관리, 8장 한계, 7장 보안과 기밀 유지.