본문으로 건너뛰기
RAISE LAB
← 블로그 목록
기초 원리

환각은 버그가 아니라 생성 원리의 그림자다

존재하지 않는 논문을 인용하고, 없는 API 옵션을 설명하고, 틀린 날짜를 확신에 차서 말합니다. 이 현상을 환각(hallucination)이라고 부르는데, 이름 때문에 오해가 생깁니다. 환각은 모델이 가끔 겪는 고장이 아니라 생성 원리에서 필연적으로 따라 나오는 성질입니다. 그래서 대응도 "고쳐지기를 기다리는 것"이 아니라 "어디서 생기는지 알고 그 자리를 검증하는 것"입니다.

왜 생기는가

앞 글의 요점을 다시 가져오면, 모델은 다음 토큰의 확률을 계산합니다. 이 계산에는 "근거가 있는가"를 따지는 단계가 없습니다. 학습 데이터에 그 사실이 있었든 없었든, 문맥상 가장 그럴듯한 조각은 항상 존재하고 모델은 그것을 출력합니다.

환각이 특히 잘 생기는 자리는 정해져 있습니다.

  • 구체적인 식별자: 논문 제목, 저자, URL, 법조문 번호, 함수 이름, 제품 버전. 형식은 학습됐지만 정확한 값은 드물게 등장해서 "그럴듯한 조합"이 만들어집니다.
  • 숫자와 날짜: 통계, 가격, 출시일. 비슷한 숫자가 학습 데이터에 수없이 있어 어느 하나로 수렴하지 않습니다.
  • 학습 시점 이후의 일: 모델에는 지식 컷오프(knowledge cutoff)가 있습니다. 그 이후의 사건은 모르는데, 모른다고 말하지 않고 이전 패턴으로 추측합니다.
  • 긴 답변의 뒷부분: 앞에서 만든 서술에 맞추려다 보면 앞 문장을 정당화하는 사실이 만들어집니다.
  • 질문에 전제가 깔린 경우: "그 회사가 작년에 인수한 스타트업 이름이 뭐였죠?"처럼 질문 자체가 사실을 가정하면 모델은 가정을 의심하기보다 채웁니다.

반대로 환각이 잘 생기지 않는 자리도 있습니다. 입력에 넣어 준 문서를 요약·분류·변환하는 작업, 형식을 바꾸는 작업, 일반적인 개념 설명입니다. 자료가 입력 안에 있으면 모델은 그 안에서 다음 토큰을 고르므로 지어낼 여지가 줄어듭니다.

줄이는 방법: 접지

환각을 줄이는 원칙은 하나입니다. 모델이 참조할 자료를 입력 안에 넣어 주고, 그 안에서만 답하게 한다. 이것을 접지(grounding)라고 부릅니다.

  1. 자료를 넣습니다. 회사 규정에 대해 물을 때 규정 문서를 함께 넣습니다. 문서가 많으면 검색 증강 생성(RAG, Retrieval-Augmented Generation)이 질문과 관련된 부분만 골라 넣어 줍니다.
  2. 범위를 지시합니다. "첨부 문서에 없는 내용은 '문서에 없음'이라고 답하세요." 이 한 줄이 추측을 상당 부분 막습니다. "모름" 칸이 없는 모델에게 "모름"을 출력 형식으로 만들어 주는 것입니다.
  3. 출처를 붙이게 합니다. "각 주장 뒤에 근거가 된 문단 번호를 적으세요." 출처가 없는 주장이 눈에 보이게 됩니다.
  4. 도구로 확인하게 합니다. 최신 정보는 웹 검색 도구, 계산은 코드 실행, 내부 데이터는 데이터베이스 조회 도구에 맡깁니다. 에이전트가 도구를 쓰는 이유의 절반은 환각 통제입니다.

검증 습관: 어디를 볼 것인가

모든 문장을 검증할 수는 없습니다. 위에서 정리한 "잘 생기는 자리"를 먼저 봅니다.

결과물 유형먼저 확인할 것
보고서 초안숫자, 날짜, 고유명사, 인용
코드함수·옵션 이름이 실제 문서에 있는가
법률·의료·재무 서술조문 번호, 수치, 판단 결론 전부 사람 검토
요약원문에 없는 문장이 섞였는가 (특히 결론부)
번역숫자와 고유명사가 원문과 같은가

어소시에이트 수업 환각과 불일치, 편향 알아보기는 결과물을 "자료 기반"과 "그 밖"으로 갈라 위험한 자리를 표시하는 실습입니다. 이 도메인(출력 평가와 검증)이 CCAO-F에서 비중이 가장 큰 21%입니다. 시험이 이 습관을 그만큼 중요하게 본다는 뜻입니다.

응시 안내: Claude 자격증은 Claude Partner Network 소속 조직의 회사 이메일로만 등록할 수 있고, 개인 이메일로는 응시할 수 없습니다. 자격증보다 도메인 학습 자체에 무게를 두시고, 응시 조건은 자격증 가이드에서 확인하시기 바랍니다.

이어서 읽기