본문으로 건너뛰기
RAISE LAB
← 블로그 목록
기초 원리

LLM은 다음 토큰을 예측할 뿐이다 — 생성 원리와 그 함의

언어 모델(LLM, Large Language Model)을 처음 쓰는 분이 가장 먼저 부딪히는 혼란은 "왜 이렇게 똑똑한데 이렇게 엉뚱한가"입니다. 긴 보고서를 정리해 주는 도구가 세 자리 곱셈을 틀리고, 어제는 맞던 답이 오늘은 다릅니다. 이 글은 그 혼란을 원리 하나로 정리합니다. 모델은 다음에 올 토큰을 확률로 고르는 장치이고, 장점과 약점이 전부 그 한 가지 사실에서 나옵니다.

모델이 실제로 하는 일

사용자가 "대한민국의 수도는"이라고 입력하면 모델은 문장을 "이해"하지 않습니다. 지금까지 입력된 글 조각(토큰, token)의 나열을 보고, 그 다음에 올 토큰 후보마다 확률을 매깁니다. "서울"이 높고 "부산"이 낮고 "사과"는 거의 0에 가깝습니다. 그중 하나를 고르고, 고른 토큰을 입력 끝에 붙인 뒤, 다시 다음 토큰의 확률을 계산합니다. 이 과정을 문장이 끝날 때까지 반복합니다.

이 방식을 자기회귀 생성(autoregressive generation)이라고 부릅니다. 한 번에 한 조각씩, 앞에 나온 것만 보고 뒤를 정합니다. 답변이 글자 단위로 흘러나오듯 보이는 것은 연출이 아니라 실제 계산 순서입니다.

확률은 어디서 왔을까요. 모델은 사전학습(pretraining) 단계에서 웹 문서, 책, 코드 수조 개의 토큰을 읽으며 "이런 글 다음에는 이런 조각이 온다"는 패턴을 수천억 개의 숫자(파라미터, parameter)에 눌러 담았습니다. 그 뒤 후훈련(post-training) 단계에서 사람이 선호하는 답변 형식과 지켜야 할 규칙을 익힙니다. 우리가 쓰는 것은 그 두 단계를 거친 결과물입니다.

이 원리에서 따라 나오는 다섯 가지

1. 계산에 약합니다. 모델은 "37 × 43 ="를 보고 곱셈을 실행하는 것이 아니라, 학습 데이터에서 그 뒤에 자주 온 숫자 패턴을 떠올립니다. 자주 본 계산은 맞히고 처음 보는 계산은 그럴듯한 오답을 냅니다. 그래서 정확한 계산은 모델에게 시키지 않고 코드 실행 도구에 넘깁니다. 시험에서도 "계산·집계는 툴에 위임한다"가 반복되는 정답 패턴입니다.

2. 같은 질문에 답이 달라집니다. 확률로 고르기 때문입니다. 가장 확률 높은 토큰만 고르면 답이 고정되지만 문장이 단조롭고 반복에 빠지기 쉬워서, 기본값은 확률에 비례해 무작위로 뽑습니다. 이 무작위성의 크기를 조절하는 값이 temperature인데, API에서만, 그것도 일부 모델에서만 직접 만질 수 있습니다. 최신 모델들은 이 값을 아예 없애고 스스로 조절하며, 대화형 제품에는 처음부터 그런 설정이 없습니다. 그래서 실무에서 재현성을 얻는 방법은 값을 낮추는 것이 아니라 출력 형식을 고정하고 예시를 주는 것입니다. 정답이 하나인 분류·추출은 고를 수 있는 값의 목록을 지시문에 적어 주면 답이 흔들릴 여지가 줄어듭니다.

3. 모르는 것을 모른다고 하지 않습니다. 확률 계산에 "모름"이라는 칸은 따로 없습니다. 근거가 없어도 가장 그럴듯한 다음 토큰은 항상 존재합니다. 이것이 환각(hallucination)의 뿌리이고, 별도의 글에서 다룹니다.

4. 앞에 있는 글이 전부입니다. 모델이 볼 수 있는 것은 지금 입력창에 들어 있는 토큰뿐입니다. 어제 나눈 대화, 회사 규정, 최신 뉴스는 지금 입력에 없으면 존재하지 않는 것과 같습니다. 그래서 "무엇을 입력에 넣을 것인가"가 프롬프트 설계의 본질이고, 컨텍스트 윈도우(context window)라는 한계가 따라옵니다.

5. 형식을 잘 따릅니다. 학습 데이터에 형식이 있는 글(표, 목록, JSON, 코드)이 많아서, 형식을 명시하면 그 뒤를 잇는 확률이 뚜렷해집니다. "표로 정리해 주세요"가 잘 먹히는 이유이고, 구조화된 출력(structured output)을 요구할 때 예시를 하나 보여 주면 정확도가 오르는 이유입니다.

실무에서 바로 쓰는 판단 기준

상황원리로 보면대응
숫자 집계, 날짜 계산패턴 회상이지 연산이 아니다코드 실행 또는 스프레드시트로 넘긴다
매번 답이 조금씩 다르다확률 샘플링출력 형식과 선택지를 고정하고 예시를 준다
회사 내부 정보를 모른다입력에 없으면 없는 것문서를 프롬프트나 Projects에 넣는다
출처를 물으면 지어낸다"모름" 칸이 없다출처 URL을 입력에 넣고 그 안에서만 답하게 한다
형식이 흐트러진다형식 패턴이 약하다예시 한 개와 출력 틀을 준다

응시 안내: Claude 자격증은 Claude Partner Network 소속 조직의 회사 이메일로만 등록할 수 있고, 개인 이메일로는 응시할 수 없습니다. 자격증보다 도메인 학습 자체에 무게를 두시고, 응시 조건은 자격증 가이드에서 확인하시기 바랍니다.

이어서 읽기