AI 공부 · 02 / LLM 이해
AI에게 기사 세 건을 건네고 “공통 흐름을 한국어로 알려줘”라고 하면 어떤 일이 벌어질까요? 모델은 기사를 데이터베이스처럼 조회해 정답 칸을 꺼내지 않습니다. 입력을 토큰으로 처리하고, 주어진 문맥을 바탕으로 답을 생성합니다. 그래서 글이 매끄러워도 원문과 다른 주장이 섞일 수 있습니다. 멍냥잇의 모닝 브리핑을 예로 들어 이 네 단계를 분해해 봅니다.
그림의 마지막 검증은 LLM 안에서 자동으로 일어나는 기능이 아닙니다. 응용 프로그램이 별도로 구현한 단계입니다.
1. LLM은 무엇을 하는 모델인가?
LLM은 Large Language Model, 즉 대형 언어모델입니다. 언어모델은 앞뒤 문맥에서 토큰이나 토큰의 연속이 나올 가능성을 다루며, 이를 바탕으로 글을 생성·요약·번역할 수 있습니다. Google의 머신러닝 강좌와 용어집은 이 기본 정의를 제시합니다. 다만 “다음 토큰을 예측한다”는 설명만으로 현재 챗봇의 모든 기능을 설명할 수는 없습니다. 실제 제품은 학습 후 지시를 따르도록 조정되고, 검색이나 도구 호출이 붙기도 합니다. 검색·실행은 모델 자체와 구분해서 봐야 합니다.
이를 엑셀 보고서와 비교하면 차이가 뚜렷합니다. 완료 건수는 행의 상태를 세는 코드가 계산하고, 그 결과를 읽기 쉬운 문장으로 다듬는 일에 LLM을 쓸 수 있습니다. LLM이 숫자를 유창하게 설명한다고 해서 숫자 계산을 맡겨야 하는 것은 아닙니다. 멍냥잇의 주간 보고서 제작 기록도 계산과 서술을 분리했습니다.
2. 토큰은 단어 수나 글자 수와 왜 다른가?
토큰은 모델이 입력을 처리하고 출력을 만드는 단위입니다. 모델에 따라 단어 전체, 단어 일부, 문자나 문장부호가 토큰이 될 수 있습니다. 따라서 “한글 1,000자 = 몇 토큰”처럼 고정된 환산식을 일반화하면 안 됩니다. 같은 문장도 모델과 토크나이저에 따라 토큰 수가 달라집니다. Google의 LLM 강좌는 단어·부분 단어·문자 단위의 예를 들고, Gemini 토큰 문서는 실제 요청을 보내기 전에 토큰을 세거나 응답의 사용량을 확인하는 방법을 안내합니다.
모닝 브리핑에서 모델에 들어가는 것은 기사 본문만이 아닙니다. “한국어로 요약하라”는 지시, 기사별 출처 ID·제목·발표 시각, 출력 형식도 입력을 차지합니다. 답변을 생성할 공간도 필요합니다. 그러므로 자료를 많이 넣을수록 무조건 좋은 것이 아닙니다. 먼저 어떤 자료가 질문에 꼭 필요한지 고르는 편이 토큰과 검증 부담을 함께 줄입니다.
3. 문맥 창은 무엇을 제한하나?
문맥은 이번 요청에서 모델이 참고할 수 있도록 전달된 내용입니다. 문맥 창은 모델이 한 번에 다룰 수 있는 토큰 범위를 뜻합니다. 모델의 학습 데이터 전체가 이번 요청의 문맥 창에 들어 있는 것은 아닙니다. 이전 대화나 웹페이지도 시스템이 이번 요청에 포함하지 않으면 그대로 참고할 수 없습니다. Google 생성형 AI 용어집은 문맥 창을 프롬프트에서 처리할 수 있는 토큰 범위로 설명하고, Gemini 문서는 해당 모델의 입력·출력 한도를 별도로 확인하도록 안내합니다.
문맥 창이 크다고 긴 문서의 모든 사실을 빠짐없이 찾아낸다는 보장은 없습니다. 자료가 길어지면 중요한 조항이 묻히거나, 관련 없는 문단이 답에 끼어들 수 있습니다. 이 글의 실무 기준은 원문을 무작정 늘리는 대신 읽을 범위, 출처, 검증할 주장부터 정하는 것입니다. 향후 문서가 더 많아질 때 청킹·검색·RAG를 배워야 하는 이유도 여기에 있습니다.
4. 문장을 생성한다는 것은 사실을 조회한다는 뜻이 아니다
아래는 실제 뉴스가 아닌 가상 연습 자료입니다. 자료 A에는 “서비스가 10월 15일 일부 국가에서 정식 출시된다. 한국은 제외한다”라고 쓰여 있고, 자료 B에는 “한국에서는 10월 20일 베타 신청을 받는다”라고 쓰여 있다고 합시다. “한국 출시 소식을 한 문장으로 요약해줘”라는 질문에 “한국에서 10월 15일 정식 출시한다”라고 답하면 두 자료의 날짜와 대상을 잘못 결합한 것입니다. 매끄러운 문장과 사실에 충실한 문장은 다릅니다.
이런 사실 오류를 흔히 환각(hallucination)이라고 부릅니다. Google의 머신러닝 용어집은 사실과 다르지만 그럴듯해 보이는 생성 결과로 설명합니다. 모델이 사람처럼 의도를 갖고 “거짓말”한다는 뜻으로 받아들이면 원인을 놓칩니다. 문제는 입력에 없는 사실을 보태거나, 조건을 혼동하거나, 서로 다른 출처를 잘못 섞을 수 있다는 점입니다.
| 확인할 주장 | 자료에서 직접 볼 것 | 판정 |
|---|---|---|
| 10월 15일 출시 | 자료 A의 날짜 | 날짜 자체는 존재 |
| 한국 정식 출시 | 자료 A의 “한국 제외”, 자료 B의 “베타 신청” | 대상·출시 상태가 틀림 |
| 한국에서 10월 20일 신청 | 자료 B의 날짜와 “베타 신청” | 자료에 부합 |
핵심은 숫자가 원문에 등장하는지만 확인해서는 부족하다는 것입니다. 숫자와 대상, 조건, 상태가 같은 문맥에서 연결되는지 읽어야 합니다.
5. 멍냥잇 모닝 브리핑은 무엇을 모델에 맡겼나?
모닝 브리핑 제작 기록의 목적은 여러 공식 발표를 하나의 한국어 카카오 메시지로 종합하는 것이었습니다. 프로그램은 최대 세 건의 공식 발표에서 읽을 수 있는 본문을 가져와 출처 ID, 제목, 발표 시각과 함께 Gemini에 전달합니다. 본문을 읽기 어려우면 공식 RSS 소개문으로 범위를 좁히고, 읽을 자료가 없으면 요약을 만들지 않습니다. 모델에는 공통 흐름, 발표별 핵심, 확인할 점을 정해진 JSON 형태로 돌려달라고 요청합니다.
이후의 검증은 일반 코드가 맡습니다. 응답에 기사별 출처 ID가 같은 순서로 있는지, 모델이 제시한 원문 발췌가 실제 입력 본문에 연속해서 들어 있는지, 요약에 등장한 숫자가 원문에도 있는지 확인합니다. 형식이나 근거 검사가 실패하면 그 AI 뉴스 요약은 보내지 않습니다. 이 단계가 있기 때문에 “모델에게 정확히 써 달라고 지시했다”에서 끝나지 않습니다.
하지만 이 검사가 사실성을 완전히 보증하지는 않습니다. 위 가상 예처럼 원문에 10월 15일과 10월 20일이 모두 있고 관련 구절을 하나 제시해도, “한국 정식 출시”라는 결론이 틀릴 수 있습니다. 현재의 문자열·숫자 검증은 명백한 오류의 일부를 걸러내는 장치입니다. 대상·제한 조건·시간 관계는 원문과 사람이 대조하거나 추가적인 의미 검증을 설계해야 합니다. 이 구분을 숨기지 않는 것이 도구의 실제 신뢰 수준을 이해하는 출발점입니다.
6. 직접 해볼 수 있는 작은 검증 연습
위 가상 자료 A·B를 원하는 LLM에 넣고 “한국의 이용 가능 시점과 상태를 한 문장으로 답하되, 어느 자료의 어느 구절이 근거인지 적어줘”라고 요청해 보세요. 답을 받은 뒤 다음 세 가지를 확인합니다.
- 날짜만 맞는가, 아니면 한국·베타 신청이라는 조건까지 맞는가?
- 모델이 제시한 근거 구절이 입력 자료에 실제로 있는가?
- 근거 구절이 답 전체를 뒷받침하는가, 아니면 일부 단어만 겹치는가?
마지막 질문이 중요합니다. 인용 표시가 있다는 사실과 인용이 주장을 뒷받침한다는 사실은 다릅니다. 결과가 틀리면 프롬프트를 바꾸어 다시 시도할 수 있지만, 실무 프로그램에서는 반복 요청뿐 아니라 실패 시 발송 중단·사람 확인 같은 경로도 필요합니다. 이 연습은 특정 모델 성능을 평가한 실험 결과가 아니라, 독자가 검증 기준을 익히기 위한 예시입니다.
7. 네 용어를 한 번에 연결하면
| 용어 | 한 문장 뜻 | 브리핑에서의 질문 |
|---|---|---|
| 토큰 | 모델이 처리·생성하는 단위 | 지시와 기사 본문이 입력 한도 안에 드는가? |
| 문맥 창 | 한 요청에서 다룰 수 있는 토큰 범위 | 이번 요약에 필요한 원문을 전달했는가? |
| 생성 | 문맥에 이어질 답을 만들어 내는 과정 | 원문을 한국어로 종합하되 조건을 유지했는가? |
| 환각 | 그럴듯하지만 사실과 다른 생성 결과 | 날짜·대상·출시 상태를 잘못 결합하지 않았는가? |
LLM을 잘 쓰는 설계는 좋은 프롬프트 한 줄로 끝나지 않습니다. 필요한 자료를 고르고, 모델이 할 일을 좁히고, 출력의 근거를 별도로 확인해야 합니다. 이어서 청킹·임베딩·벡터 DB와 RAG의 검색 흐름을 살펴보세요. AI 공부 목록으로 돌아가기 →
개념 확인 자료: Google 머신러닝 강좌: LLM · Google 머신러닝 용어집: 언어모델·토큰·환각 · Google 생성형 AI 용어집: 문맥 창 · Gemini API: 토큰 계산과 입력·출력 한도. 모닝 브리핑의 구현·검증 범위는 멍냥잇 로컬 프로그램의 소스와 제작 기록을 확인했습니다. 가상 출시 사례는 개념 설명을 위해 만든 예시이며 실제 제품 발표가 아닙니다.
