ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 백과사전
사전 학습이란? 모델이 대화를 배우기 전에 인터넷 대부분을 먼저 읽는 단계

사전 학습이란? 모델이 대화를 배우기 전에 인터넷 대부분을 먼저 읽는 단계

AI 백과사전 • Admin • • 9 회 조회

사전 학습은 대형 언어 모델 훈련의 첫 단계입니다. 모델이 대화와 코딩을 배우기 전에, 방대한 텍스트를 놓고 하는 일은 하나, 다음 단어를 반복해서 맞히는 것입니다. 이 단계에서는 예의도, 지시를 따르는 법도 가르치지 않습니다. 언어의 통계적 패턴, 사실 사이의 연결, 표현 습관을 파라미터에 새겨 넣을 뿐입니다. 익숙한 대화 능력과 추론 스타일은 모두 사전 학습이 닦은 토대 위에 서 있습니다.

훈련 과제는 하나뿐: 다음 단어 맞히기

과제는 놀라울 만큼 소박합니다. 텍스트를 주고 뒤에 올 단어를 가린 뒤 맞히게 합니다. 틀리면 파라미터를 조정하고, 맞으면 강화합니다. 수조 번에 이르는 이런 연습 속에서 모델은 문법, 상식, 전문 용어 사이의 연결을 조금씩 익혀 갑니다.

이런 방식을 자기 지도 학습이라고 합니다. 정답이 텍스트 자체 안에 숨어 있어 사람이 일일이 라벨을 달 필요가 없습니다. 그래서 사전 학습이 이토록 크게 확장될 수 있었고, 웹페이지, 책, 논문, 코드 저장소가 정제를 거치면 그대로 교재가 됩니다.

얼마나 읽었나보다 무엇을 읽었나가 중요

교재의 질이 상한을 정합니다. 각 회사의 방식은 대동소이합니다. 공개 웹, 책, 백과사전, 코드 등에서 원시 말뭉치를 모은 뒤 중복 제거, 저품질 콘텐츠 필터링, 개인정보 제거 같은 정제를 거칩니다. 최근 몇 년의 뚜렷한 흐름은 '적게, 그러나 정밀하게'입니다. 웹 전체의 노이즈를 넣기보다 교과서형 데이터와 코드의 비중을 높이는 쪽입니다.

그래서 모델을 볼 때 '몇 토큰으로 훈련했는가'는 규모 지표일 뿐 수준과 직결되지 않습니다. 파라미터 규모가 비슷한 모델이라도 데이터 배합이 다르면 코딩과 수학 실력이 한 등급 차이 날 수 있습니다.

사전 학습과 사후 학습의 분업

사전 학습을 마친 결과물을 베이스 모델이라고 합니다. 지식량은 크지만 성향은 '이어 쓰기 기계'에 가깝습니다. 질문을 던지면 답하는 대신 질의응답 문장을 지어내 이어 붙일 수 있습니다. 오늘날처럼 묻는 말에 답하고 부적절한 요청을 거절하는 어시스턴트로 만들려면, 사람의 시범으로 지시 따르기를 가르치는 지도 미세 조정과 인간 선호 피드백을 이용한 정렬이라는 두 단계가 더 필요합니다.

기억하기 쉬운 분업은 이렇습니다. 사전 학습은 '얼마나 아는가, 토대가 얼마나 두터운가'를 정하고, 사후 학습은 '사람을 어떻게 대하는가'를 정합니다. 같은 베이스 모델이라도 사후 학습 레시피를 바꾸면 성격이 전혀 다른 어시스턴트가 됩니다.

흔한 세 가지 오해

첫째, 사전 학습은 원문을 데이터베이스에 외워 넣는 것이 아닙니다. 모델이 저장하는 것은 파라미터화된 통계 패턴이지 검색 가능한 텍스트 보관소가 아닙니다. 명문을 유창하게 암송하는 것은 말뭉치에 그만큼 자주 등장했기 때문이지 원본 파일을 저장해서가 아닙니다. 이는 그럴듯하게 틀리는 이유 중 하나이기도 합니다. 모델이 생성하는 것은 '그럴듯한 말'이지 조회한 사실이 아닙니다.

둘째, 사전 학습이 끝났다고 훈련이 끝난 것은 아닙니다. 베이스 모델을 그대로 채팅 제품으로 쓰면 경험이 대개 좋지 않습니다. 업체가 발표하는 '모델'에는 기본적으로 전체 사후 학습 과정이 포함되어 있습니다.

셋째, 사전 학습은 일회성 평생 교육이 아닙니다. 주요 업체는 새 데이터로 계속 훈련해 새 버전을 내놓습니다. 어떤 모델이 '똑똑해졌다'고 느껴진다면, 그 공의 상당 부분은 새 사전 학습 데이터와 그 배합에 있는 경우가 많습니다.

추천 도구

더보기