ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 백과사전
AI 얼라인먼트: 말할 수 있게 된 거대 언어 모델에게 '제대로 말하기'를 가르치기

AI 얼라인먼트: 말할 수 있게 된 거대 언어 모델에게 '제대로 말하기'를 가르치기

AI 백과사전 • Admin • • 6 회 조회

AI 얼라인먼트(AI Alignment)란 사전학습이 끝난 뒤, 거대 언어 모델의 행동을 인간의 의도·가치관·안전 요구사항에 맞추는 훈련·평가 방법 전체를 말한다. 사전학습은 모델에게 '말하는 법'만 가르친다. '제대로 말하는 법'을 가르치는 것이 얼라인먼트다.

얼라인먼트는 사전학습도 아니고 파인튜닝도 아니다

사전학습: 방대한 텍스트로 학습시켜 언어 규칙과 세계 지식을 익히게 한다. 이 단계의 모델은 단순한 '텍스트 이어쓰기 기계'에 불과하다.

파인튜닝(SFT, 지도 파인튜닝): 질의응답 쌍으로 '대화 형식으로 답하는 법'을 가르친다. 신입 사원 교육과 같다.

얼라인먼트: SFT를 넘어 한 걸음 더 나아가, 인간의 선호를 이용해 모델을 훈련시켜 능력 자체는 그대로 두면서 인간의 기대에 더 부합하는 선택을 하게 한다.

비유하자면, 사전학습은 '모든 책을 읽은 학생', SFT는 '시험 답안 형식을 배운 학생', 얼라인먼트는 '해도 되는 말과 안 되는 말을 아는 학생'이다.

얼라인먼트의 세 가지 주요 방법: RLHF·RLAIF·DPO

RLHF(인간 피드백 기반 강화학습): 인간이 모델의 답변에 순위를 매기고(어느 쪽이 더 좋은가), 인간의 선호를 모방하는 '보상 모델'을 만든 뒤, 강화학습으로 모델을 고득점 방향으로 최적화한다. 초기 ChatGPT로 유명해진 방법으로 효과는 높지만 대규모 인간 어노테이션이 필요해 비용이 크다.

RLAIF(AI 피드백 기반 강화학습): '인간 채점'을 'AI 채점'으로 바꿔, 더 강력한 모델이 정해진 원칙에 따라 답변에 순위를 매긴다. 빠르고 저렴하지만 채점 AI 자체에 편향이 있으면 편향이 증폭된다.

DPO(직접 선호 최적화): 보상 모델을 만들지 않고 '좋은 답변 vs 나쁜 답변' 대비 데이터를 이용해 좋은 답변을 선택하도록 모델 파라미터를 직접 조정한다. 단순하고 효율적이어서 현재 오픈소스 커뮤니티에서 가장 많이 쓰이는 얼라인먼트 방법 중 하나다.

얼라인먼트가 할 수 없는 것

≠ 모델을 더 똑똑하게 만들기. 얼라인먼트는 지식이나 능력을 늘리지 않는다. 행동 방식만 조정한다. 잘 얼라인된 모델이 사전학습 때보다 '아는 게 더 많아지는' 것은 아니다.

≠ 환각 없애기. 모델은 여전히 자신만만하게 지어낼 수 있다. 얼라인먼트는 날조 빈도를 낮출 수 있지만 '자신이 무엇을 아는지 모른다'는 근본 문제는 해결하지 못한다.

≠ 한 번으로 끝내기. 새로운 공격 기법(프롬프트 인젝션 등)은 얼라인먼트를 우회할 수 있어 지속적인 유지보수와 업데이트가 필요하다.

흔한 세 가지 오해

오해 1: 얼라인먼트는 '하면 안 되는 말' 블랙리스트다. 블랙리스트는 안전 가드레일(배포 시 필터링 규칙)이고, 얼라인먼트는 훈련 과정의 형성이다. '말하고 나서 막히는' 게 아니라 '말하고 싶지 않게' 만드는 것이다.

오해 2: 얼라인된 모델은 안전하다. 얼라인먼트는 위험을 낮추지만 안전을 보장하지 않는다. 적대적 입력이나 탈옥 프롬프트는 여전히 우회할 수 있다.

오해 3: 얼라인먼트는 대기업만의 것이다. 모델을 사용자에게 내놓는 모든 경우에 어떤 형태의 얼라인먼트가 필요하고, 오픈소스 커뮤니티도 하고 있다(DPO로 오픈 모델을 조정하는 등).

얼라인먼트가 작동하는 것을 느끼는 순간

'폭탄 만드는 법'을 물었을 때 모델이 정중히 거절하고 안전한 대안을 제시한다 — 그게 얼라인먼트다. 논쟁적인 질문에 한쪽 편을 들지 않고 여러 관점을 제시한다 — 그것도 얼라인먼트다. 답변 중에 '확실하지 않습니다', '제 지식은 ○년까지입니다'라고 스스로 밝힌다 — 그것도 얼라인먼트다.

얼라인먼트는 눈에 띄지 않지만, 당신이 매일 대화하는 거대 언어 모델이 '믿고 쓰는 비서'인지 '말은 하지만 믿을 수 없는 기계'인지를 결정한다.

추천 도구

더보기