ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 백과사전
Chain-of-Thought란? AI에게 먼저 생각하게 한 뒤 답하게 하는 기술

Chain-of-Thought란? AI에게 먼저 생각하게 한 뒤 답하게 하는 기술

AI 백과사전 • Admin • • 2 회 조회

Chain-of-Thought(사고의 연쇄, CoT)는 프롬프트 기법으로, 모델에게 바로 답을 내게 하는 대신 중간 추론 단계를 먼저 쓰게 하고 마지막에 결론을 내게 합니다. 수학 문제를 풀 때 답 숫자부터 내놓는 대신 "미지수 설정→방정식 세우기→풀이" 과정을 먼저 적습니다. 이런 "과정을 먼저 쓰기" 제약 덕분에 복잡한 문제의 정답률이 크게 오르는 경우가 많습니다.

핵심 방식: 단계 먼저, 답은 나중에

대규모 언어 모델은 토큰을 하나씩 생성하며, 먼저 출력한 내용이 뒤의 문맥이 됩니다. Chain-of-Thought는 바로 이 점을 이용합니다. 중간 단계가 일단 적히면 최종 답의 근거가 되고, 단계가 탄탄하면 답이 "중간을 건너뛰어" 틀릴 가능성이 줄어듭니다.

예시 제공에서 한 마디 지시로

초기 Chain-of-Thought는 few-shot 방식이었습니다. 프롬프트에 "문제+단계별 풀이" 예시를 두세 개 넣어 주면 모델이 그 형식을 따라 새 문제를 풉니다. 2022년 Kojima 등은 논문 "Large Language Models are Zero-Shot Reasoners"에서 예시가 필수가 아님을 보였습니다. 문제 뒤에 "Let's think step by step" 한 마디만 붙이면 모델이 스스로 추론을 펼치는데, 이것이 zero-shot CoT이며 수학 추론 벤치마크 GSM8K 정답률을 약 10%에서 약 40%로 끌어올렸습니다. 형식이 특수하고 기호가 많은 작업에는 예시가 적합하고, 예시가 없을 때는 한 마디 지시가 빠릅니다.

투표로 이기기: self-consistency 디코딩

self-consistency(자기 일관성)는 Chain-of-Thought의 확장으로, 같은 문제를 여러 번 풀게 하되 매번 다른 추론 경로를 거치게 한 뒤 가장 많이 나온 답을 채택합니다. 여러 독립적인 추론 체인이 동시에 같은 실수를 할 확률은 낮아 투표로 우발적 오류를 걸러낼 수 있습니다. 대신 연산량은 몇 배로 늘어납니다.

"추론 모델"과는 다른 것

Chain-of-Thought는 어떤 대규모 언어 모델에도 쓸 수 있는 프롬프트 방법이고, "추론 모델"(o1, DeepSeek-R1 등)은 단계적 사고에 특화되도록 훈련된 모델 유형입니다. 일반 모델은 Chain-of-Thought의 "촉진"으로 단계적으로 생각하고, 추론 모델은 타고나게 그렇게 합니다. 후자에 Chain-of-Thought를 덧씌워도 효과는 보통 크지 않습니다.

쓰기 전에 알아야 할 네 가지 한계

첫째, 토큰 비용이 큽니다. 모든 단계가 출력되므로 어려운 문제는 몇 배의 토큰을 씁니다. 둘째, 추론 환각입니다. 단계는 그럴듯해 보여도 결론이 틀릴 수 있는데, 모델은 "추론처럼 보이는 텍스트"를 잘 만들 뿐이므로 핵심 단계는 사람이 확인해야 합니다. 셋째, 소형 모델에서는 효과가 제한적입니다. 효과는 모델의 기본 역량에 크게 의존하며, 너무 작은 모델은 단계를 적어도 자주 틀립니다. 넷째, 긴 체인에서의 오차 누적입니다. 단계가 많아질수록 어딘가에서 틀릴 확률이 올라가고, 한 번 틀리면 연쇄적으로 무너질 수 있습니다.

흔한 두 가지 오해

오해 하나: Chain-of-Thought를 쓰면 모델이 "진짜로 추론"한다. 아닙니다. 단계별 텍스트 생성을 유도할 뿐, 모델은 여전히 확률에 따라 다음 토큰을 예측하며 인간 같은 논리 검증 장치가 없습니다. 오해 둘: 표시된 사고 체인이 모델의 "진짜 생각"이며 설명 가능성의 증거가 된다. 이는 위험합니다. 표시되는 단계는 사용자에게 보여주기 위해 생성된 텍스트로, 내부의 실제 계산 과정과 같지 않습니다. 결론을 먼저 정하고 단계를 나중에 끼워 맞춘 사례도 연구에서 발견됐으며, 단계는 사후적 정당화에 불과할 수 있습니다.

시도해 볼 만한 장면

수학 계산, 논리적 추론, 다단계 계획, 근거 인용이 필요한 질의응답이 Chain-of-Thought의 주무대입니다. 창작, 잡담, 단순 사실 조회에는 토큰 낭비가 되기 쉽습니다. 기준은 단순합니다. 엄밀한 도출이 요구될수록 효과가 크고, 답이 주관적이고 열려 있을수록 필요 없습니다.

Chain-of-Thought는 "생각하고 말하기"를 재현 가능한 조작으로 바꿨습니다. 사용법보다 그 경계와 오해를 기억하는 편이 중요합니다.

추천 도구

더보기