ToolNavs AI 도구 탐색
도구 제출 로그인
돌아가기 AI 백과사전
추측적 디코딩이란 무엇인가요? 왜 작은 모델이 먼저 초안을 작성할 수 있는데, 그럼 큰 모델은 더 빨라질까요?

추측적 디코딩이란 무엇인가요? 왜 작은 모델이 먼저 초안을 작성할 수 있는데, 그럼 큰 모델은 더 빨라질까요?

AI 백과사전 Admin 2 회 조회

추측적 디코딩은 대규모 모델 추론 가속 방법으로, 먼저 더 가볍고 빠른 초안 모델이 여러 후보 토큰을 연속으로 제안한 후, 대상 대형 모델이 병렬 검사를 수행합니다. 후보가 수락되면, 대상 모델은 단일 순방향 계산에서 여러 순위를 이동시킬 수 있습니다; 미확인된 부분은 대상 모델에 의해 수정됩니다. 이는 단순히 두 모델의 답변을 이어 붙이는 것이 아니라 생성 대기 시간을 최적화합니다.

각 토큰마다 느려짐이 생성됩니다

자기회귀 모델은 보통 첫 번째 토큰으로 형성되어야 두 번째 토큰이 진행될 수 있습니다. 강력한 GPU 컴퓨팅 파워가 있어도 이 직렬 의존성 때문에 디코딩 중 자주 단순방향 계산이 발생하고, 하드웨어가 충분히 활용되지 않을 수 있습니다. 디코딩은 먼저 후속 내용을 초안한 뒤, 이를 대규모 모델에 제출해 배치 채점하여 대상 모델에 대한 호출 횟수를 줄이는 것으로 추정됩니다.

이 과정은 네 단계로 이해할 수 있습니다:

  1. 초안 모델은 현재 맥락에 기반한 짧은 후보 서열 시퀀스를 제안합니다.
  2. 목표 모델은 이러한 위치들의 확률을 병렬로 계산합니다.
  3. 후보자는 수락 규칙에 따라 유지되며, 직위가 일치하지 않으면 수락이 중단됩니다.
  4. 목표 모델은 다음 초안 작성 전에 올바른 분과를 보완합니다.

표준 알고리즘은 지원 수용 및 보정 규칙을 사용하여 대상 모델의 원래 샘플링 분포를 유지할 수 있습니다; 큰 모델을 비밀리에 작은 모델로 대체하지 않으며, 목표 모델을 재학습할 필요도 없습니다.

왜 항상 더 빠르지 않을까요?

핵심 지표는 후보자 수용률입니다. 초안 모델이 너무 약하면 처음 몇 토큰 내에 거부되는 경우가 많고, 추가 초안은 오버헤드가 됩니다; 초안 모델이 너무 크면 '저렴한 생성'의 의미를 잃게 됩니다. 텍스트 예측 가능성, 라운드당 후보자 길이, 하드웨어 병렬성, 배치 크기 등이 모두 수익에 영향을 미칩니다. 코드와 고정 형식처럼 강한 연속성을 가진 콘텐츠는 매우 다양한 생성보다 긴 초안을 더 수용할 가능성이 높습니다.

이 방법은 문제를 해결하는 다른 가속 방법과는 다릅니다

양자화는 주로 가중치 크기와 계산 비용을 줄이고, KV 캐시는 계산된 과거 주의 상태를 재사용합니다; 추측적 디코딩은 단일 대상 모델이 더 많은 토큰을 확인할 수 있도록 하는 방법에 초점을 맞춥니다. 이 방법들은 결합할 수 있지만, 함께 메모리를 소모하고 스케줄링 복잡도를 증가시킵니다.

채택할 가치가 있는지 판단하려면 데모의 속도만 마세요. 배포팀은 첫 토큰 시간, 토큰당 지연, 처리량, 메모리 사용량에 대해 프롬프트 길이, 출력 길이, 동시성 볼륨, 하드웨어를 비교하고, 가속이 안정성 저하를 대가하지 않는지 확인해야 합니다.

추천 도구

더보기