LLM 추론 최적화
요청을 묶는 방식만 바꿔도 같은 GPU의 처리량이 몇 배 달라집니다. 연속 배치, 추측 디코딩, KV 캐시, 컨텍스트 캐시가 각각 어느 구간의 비용을 줄이는지, 커널 라이브러리와 희소 구조로 어디까지 당길 수 있는지 정리합니다.
요청을 묶는 방식만 바꿔도 같은 GPU의 처리량이 몇 배 달라집니다. 연속 배치, 추측 디코딩, KV 캐시, 컨텍스트 캐시가 각각 어느 구간의 비용을 줄이는지, 커널 라이브러리와 희소 구조로 어디까지 당길 수 있는지 정리합니다.
연속 배치 처리는 대형 모델의 서버 측에서 사용되는 동적 스케줄링 방법으로, 시스템은 같은 배치 내 모든 요청이 생성될 때까지 다음 배치를 교체하기 전에 기다릴 필요가 없습니다; 대신 각 생성 단계가 끝난 후 완료된 요청을 제거하고 새로운 요청을 추가합니다. 주로 GP...
추측적 디코딩은 대규모 모델 추론 가속 방법으로, 먼저 더 가볍고 빠른 초안 모델이 여러 후보 토큰을 연속으로 제안한 후, 대상 대형 모델이 병렬 검사를 수행합니다. 후보가 수락되면, 대상 모델은 단일 순방향 계산에서 여러 순위를 이동시킬 수 있습니다; 미확인된 부분은...
컨텍스트 캐싱은 모델에 반복적으로 전송될 컨텍스트를 캐시하고, 이후 요청을 매번 재처리하는 대신 가능한 한 재사용하는 것을 의미합니다. 최근 뜨거워지는 이유는 매우 현실적입니다: 장기 문맥 제품이 점점 더 많아지고 있지만, 아무도 같은 큰 문서, 규칙, 코드베이스에 계...
전문가 혼합(Mixture of Experts, MoE)은 "매번 전체 모델을 조립하지 않는" 모델 아키텍처입니다. 가장 중요한 기능은 모델의 일부 계층이 여러 전문가 모듈로 나뉘고, 라우터가 현재 토큰이 어떤 전문가를 선택할지 결정한다는 점입니다. 이렇게 하면 모델의...
KV 캐시는 트랜스포머의 추론 단계에서 매우 중요한 캐싱 메커니즘 계층입니다. 간단히 말해, 모델이 이미 계산한 키와 값 중 일부를 먼저 저장한 뒤, 매번 처음부터 다시 계산하는 대신 생성 시 직접 재사용합니다. 이 때문에 KV 캐시는 긴 대화, 긴 맥락, 추론 속도에...
희소주의는 간단히 이해할 수 있습니다: 각 토큰이 모든 토큰을 살펴보는 대신, 선택적으로 일부만 살펴보게 하는 것입니다. 이 용어는 긴 맥락과 추론 비용 논의에서 반복적으로 등장하는데, 표준 전면 집중이 강하지만, 맥락이 특히 길어지면 계산과 비디오 메모리 비용이 급격...
1. 초록 HPC-Ops는 텐센트의 Hunyuan AI 인프라 팀이 개발한 오픈소스 생산용 LLM 추론 연산자 라이브러리로, 주류 추론 카드(특히 H20과 같은 NVIDIA Hopper/SM90)를 하드웨어 활용도를 한층 더 가깝게 만드는 것을 목표로 하고 있습니다. ...
Moonshot AI는 Kimi Linear 기술 보고서와 공개 가중치를 발표하며 핵심 구성 요소인 Kimi Delta Attention(KDA) 선형 어텐션 모듈과 선형 및 전체 어텐션(MLA)을 결합한 계층적 하이브리드 아키텍처를 강조했습니다. 2025년 10월 3...