알리바바 통이가 QwQ-32B를 발표했습니다: 강화 학습 기반 추론 업그레이드, 32B 매개변수는 더 큰 모델 성능에 근접합니다
알리바바 통이는 강화 학습을 통한 추론 성과 향상에 중점을 둔 QwQ-32B를 출시했습니다. 힙 매개변수의 규모만을 다루는 것과 달리, 이번 업데이트의 핵심은 320억 파라미터 모델을 사용해 복잡한 추론 작업에 더 큰 모델의 효과를 근사화하여 '더 가볍지만 더 사고가 ...
AI 정보 • Admin •
87