ToolNavs 유용한 AI 도구 찾기
도구 제출 로그인
돌아가기 AI 정보
앤트, Ling-3.1-flash 발표: 5,600억 파라미터, 에이전트와 장문 작업을 위해

앤트, Ling-3.1-flash 발표: 5,600억 파라미터, 에이전트와 장문 작업을 위해

AI 정보 • Admin • • 3 회 조회

2026년 9월 30일, 앤트그룹 산하 InclusionAI(백령)는 공식 위챗 계정을 통해 차세대 언어 모델 Ling-3.1-flash를 발표했다. 총 파라미터 5,600억, 추론 시 활성화되는 파라미터는 약 250억에 불과하며, 에이전트 작업, 검색, 오피스 소프트웨어, 전문 애플리케이션을 주 무대로 삼는다. flash 시리즈가 파라미터 규모를 5,000억급으로 끌어올린 것은 이번이 처음이다.

파라미터는 약 5배, 그래도 "flash"는 효율을 이야기한다

전 세대 Ling-3.0-flash는 "작고 빠른" 노선을 걸었다. 총 파라미터 1,240억, 활성화 51억, 하이브리드 어텐션 아키텍처로 Blackwell 4장에서 단일 요청 606토큰/초의 처리량을 기록했고, MIT 라이선스로 오픈소스화되어 많은 개발자가 셀프 호스팅해 왔다. 반면 Ling-3.1-flash는 총 파라미터 5,600억, 활성화 250억으로 단숨에 끌어올려 전 세대 약 5배의 규모가 됐다.

활성화 파라미터는 총 파라미터의 약 20분의 1에 불과하다. 이는 혼합 전문가(MoE) 아키텍처의 논리 그대로다. 모델 안에 다수의 "전문가" 모듈을 두고 추론마다 가장 관련성 높은 것만 호출함으로써 지식 용량과 추론 비용을 분리하는 것이다. "파라미터는 크고 활성화는 작다"의 원리에 대해서는 이 해설을 참고하라. 혼합 전문가(MoE)란? 인기 모델의 파라미터가 큰데 활성화는 작은 이유.

100만 토큰이 목표, 시범 기간은 일단 25.6만부터

공식 발표에 따르면 Ling-3.1-flash는 최대 100만 토큰의 컨텍스트 윈도우를 설계 목표로 하며 "현실 세계의 장문 작업"을 겨냥한다. 다만 현재 진행 중인 2주 무료 시범에서는 컨텍스트 상한이 25.6만 토큰이다. 시범 종료 후 더 큰 윈도우를 개방하고 모델을 오픈소스화할 계획이다.

이 흐름은 백령의 정석이다. 먼저 무료 시범으로 실제 사용 시나리오의 피드백을 모은 뒤 오픈소스화하는 것이다. 그동안 Ling 시리즈의 다수 모델이 MIT 라이선스로 공개되어 온 점을 감안하면 "시범 후 오픈소스화" 약속은 충분히 신뢰할 만하다.

포지셔닝 순서가 의도를 드러낸다: 채팅에서 "일"로

발표에서 가장 주목할 점은 포지셔닝의 순서다. 에이전트 작업이 맨 앞에 놓였고, 그 뒤로 검색, 오피스 소프트웨어, 전문 애플리케이션이 이어진다. 즉 Ling-3.1-flash는 범용 채팅에 최적화된 모델이 아니라 "하나의 일을 끝까지 해내는" 긴 체인의 작업을 위해 설계된 것이다. 여러 차례의 도구 호출, 장문 문서 처리, 앱 간 연계 — 이런 장면에서야말로 컨텍스트 길이와 안정성이 관건이다.

장문 작업 전선: 백령이 노리는 것

"작고 빠른"에서 "크고 충실한"으로 — 백령의 제품 전환은 업계 전체의 무게중심 이동을 비추고 있다. 2026년의 경쟁은 더 이상 채팅 품질의 싸움이 아니라, 현실의 작업을 안정적으로 완수할 수 있는 모델이 어느 것인가의 싸움이다. 에이전트 장면에서는 모델이 수십 차례의 상호작용 동안 목표를 흔들림 없이 유지하고, 도구를 정확히 호출하며, 초장문 입력을 처리해야 한다. 대파라미터와 장컨텍스트의 조합이 풀려는 문제는 바로 이것이다.

개발자에게 지금 가장 현실적인 행동은 이 2주 무료 시범을 활용하는 것이다. 25.6만 토큰 컨텍스트면 대부분의 장문 작업 워크플로를 검증할 수 있고, 시범 후 오픈소스 버전이 MIT 라이선스를 이어받는다면 기업은 라이선스 비용 없이 5,600억 파라미터급 장문 작업 모델을 셀프 호스팅할 수 있다 — 중국산 모델에서는 드문 일이다. 전 세대 모델의 실측 성능은 여기에서 확인할 수 있다. Ling 3.0 Flash 디코딩 가속: Blackwell 4장으로 단일 요청 606토큰/초.

추천 도구

더보기