AstaBrief 8B는 Ai2(Allen Institute for AI)가 2026년 10월 2일 오픈소스로 공개한 과학 보고서 생성 모델이다. 연구 질문과 검색된 문헌 발췌를 입력하면 인용이 달린 보고서를 바로 만들어 낸다. 모델은 Ai2의 과학 연구 플랫폼 Asta의 '보고서 생성' 기능에서 Fast mode로 이미 서비스 중이며, 가중치와 훈련 데이터가 함께 공개됐다. 모델은 Hugging Face의 allenai 조직 AstaBrief_8B 저장소에 올라가 있다.
과학 보고서에 전용으로 훈련된 작은 모델이 필요한 이유
과학 글쓰기가 모델에 까다로운 지점은 문장력이 아니다. 답은 증거에 붙어 있어야 하고, 어떤 연구의 결론을 슬그머니 넓혀 말해서는 안 되며, 연구자는 각 인용이 해당 주장을 실제로 뒷받침하는지 확인할 수 있어야 한다. Ai2가 검증하려 한 것은 Qwen3-8B를 기반으로 보고서 생성에만 후훈련한 8B 오픈 모델이, 그동안 써 온 비공개 모델 파이프라인의 품질에 근접하면서 생성 시간과 서빙 비용을 낮출 수 있는가였다. 설계상 이 모델은 발췌 요약과 클러스터링 단계를 건너뛰고 보고서 전체를 한 번에 써 낸다.
핵심은 알고리즘이 아니라 데이터를 어떻게 거르느냐
AstaBrief는 지도 미세조정과 직접 선호 최적화(SFT + DPO)라는 통상적인 조합을 쓰며, 공은 데이터에 들였다. SFT 샘플은 실제 연구자들의 질의에서 나왔다. 약 9만 건의 후보 질의를 품질, 관련성, 프라이버시 기준으로 거른 뒤 ScholarQA 파이프라인으로 완성된 보고서를 생성해 목표 출력으로 삼아 약 4만 7천 건의 사용 가능한 샘플이 남았고, 생성에는 Claude 3.5 Sonnet, Claude 3.7 Sonnet, o3, o4-mini, GPT-4.1이 섞여 쓰였다. DPO 단계에서는 약 6천 쌍의 선호 샘플을 만들었는데, GPT-4.1과 DeepSeek-R1 두 심사 모델의 의견이 일치하는 경우만 남겼다. 두 심사 모델은 인간 선호와 95% 일치한다. 네 가지 통계 필터를 시험한 결과 가장 효과가 좋았던 것은 가장 단순한 '인용 밀도', 즉 합성 보고서가 주장마다 꾸준히 인용을 다는가였다. 더 복잡한 필터 조합은 추가 효과를 내지 못했다. 전체 Asta 파이프라인에서 Fast mode는 보고서 한 편에 평균 51.1초, Thinking mode의 178.5초와 비교하면 약 3.5배 빠르다. SQABench-CS2, DeepScholarBench 같은 평가와 소규모 인간 연구에서 답과 인용의 품질은 Claude 기반 파이프라인과 같은 수준이었다.
어디에 쓸 수 있고, 한계는 어디인가
가중치가 공개돼 있어 기관은 AstaBrief를 자체 인프라에서 돌릴 수 있다. 발표되지 않은 성과와 관련된 민감한 연구 질문을 내부 밖으로 내보낼 필요가 없다. Ai2는 연구자가 자신의 PDF 문헌으로 보고서를 만들 수 있는 개조 가능한 예시 워크플로도 제공한다. 한계도 솔직히 적혀 있다. 훈련 데이터와 비교 기준은 2025년 수준의 프론티어 모델을 반영한 것이며, Ai2는 오늘의 프론티어 모델로 전체 평가를 다시 돌리지는 않았다고 명시했다. 또 인용이 올바른 논문을 가리켜도 주장이 그 논문이 보여 준 범위를 넘어설 수 있다. 특정 표본의 발견을 보편적 규칙처럼 말하는 식의 미묘한 확대는 현재 지표로 잡아내기 어렵다. 연구 도구를 만드는 이들에게 주는 시사점도 있다. 모델을 전문적으로 만드는 길이 사전훈련에 도메인 텍스트를 쌓는 것만은 아니며, 후훈련 데이터의 구성과 그 데이터가 '인용을 실체에 닿게 하는' 행동을 보여 주는지가 출력 품질을 실질적으로 바꿀 수 있다.