Meituan LongCat 팀은 지능형 에이전트 벤치마크 제품군인 VitaBench를 출시했습니다. 이 프레임워크는 음식 배달, 레스토랑 매장 식사, 온라인 여행이라는 세 가지 고빈도 생활 서비스 시나리오를 선택합니다. 66개의 구성 가능한 도구를 추상화하고 100개의 교차 시나리오 작업과 300개의 단일 시나리오 작업을 구성합니다. 이 시스템은 추론, 도구 사용 및 적응형 상호작용 기능을 체계적으로 측정합니다. 프로젝트 페이지와 논문은 코드, 데이터 및 순위표를 동시에 게시하여 간편한 복제 및 비교를 지원합니다.
최신 결과에 따르면 교차 시나리오 평균@4는 30.0%, 단일 시나리오 평균@4는 48.3%입니다. 교차 시나리오 통과@4 비율은 약 60%이고, 통과⁴(4/4 완전 성공) 비율은 거의 0%입니다. 이러한 데이터는 최상위 "사고/비사고" 모델이 특정 영역에서 잠재력을 가지고 있지만, 복잡한 실제 환경에서 안정성과 프로덕션 수준의 신뢰성이 부족하고 장기 계획, 도메인 간 전환, 그리고 멀티툴 협업에 여전히 어려움을 겪고 있음을 시사합니다.
자주 묻는 질문
질문: VitaBench는 어떤 기능과 시나리오를 지원하나요?
A: 음식 배달, 케이터링, 온라인 여행을 다루며 추론, 도구 호출, 적응적 상호 작용을 평가합니다. 여기에는 66개 도구와 400개 작업이 포함됩니다.
질문: 주요 지표를 어떻게 해석하나요?
A: Avg@4는 4번 시도했을 때의 평균 성공률입니다. Pass@4는 4번 시도 중 최소 1번은 성공했다는 의미입니다. Pass⁴는 4번 시도 모두 성공했다는 의미입니다.
질문: 크로스 시나리오가 더 어려운 이유는 무엇입니까?
답변: 장기적인 계획과 대규모 도구 세트와 크로스 도메인 규칙 간의 전환이 필요한데, 이로 인해 오류가 누적되고 안정성이 저하될 수 있습니다.
질문: 오픈소스인가요?
A: 네. 프로젝트 페이지, 코드 저장소, Hugging Face 데이터 세트를 제공하고, 공개 리더보드도 운영하고 있습니다.
질문: 구현을 위한 통찰력은 무엇입니까?
A: 실제 비즈니스에서 지능형 에이전트의 가용성과 일관성은 아직 부족하며, 도구 종속성 모델링, 견고성 및 오류 수정 전략을 강화해야 합니다.