Grok 4.5进入SpaceX与特斯拉私测:先看三项不确定性
2026年6月28日,Elon Musk在X上表示,Grok 4.5已进入SpaceX和特斯拉的内部私测。按其披露,这一版本基于1.5万亿参数的V9基础模型,并在补充训练中加入了Cursor相关数据;早期评估被描述为接近、甚至可能超过Opus。此时更准确的判断是:Grok 4.5已经进入真实企业环境...
AI资讯 • Admin •
178
找到 2 篇相关文章
2026年6月28日,Elon Musk在X上表示,Grok 4.5已进入SpaceX和特斯拉的内部私测。按其披露,这一版本基于1.5万亿参数的V9基础模型,并在补充训练中加入了Cursor相关数据;早期评估被描述为接近、甚至可能超过Opus。此时更准确的判断是:Grok 4.5已经进入真实企业环境...
AI Evals 指的是对大模型或 AI 应用进行系统评测。它不是随便问几个问题看看感觉,而是把真实任务变成测试集、评分标准和回归检查,用来判断模型或应用是否真的可上线。 为什么聊天体验不能代表质量 大模型回答很会“看起来合理”,但线上应用关心的是稳定性:客服是否引用正确政策,知识库是否拒答未知问题...