ToolNavs 发现实用AI工具
提交工具 登录
返回AI资讯
Falcon-Emirati-7B 发布:7B 模型专攻阿联酋方言,文化题得分 85.57%

Falcon-Emirati-7B 发布:7B 模型专攻阿联酋方言,文化题得分 85.57%

AI资讯 • Admin • • 5 次浏览

Falcon-Emirati-7B 在 2026 年 10 月 6 日由阿联酋技术创新研究所(TII)通过 Hugging Face 官方博客发布。这是一款专门为阿联酋方言打造的 7B 模型,基座是 TII 自家的 Falcon-H1-Arabic:一种把 Mamba 状态空间模型与 Transformer 注意力并行融合的混合架构。它的目标很窄,也很明确——让模型像本地人一样理解和使用阿联酋阿拉伯语,而不只是把标准阿拉伯语说得流利。目前模型已上线 Falcon 聊天平台供试用。

答得对标准阿拉伯语,不等于听得懂方言

阿拉伯语名下其实是一个语系:新闻和课本用的是现代标准阿拉伯语,但阿联酋人的日常交谈、玩笑、谈判和讲故事,用的都是海湾方言。纳巴提诗歌、谚语和典故的含义大量依赖共享的文化背景,逐字翻译全对,也可能完全会错意。通用阿拉伯语模型最常见的翻车方式,是听懂了问题,却默认用标准阿拉伯语作答——内容没错,语域全错。Falcon-Emirati-7B 要补的就是这一层。

数据从三处来,还要过原生语者这一关

方言适配的第一个麻烦是语料:阿联酋方言以口语为主,网上留下的原生文本远少于标准阿拉伯语。TII 的做法是三路并进:从阿联酋网站和论坛抓取、清洗原生方言文本;补入用标准阿拉伯语写成的阿联酋文化、历史与礼俗材料,让模型知道自己在谈什么;再用专门编纂的方言词表和文体规则约束合成数据生成,避免造出语法没错、本地人一听就假的句子。训练策略同样没有现成配方,团队对数据配比、注入阶段和监督方式做了多轮消融实验,每一步都同时看自动评分和原生语者的听感判断。最终选 7B 而不是 34B,是在方言细腻度与训练、推理成本之间取的平衡点。

两张成绩单:一张看对错,一张看像不像

第一张是 Alyah 基准:1,173 道由原生语者手工收集的选择题,覆盖日常问候、比喻表达、文化遗产知识和诗歌等类别,Falcon-Emirati-7B 得分 84.83%,高于参与对比的其他阿拉伯语与多语言模型。在 ArabCulture-Dialogue 的阿联酋部分(283 个场景)上,它以 85.57% 居首,排在后面的 ALLaM-7B 是 83.39%,Jais-2-8B 为 73.79%,参数量大得多的 Fanar-2-27B 只有 71.50%。

第二张更有意思:开放式生成时,由 Gemini 3.7 Flash 担任评委,单独给“是否用阿联酋方言作答”打分,Falcon-Emirati-7B 的方言保真度是 0.52,而 ALLaM、gemma-3-27b-it、Jais-2-8B、Fanar-2-27B 分别只有 0.05、0.03、0.02 和接近 0——其他模型常常知道正确答案,却用标准阿拉伯语说出来。它也不是全胜:在问候与日常表达这一类上,它输给了 Jais-2-8B,因为这一类里方言与标准语重合最多;TII 也提醒,罕见表达和高度本地化的指涉仍可能出错,敏感或正式场合使用前应先自行评测。

这件事给多语言模型立了一个可复用的判断标准:参数规模买不来方言能力,语种数量写在规格表上更说明不了什么。真正有效的路径,是为单个方言准备原生数据、原生评测,再让原生语者做最后的验收——这套方法不只适用于阿联酋方言。

推荐工具

更多