Falcon-Emirati-7B は 2026 年 10 月 6 日、アラブ首長国連邦の技術革新研究所(TII)が Hugging Face の公式ブログで発表した、アラブ首長国連邦方言に特化した 7B モデルです。基盤は TII 自身の Falcon-H1-Arabic で、Mamba の状態空間モデルと Transformer の注意機構を並列に融合させたハイブリッドアーキテクチャを採用しています。狙いは狭くて明確で、標準アラビア語を流暢に話すことではなく、現地の人のように首長国方言を理解し、使いこなすことです。モデルはすでに Falcon のチャットプラットフォームで試用できます。
標準アラビア語で正しく答えられることと、方言が分かることは別
アラビア語という名前の下には、実は一つの語族が収まっています。ニュースや教科書は現代標準アラビア語ですが、首長国連邦の日常会話、冗談、交渉、物語は湾岸方言で交わされます。ナバティー詩やことわざ、典故の意味は共有された文化的背景に大きく依存し、一語一句正しい翻訳でも真意を外すことがあります。汎用アラビア語モデルの典型的な失敗は、質問は正確に聞き取れているのに、既定で標準アラビア語で答えてしまうことです。内容は合っていても、語域が全く違う。Falcon-Emirati-7B が埋めようとしているのは、まさにその隙間です。
データは3つの出所から、最後は母語話者の耳で確認
方言適応の第一の難題はデータです。首長国方言は話し言葉が中心で、ネット上に残る原生テキストは標準アラビア語よりはるかに少ない。TII の方法は3つの並行策でした。首長国のウェブサイトやフォーラムから原生の方言テキストを集めて整えること。標準アラビア語で書かれた首長国の文化・歴史・礼俗の資料を補い、モデルに話題の中身を理解させること。そして専用に編んだ方言用語集と文体規則で合成データの生成を縛り、文法は正しいのに現地の人が聞けば偽物と分かる文を作らせないことです。訓練戦略にも既成のレシピはなく、データ配分、投入段階、監督方法について何度もアブレーションを行い、各段階で自動スコアと母語話者の聴感の両方を確認しました。34B ではなく 7B を選んだのは、方言の細やかさと訓練・提供コストの釣り合い点としてです。
成績表は2枚:正しさを見るものと、らしく聞こえるかを見るもの
1枚目は Alyah ベンチマークです。母語話者が手作業で集めた 1,173 問の選択式問題で、日常の挨拶、比喩表現、文化遺産の知識、詩などの分野を覆い、Falcon-Emirati-7B は 84.83% で、比較対象のアラビア語モデルと多言語モデルの全てを上回りました。ArabCulture-Dialogue の首長国部分 283 シナリオでは 85.57% で首位に立ち、ALLaM-7B の 83.39%、Jais-2-8B の 73.79%、はるかに大きい Fanar-2-27B の 71.50% が続きます。
2枚目の方が本質を示しています。自由生成では Gemini 3.7 Flash が審査員を務め、「首長国方言で答えているか」を独立に採点しました。Falcon-Emirati-7B の方言忠実度は 0.52 で、ALLaM、gemma-3-27b-it、Jais-2-8B、Fanar-2-27B はそれぞれ 0.05、0.03、0.02、ほぼ 0 でした。他のモデルは正解を知っていても、標準アラビア語で答えてしまうことが多いのです。全勝ではありません。挨拶と日常表現の分野では、方言と標準語の重なりが最も大きいこともあり、Jais-2-8B に僅差で敗れています。TII は、珍しい表現や高度に地域的な言及では誤り得ること、機微な用途や公式用途の前には自身で評価すべきことも注意しています。
多言語モデルへの再利用可能な教訓は、その判定基準です。パラメータ規模では方言能力は買えず、仕様表の言語数の多さは何の証明にもなりません。効くのは、方言ごとに原生データと原生ベンチマークを用意し、最後は母語話者に検収させる方法であり、これは首長国方言以外にも通用します。