Falcon-Emirati-7B는 2026년 10월 6일 아랍에미리트 기술혁신연구소(TII)가 Hugging Face 공식 블로그를 통해 공개한, 아랍에미리트 방언 전용 7B 모델이다. 기반은 TII 자체 모델 Falcon-H1-Arabic으로, Mamba 상태공간 모델과 Transformer 어텐션을 병렬로 융합한 하이브리드 아키텍처를 쓴다. 목표는 좁고 분명하다. 현대 표준 아랍어를 유창하게 하는 것이 아니라, 현지인처럼 아랍에미리트 아랍어를 이해하고 구사하는 것이다. 모델은 현재 Falcon 챗 플랫폼에서 체험할 수 있다.
표준 아랍어로 맞게 답하는 것과 방언을 알아듣는 것은 다르다
아랍어라는 이름 아래에는 사실 하나의 어족이 들어 있다. 뉴스와 교과서는 현대 표준 아랍어를 쓰지만, 아랍에미리트의 일상 대화와 농담, 협상, 이야기에는 걸프 방언이 쓰인다. 나바티 시와 속담, 고사의 뜻은 공유된 문화 배경에 크게 의존해서, 단어 하나하나가 맞는 번역도 정작 의미는 빗나갈 수 있다. 범용 아랍어 모델이 가장 흔하게 실패하는 방식은 질문은 정확히 알아들으면서도 기본값으로 표준 아랍어 답변을 내놓는 것이다. 내용은 맞는데 어투가 완전히 다르다. Falcon-Emirati-7B가 메우려는 것이 바로 그 간극이다.
데이터는 세 갈래로 모으고, 마지막은 원어민의 귀로 검수한다
방언 적응의 첫 번째 난제는 데이터다. 아랍에미리트 방언은 구어가 중심이라 온라인에 남은 원어 텍스트가 표준 아랍어보다 훨씬 적다. TII는 세 가지 경로를 동시에 썼다. 현지 웹사이트와 포럼에서 원어 방언 텍스트를 수집·정제하고, 표준 아랍어로 쓰인 아랍에미리트 문화·역사·예절 자료를 보태 모델이 무슨 이야기를 하는지 알게 하며, 전용으로 편찬한 방언 용어집과 문체 규칙으로 합성 데이터 생성을 묶어 문법은 맞지만 현지인이 들으면 가짜인 문장이 나오지 않게 했다. 학습 전략에도 정해진 레시피가 없어, 데이터 배합과 주입 단계, 감독 방식을 두고 여러 차례 절제 실험을 하며 단계마다 자동 점수와 원어민의 청감 판단을 함께 봤다. 34B가 아닌 7B를 고른 것은 방언의 섬세함과 학습·서빙 비용 사이의 균형점이다.
성적표는 두 장: 맞는지를 보는 표와, 방언답게 들리는지를 보는 표
첫 번째는 Alyah 벤치마크다. 원어민이 손으로 모은 1,173개의 객관식 문항으로 일상 인사, 비유 표현, 문화유산 지식, 시 등의 분야를 덮으며, Falcon-Emirati-7B는 84.83%로 비교 대상인 다른 아랍어·다국어 모델을 모두 앞섰다. ArabCulture-Dialogue의 아랍에미리트 부분 283개 시나리오에서는 85.57%로 1위를 차지했고, ALLaM-7B 83.39%, Jais-2-8B 73.79%, 훨씬 큰 Fanar-2-27B 71.50%가 뒤를 이었다.
두 번째 표가 더 본질을 보여 준다. 자유 생성에서는 Gemini 3.7 Flash가 심사위원을 맡아 '아랍에미리트 방언으로 답했는가'를 따로 채점했는데, Falcon-Emirati-7B의 방언 충실도는 0.52였고 ALLaM, gemma-3-27b-it, Jais-2-8B, Fanar-2-27B는 각각 0.05, 0.03, 0.02, 사실상 0이었다. 다른 모델들은 정답을 알면서도 표준 아랍어로 말해 버리는 경우가 많다. 전승은 아니다. 인사와 일상 표현 분야에서는 방언과 표준어의 겹침이 가장 커서 Jais-2-8B에 근소하게 졌다. TII는 드문 표현이나 고도로 지역적인 지시에서는 틀릴 수 있으며, 민감하거나 공식적인 용도 전에는 직접 평가하라고도 주의를 준다.
다국어 모델 전반에 재사용할 수 있는 판단 기준이 여기서 나온다. 파라미터 규모로는 방언 능력을 살 수 없고, 사양표에 적힌 언어 수는 아무것도 증명하지 못한다. 통하는 길은 방언마다 원어 데이터와 원어 벤치마크를 준비하고 마지막 검수를 원어민에게 맡기는 것이며, 이 방법은 아랍에미리트 방언 밖에서도 유효하다.