Мой блог
Falcon-Emirati-7B: новая языковая модель для эмирского диалекта и культуры
Подробности изложены в материале первоисточника. Арабский язык на практике представляет собой целое семейство живых наречий. Если в официальных текстах и новостях используется стандартный арабский, то повседневное общение, шутки и истории в ОАЭ происходят на эмиратском диалекте. Именно этот разрыв призвана преодолеть моя новая разработка — Falcon-Emirati-7B, созданная для глубокого понимания местной культуры.
Традиционные языковые модели часто упускают скрытый смысл метафор, пословиц и поэзии на диалекте. В этом материале я подробно разберу архитектуру новинки, особенности сбора данных и результаты тестирования.
Создание на базе Falcon-H1-Arabic
Я не стал разрабатывать систему с нуля, а взял за основу семейство моделей Falcon-H1-Arabic. Гибридная архитектура объединяет линейные механизмы пространства состояний Mamba и механизмы внимания Transformer, обрабатывая длинные последовательности с высокой эффективностью.
Базовое семейство включает версии на 3, 7 и 34 миллиарда параметров. Для эмирского диалекта я выбрал вариант на 7 миллиардов параметров. Это оптимальный баланс: модель достаточно крупная для тонких языковых нюансов, но при этом экономичная в обучении и инференсе.
Почему адаптация к диалекту вызывает трудности
Превращение универсальной языковой модели в узкого специалиста по эмиратскому наречию оказалось сложной задачей по нескольким причинам.
Эмиратский диалект преимущественно устный. В письменном виде в сети он встречается гораздо реже литературного арабского языка. Кроме того, значение слов часто бывает не буквальным, а идиомы и поговорки опираются на специфический культурный контекст.
Подход к сбору и подготовке данных
Для обучения я сформировал специализированный конвейер данных, который опирается на три ключевых источника информации.
1. Аутентичные диалектные тексты из интернета
Я собрал и отфильтровал контент с локальных эмиратских сайтов и форумов, где общение ведется на живом диалекте без машинного перевода. Это позволило зафиксировать реальные обороты речи и естественные переключения между диалектом и стандартом.
2. Материалы об эмиратской культуре на стандартном арабском
Помимо разговорного текста, я задействовал статьи и документы об истории, традициях, этикете и социальных нормах ОАЭ. Это дает модели понимание того, о чем идет речь в диалоге на культурные темы.
3. Синтетические данные под управлением глоссариев
Чтобы закрыть пробелы в различных темах, я сгенерировал синтетический массив данных. Использование строгих правил, словаров и грамматических ограничений позволило избежать искусственного звучания.
Методология оценки качества
Для контроля прогресса я использовал два взаимодополняющих метода проверки результатов.
Ручная оценка носителями языка
Носители эмирского диалекта оценивали ответы модели с точки зрения естественности, тона и культурной умеренности, что невозможно полностью измерить автоматическими метриками.


Автоматический бенчмарк Alyah
В качестве количественного ориентира применялся бенчмарк Alyah, состоящий из 1173 вопросов с вариантами ответов. Он охватывает все аспекты от повседневных приветствий до сложной поэзии.


Результаты тестирования
В тестах на бенчмарке Alyah модель Falcon-Emirati-7B набрала 84.83%, опередив все сопоставимые арабские и многоязычные аналоги, включая решения большего размера.


Анализ результатов показывает, что масштаб модели не гарантирует владение диалектом без целенаправленного обучения. Модели общего назначения теряют эффективность на культурно укорененном материале.


Оценка с помощью LLM-судьи и генерации текста
Помимо тестов с выбором ответа, я провел оценку открытой генерации при помощи судьи Gemini 3.7 Flash, который проверял правильность фактов и верность выбора диалекта.

На диалектной верности Falcon-Emirati-7B показала результат 0.52 балла, в то время как конкуренты практически полностью скатывались в стандартный арабский язык. Модель стабильно отвечает именно на том диалекте, на котором к ней обращаются.
Парное сравнение по категориям
При слепом парном сравнении ответов Falcon-Emirati-7B уверенно побеждает конкурентов в большинстве тематических блоков, особенно в поэзии и творческом выражении, уступая лишь в базовых приветствиях.
Понимание эмиратской культуры
Язык неотделим от культуры, поэтому модель прошла проверку на эмиратском подмножестве бенчмарка ArabCulture-Dialogue для оценки культурного контекста.
Falcon-Emirati-7B продемонстрировала точность в 85.57% на 283 эмирских сценариях, подтвердив способность находить наиболее подходящие реакции в локальном общении.
Безопасность и ограничения
Как и любая нейросеть, эта система может отражать предвзятость обучающих данных и совершать ошибки в редких локальных идиомах. Рекомендуется оценивать ее работу для критически важных задач.
