Ya Metrika Fast


Реестр деклараций

Большие языковые модели для малых языков

Общество — 8 сентября 2026 16:00
0
Изображение 1 для Большие языковые модели для малых языков

Многое уже сказано о рисках для вооружённых сил и безопасности из-за искусственного интеллекта (ИИ). Но мало кто обращает внимание на угрозы для культуры и экономики, которые исходят от больших языковых моделей (LLM), обученных на небольшом числе языков и принадлежащих горстке транснациональных компаний. Рыночное доминирование таких LLM ставит в крайне невыгодное положение развивающиеся страны с языками меньшинства.

AI сокращение
  • Большие языковые модели обучаются примерно на ста из более чем семи тысяч языков; большая доля данных приходится на английский и другие языки «большой пятёрки» (китайский, испанский, французский и немецкий).
  • Смещение доступов к ИИ в развивающихся странах связано с языковой предвзятостью и рыночным доминированием компаний, управляющих LLM.
  • С момента запуска ChatGPT в ноябре 2022 года обсуждают потенциал ИИ в здравоохранении и образовании, прирост производительности и доходов, но выгоды неравномерно распределяются.
  • Украина: Киевстар сотрудничает с министерством цифровой трансформации для разработки национальной LLM на украинском и дополнительных языках (русский, болгарский, крымско-татарский); отбор текстов для обучения контролировали четыре консультативных комитета.
  • GSMA реализует инициативу Африканские языковые модели ИИ и программу EmergingTech для поддержки локальных ИИ-моделей и стартапов в Африке южнее Сахары, финансирование — British FCDO.
  • Примеры проектов: ToumAI в Марокко — голосовые интерфейсы на местных диалектах; Wiseyak в Непале — многоязычное решение для диалогового ИИ с смешанным кодом; для развития необходимы данные, участие операторов связи, открытые модели и контроль над суверенитетом данных.

С тех пор как в ноябре 2022 года компания OpenAI представила чат-бот ChatGPT, лидеры техноотрасли и власти восхваляют потенциал ИИ, который способен улучшить общество благодаря революции в сфере здравоохранения и образования, а также за счёт повышения производительности и доходов. Но эти выгоды распределяются неравномерно.

Многие развивающиеся стран не могут получить доступ к ИИ-системам из-за их языковой предвзятости. Большинство LLM обучаются примерно на ста из более чем семи тысяч языков, на которых сегодня говорят в мире. На долю английского и других «высокоресурсных» языков «большой пятёрки» (китайский, испанский, французский и немецкий) приходятся почти все используемые данные. Но английский язык является родным всего лишь для 400 млн человек, и только для 25% мирового населения первым языком является один из языков «Большой пятерки». Такой дисбаланс может привести к культурной и экономической изоляции в краткосрочной перспективе, а в долгосрочной – затормозить рост экономики и уменьшить языковое разнообразие.

Горькая ирония в том, что быстрое внедрение ИИ в богатых странах, подкрепляемое масштабным строительством дата-центров с мощной вычислительной инфраструктурой, затрудняет пользователям в развивающихся странах получение доступа к интернету и к преимуществам цифровых инструментов. Рост спроса на чипы из-за ИИ повысил цену смартфонов, сделав их недоступными для миллионов людей.

Чингиз Айтматов

Большие языковые модели должны лучше учитывать местные языки и культуры. В ином случае общества рискуют утратить свою уникальную лексику, долго формировавшуюся под воздействием исторических событий, массовой миграции и политического наследия. Более того, нынешнее отсутствие языкового разнообразия в ИИ-системах замедлит их внедрение. Цифровые финансовые услуги в Перу должны предоставляться на простом и понятном языке для того, чтобы потребители их оценили. А во Вьетнаме для эффективного лечения онлайн требуется ясность, которую способна обеспечить только модель на родном языке.

Операторы мобильной связи уникально позиционированы для создания местных языковых моделей, поскольку у них есть целые армии программистов и мощности для обработки данных. Кроме того, у них есть лицензии, и у властей они пользуются партнёрским доверием. Это важно, потому что один из главных барьеров на пути создания LLM для малых языков – отсутствие данных для обучения. Решением могли бы стать огромные объёмы данных, которыми располагают правительств, но которые обычно конфиденциальны.


Например, крупнейший украинский оператор мобильной связи «Киевстар» сформировал партнёрство с министерством цифровой трансформации для разработки первой в стране национальной LLM, адаптированной к украинскому языку и к другим языкам, на которых говорят в этой стране, включая русский, болгарский и крымско-татарский. Задача осложнялась тем фактом, что значительная часть литературы в Украине была написана в период российского господства и поэтому была признана культурно неприемлемой. В результате отбором текстов для обучения руководили четыре консультативных комитета, имевших полномочиями определять технические, правовые, культурные, исторические и лингвистические аспекты модели.

Ассоциация глобальных систем мобильной связи (GSMA), генеральным директором которой я являюсь, следует схожей стратегии во многих странах Африки южнее Сахары, включая Нигерию, Мадагаскар, Того и Демократическую Республику Конго. Речь идёт об инициативе «Африканские языковые модели ИИ», которая объединяет не только операторов мобильной связи из «Группы шести» (Airtel, Axian Telecom, Ethio Telecom, MTN, Orange и Vodacom), но и другие телекоммуникационные компании, государственные и частные организации, учёных и группы гражданского общества для того, чтобы создать масштабируемые, инклюзивные LLM для африканских языков.

С целью содействовать росту ИИ-стартапов, которые приносят позитивные социально-экономические результаты для малоимущих групп населения, ассоциация GSMA запустила программу EmergingTech. Она финансируется британским министерством иностранных дел, по делам Содружества и развития. В числе компаний первой группы – ToumAI, которая разрабатывает голосовые интерфейсы на местных диалектах Марокко, чтобы помочь малограмотным сельским пользователям получать доступ к цифровым и финансовым услугам с помощью простых голосовых команд, и Wiseyak, которая разрабатывает многоязычное решение для диалогового ИИ со смешанным кодом, чтобы сократить цифровое неравенство в Непале.

Эти инициативы крайне важны при переходе мира от ИИ, отвечающего на запросы, к самостоятельному, агентному ИИ. В цифровых услугах, в том числе банковских, медицинских и образовательных, для оказания помощи пользователям всё чаще используется искусственный интеллект, который станет ключевым фактором поддержания жизни и доходов. Стоит также отметить, что компаниям выгодны модели с открытым исходным кодом.

Инвестиции в локальные ИИ-модели создают благотворный круг в развивающихся странах, поскольку формируют резерв технических талантов, а это крайне важно для цифровой независимости. На фоне усиления озабоченности суверенитетом данных и их обработки развивающиеся страны должны улучшать оперативный контроль и управление при внедрении агентного ИИ. Это означает, что в сотрудничестве с программистами и операторами мобильной связи надо создавать модели на малых языках, соответствующие нуждам обществ в развивающихся странах.

Copyright: Project Syndicate, 2026. www.project-syndicate.org


Вивек Бадринат

Генеральный директор Ассоциации глобальной системы мобильной связи (GSMA).

Поделиться публикацией
Комментариев пока нет

Все комментарии проходят предварительную модерацию редакцией и появляются не сразу.