Как технологии Google меняют мир общения: от перевода до понимания


Технологии Google сегодня обеспечивают взаимодействие более чем на 300 языках, которые говорят более 7 миллиардов человек, что составляет 86% населения Земли. Достижение этого рубежа имеет важное значение, но также подчеркивает необходимость работы, критически важной для нашей миссии. На протяжении десятилетий технологии лучше всего работали для нескольких доминирующих языков, оставляя тысячи живых языков и диалектов слабо представленными или вовсе отсутствующими в цифровом мире. Когда мы запустили Google Translate в 2006 году, наша цель была проста: разрушить языковые барьеры. Достижения в области искусственного интеллекта помогли нам реализовать это видение для большего числа людей, расширив Translate с нескольких языков до более чем 250 сегодня. Однако простого перевода текста недостаточно. Технология должна понимать, как люди на самом деле общаются в реальном мире. Поэтому мы сосредоточили свои исследования и разработки на создании систем, которые учитывают культурные нюансы и богатство человеческого языка, позволяя каждому участвовать и быть понятым на своих условиях.

Переход от текста к истинному пониманию

Исторически системы распознавания речи следовали жесткому многоступенчатому процессу: транскрибирование аудио в текст, обработка этого текста и затем синтезирование его обратно в аудио. Хотя это работало, такая схема лишала общения самых богатых его аспектов: тона, ритма, эмоций и контекста. Люди не говорят в идеально аккуратных грамматических предложениях. Мы смеемся, перебиваем друг друга, колеблемся и смешиваем несколько языков в одном предложении, как, например, когда говорим на спанглише или хинглише. Чтобы это уловить, мы перешли от текстовых транскриптов к нативному аудио-интеллекту — обучая модели, такие как Gemini, обрабатывать аудио напрямую, а также понимать как звук, так и намерение. Эти усилия включают:
  • Инструменты для плавного диалога в реальном времени: Сегодня Gemini 3.5 Live Translate обеспечивает реальный перевод речи на 70 языках и более 2000 языковых пар, естественно захватывая переключение кодов и эмоциональные нюансы.
  • Gemini 3.5 Transcribe: наша самая точная модель распознавания речи на сегодняшний день, превращающая сырое аудио в отформатированный текст, даже в шумной обстановке или с использованием сложной терминологии. Она также поддерживает функции, такие как Rambler на Android Gboard, которая удаляет лишние слова, исправляет грамматику и пунктуацию, а также позволяет редактировать или переписывать с помощью голосовых команд и плавно переключаться между языками.
  • Инициатива 1000 языков

    Искусственный интеллект помогает нам разрушать языковые барьеры в масштабе, который ранее казался немыслимым. Но чтобы достичь большего числа людей на их предпочтительном языке, нужно выйти за пределы языков, где ИИ работает лучше всего сегодня. Наша цель — поддерживать 1000 самых распространенных языков мира. Чтобы сделать это возможным, наша Универсальная модель речи, обученная на 12 миллионах часов аудио, использовала методы перекрестного обучения, которые позволяют моделям передавать то, что они узнали из языков с большим объемом данных, для улучшения понимания речи в языках с гораздо меньшим объемом обучающих данных. Это позволяет моделям применять шаблоны, изученные на языках с большим объемом данных, к языкам с недостаточными ресурсами.

    Основные исследования

    Эта работа основывается на 25-летних открытых исследованиях и более 400 рецензируемых статьях по речи, которые помогли продвинуть границы и развить модели речи.

    Сообщество в центре языковых данных

    Поскольку веб непропорционально представляет несколько доминирующих языков, обучение ИИ пониманию недостаточно представленных языков потребовало от нас переосмыслить, как мы собираем данные. Решением стали местные партнерства. Этот локализованный подход стал основой для трех наших самых амбициозных открытых данных:
  • WAXAL (в переводе с волофа "говорить"): созданный с партнерами, включая Университет Makerere и Digital Umuganda, WAXAL представляет собой крупномасштабный открытый набор данных по речи, охватывающий 27 языков субсахарской Африки, на которых говорят более 100 миллионов человек в более чем 26 странах, захватывая тональные вариации и разговорные ритмы, часто отсутствующие в традиционных наборах данных.
  • Проект Vaani: в партнерстве с Индийским институтом науки (IISc) и Bhashini, Проект Vaani картирует языковое разнообразие Индии через подход, ориентированный на регион, а не на язык, что позволяет собрать более 30 000 часов речи на 109 языках от более чем 155 000 носителей.
  • Инициатива Amplify: мы объединились с более чем 1600 местными экспертами и 20 университетами на четырех континентах, включая UFMG в Бразилии, IIT Kharagpur в Индии и Университет Makerere в Уганде, чтобы внести 15 000 мультимодальных данных, отражающих местные нюансы.
  • Мы также продолжаем развивать нашу работу, придавая приоритет открытым языковым инновациям через наш новый инструмент Language Explorer. Это интерактивный инструмент, который визуализирует LinguaMeta, крупнейший в мире репозиторий открытых языковых данных. Признанный Fast Company за инновации в дизайне, он непрерывно отображает более 7000 разговорных, письменных и жестовых языков.

    Влияние инноваций и партнерств

    Влияние этих инноваций и партнерств наибольшее, когда они достигают людей, которые могут превратить новые данные и идеи в значимые изменения в своих сообществах. Поддерживаемые Google.org усилия, включая Центр цифрового языкового включения и проект Aquarium в Сингапуре, помогают приносить многоязычные инструменты фермерам, работникам здравоохранения, учителям и другим важным членам сообщества по всему миру.

    Преодоление реальных ограничений

    Для более чем 3 миллиардов людей надежный доступ в интернет все еще недоступен. Технология действительно доступна только тогда, когда она работает там, где живут люди, включая районы с ограниченной или прерывистой связью. Чтобы помочь решить эту проблему, мы разработали TranslateGemma, семью легковесных открытых моделей перевода, созданных на основе Gemini и обученных на 55 языках. Поскольку TranslateGemma работает эффективно на устройстве, качественный перевод больше не требует подключения к облаку или интернету. Тем не менее, запуск мощных моделей ИИ требует способного оборудования, что исключает сотни миллионов людей, которые все еще используют обычные мобильные телефоны в регионах с ограниченными ресурсами. Чтобы преодолеть этот разрыв, мы поддерживаем организации, такие как Viamo, для запуска "Спросите Viamo о чем угодно" (AVA), голосового ИИ-помощника, который приносит мощь Gemini на стандартные мобильные телефоны. Viamo успешно протестировала AVA в Руанде с существующими пользователями интерактивного голосового ответа, и сервис уже использовал Gemini для ответа на более чем 2 миллиона вопросов.

    Доступность технологий

    Язык — это не только региональные диалекты или словарный запас. Это также множество других способов общения. Обычные инструменты речи часто не учитывают людей с нестандартной речью, заставляя их адаптироваться к технологии, а не наоборот. Мы работаем над тем, чтобы изменить это, разрабатывая доступность с самого начала, например, с помощью технологии Sign Language-to-Text (SL2T). Обученная на более чем 50 жестовых языках, SL2T обеспечивает диктовку жеста в текст в Gboard и Live Transcribe на Pixel 11, начиная с американского жестового языка (ASL) до английского. Это важный первый шаг к тому, чтобы сделать наши продукты более доступными для 70 миллионов людей по всему миру, которые полагаются на жестовый язык для общения.

    Правильное произношение

    Детали имеют значение, особенно в повседневных инструментах, таких как навигация. Когда навигационное приложение неправильно произносит название города или улицы, это не только вызывает путаницу, но и может упустить культурное наследие места. Мы считаем, что культурный контекст должен быть частью того, как создается языковая технология, и это означает работу напрямую с местными сообществами. Например, в Новой Зеландии мы работали с экспертами по языку маори, чтобы улучшить произношение названий мест в Google Maps, помогая сделать опыт более точным и по-настоящему местным. Включение культурно аутентичного произношения непосредственно в наши модели текст-в-речь гарантирует, что технологии отражают язык и наследие сообществ, которым они служат.

    Строительство языковых инструментов для всех

    Одним из основных уроков, которые мы извлекли за 20 лет исследований и разработок в области языкового ИИ, является то, что технологии никогда не должны сужать спектр человеческого выражения — они должны его расширять. Сегодня наши языковые технологии уже встроены в нашу основную экосистему, соединяя более пяти миллиардов людей на девяти платформах, включая Поиск, Android, Chrome, YouTube и Google Play. Но масштаб — это лишь часть истории. Более важная цель — глубина и богатство — создание систем, которые понимают контекст, уважают культуру и отмечают множество способов общения людей. По мере того как мы продолжаем использовать ИИ для решения некоторых из самых больших возможностей общества, мы будем продолжать тесно работать с местными сообществами, чтобы создавать технологии, которые помогают большему числу людей общаться, участвовать и быть понятыми на своих условиях.

    Комментарии (0)

    Войдите, чтобы оставлять комментарии.
    Пока нет комментариев. Будьте первым!