Опыт Google: как разрабатывают приложения обработки естественного языка на основе искусственного интеллекта

Американская транснациональная корпорация Google уже долгое время занимается разработкой технологий искусственного интеллекта, включая приложения для обработки естественного языка (NLP) в режиме реального времени.

О дивный новый мир возможностей чат-бота BardAl: от перевода текста до анализа настроения

Специалисты подразделения Google AI создали сервис разговорного ИИ чат-бот BardAI, построенный на нейронной языковой модели для диалоговых приложений LaMDA. Эта модель способна обрабатывать цепочки слов и предложений, определять их взаимосвязь друг с другом, и на основе метода прогнозирования осуществлять выдачу ответа на запрос. BardAI может использоваться для решения широкого спектра задач:

· Языковой перевод. Позволяет обрабатывать текст на одном языке и генерировать точный и быстрый его перевод на любой другой язык, что делает BardAI полезным инструментом для преодоления языковых барьеров.

· Генерация текста. Позволяет создавать текстовые ответы на запросы, похожие на человеческие. Эта функция позволяет использовать чат-бот для создания приложений, способных давать ответы на онлайн-форумах, осуществлять подбор материалов для публикаций в социальных сетях.

· Обобщение текста. BardAI может использоваться для составления резюме или публикаций статей, предоставляет возможность получать краткий обзор текста, экономя время пользователей, которым необходимо оставаться в курсе определенной темы.

· Анализ настроения. Помогает понять общий тон и эмоции, передаваемые в письменном виде, а также определять настроение в отзывах клиентов. Такая функция позволяет компаниям работать над улучшением предоставляемых услуг.

На данном этапе чат-бот отвечает на текстовые запросы только в письменном виде, однако в дальнейшем разработчики намерены обеспечить звуковой способ общения «человек-машина».

Языковые титаны: BardAI и его соперники

У чат-бота Google Bard AI есть сильные конкуренты, например, языковые модели компаний OpenAI «GPT-3» и Microsoft «Bing AI». Сравнительный анализ приложения Google с языковыми моделями OpenAI и Microsoft позволяет утверждать, что у всех трех систем есть свои сильные и слабые стороны, и выбор между ними зависит от конкретного варианта использования. Однако на данный момент у этих моделей чат-ботов есть общий недостаток – ограниченность знаний из-за того, что они обучены на не обновляемых базах данных, в результате чего они могут выдавать неверные ответы и вводить пользователя в заблуждение.

SLING: обогащение Wikipedia

Кроме того, инженерами Google AI разработана система SLING – анализатор семантики фреймов естественного языка, предназначенный для чтения и понимания статей Wikipedia на разных языках. Это делается для пополнения базы знаний, например, путем добавления фактов из Wikipedia и других источников в базу знаний Wikidata. Семантика фреймов используется как способ представления информации и аннотаций в документах. Это поддерживает общий анализ нейронной сети на основе переходов с двунаправленным входным кодированием (Long short-term memory, LSTM) и рекуррентного блока на основе переходов (Transition Based Recurrent Unit) для декодирования выходных данных. Модель синтаксического анализа обучается, используя в качестве входных данных только текстовые токены.

В настоящее время программисты компании работают над усовершенствованием данного проекта. С этой целью создан ряд подсистем, необходимых для нормального его функционирования:

· хранилище фреймов SLING – базовая платформа для построения структур семантического графа фреймов и управления ими;

· конвейер Wiki flow, который преобразует файлы Wikipedia в набор документов со структурированными аннотациями, а также позволяет создать таблицы фраз, которые используются для сопоставления имен с объектами;

· SLING Python API, обеспечивающий доступ к информации;

· бот, осуществляющий загрузку извлеченной информации в Wilidata.

WaveNet: ИИ обретает голос

Специалистами дочерней компании Google DeepMind была создана система преобразования текста в речь WaveNet. Функционирование данной модели реализовано на основе нейронной сети, которая была настроена с использованием большого объема образцов речи. Во время обучения сеть извлекала базовую структуру, изучала звучание тонов и то, как выглядит реалистичная форма речевого сигнала.

В отличии от большинства других аналогичных систем, платформа WaveNet может генерировать соответствующие речевые сигналы с нуля, по одному сэмплу за раз, со скоростью до 24 тысяч сэмплов в секунду и плавными переходами между отдельными звуками. Это наделяет голосовой синтезатор возможностью воспроизводить натуральную интонацию.

LipNet: визуальное распознавание речи

Кроме того, инженеры DeepMind разработали нейросеть LipNet, которая распознает речь с помощью чтения по мимике губ. LipNet обучали с использованием метода нейросетевой темпоральной классификации. Этот метод не требует обучения на наборе входных данных, синхронизированных с правильным выходным результатом. На вход платформы подавали последовательность кадров, которые обрабатывались тремя слоями пространственно-временной свёрточной нейросети, каждый из которых, в свою очередь, сопровождался слоем пространственной выборки. Для извлечённых признаков повышалась частота дискретизации по шкале времени, а далее они обрабатывались двойной LTSM. Такой подход не только превышает точность распознавания, но и превосходит эффективность чтения по губам специально обученных людей.

75 views·2 shares