●Основан на двухэнкодерной архитектуре для сопоставления речи и текста
●Повышает точность, минимизируя ошибки ASR
●Уже внедрён в Google и поддерживает множество языков
Новый подход Google к голосовому поиску
7 октября 2025 года Google Research представила инновационное решение — Speech-to-Retrieval (S2R), которое обещает изменить подход к голосовому поиску. Вместо традиционной цепочки «речь → автоматическое распознавание речи (ASR) → текст → поиск», S2R напрямую сопоставляет речевой запрос с текстом, минуя стадию транскрипции.
Как работает S2R
Архитектура S2R базируется на двухэнкодерной модели:
Аудио-энкодер преобразует звуковую волну в семантический вектор.
Документ-энкодер создаёт векторные представления текстов в том же пространстве.
Во время запроса аудио-энкодер генерирует embedding, после чего система ищет похожие документные embeddings и передаёт результаты в существующий механизм ранжирования Google.
Преимущества нового метода
●Устранение ошибок ASR: ошибки, такие как путаница между "scream" и "screen", больше не влияют на результаты.
●Повышенная точность: в экспериментах на датасете Simple Voice Questions (SVQ) S2R превзошла классическую модель и приблизилась к идеальной транскрипции.
●Глубинное понимание запросов: S2R фокусируется на намерении пользователя, а не на точности слов.
Внедрение и открытые данные
S2R уже используется в голосовом поиске Google и доступен на нескольких языках. Google также открывает доступ к датасету SVQ в рамках Massive Sound Embedding Benchmark (MSEB) для стимулирования исследований.
Мнения экспертов
Yossi Matias из Google подчёркивает, что S2R переходит от распознавания слов к пониманию смысла. Michael Alexander Riegler отмечает элегантность архитектуры, но указывает на сложности в интерпретации и настройке системы.
Заключение
Speech-to-Retrieval — значимый шаг в развитии голосового поиска, который уже внедрён в Google и показывает впечатляющие результаты. Открытие SVQ/MSEB создаёт платформу для дальнейших исследований, а отзывы экспертов подчёркивают потенциал и вызовы новой технологии.
Частые вопросы
Что такое Speech-to-Retrieval?
Это технология от Google, которая позволяет пропускать стадию транскрипции в голосовом поиске, напрямую сопоставляя аудио с текстом.
Какие преимущества у S2R перед классическим подходом?
Она устраняет ошибки ASR и повышает точность поиска за счёт глубокого понимания запросов.
Где уже используется S2R?
Технология внедрена в голосовом поиске Google и доступна на нескольких языках.
Каковы перспективы технологии?
S2R обещает значительно улучшить голосовой поиск и стимулировать дальнейшие исследования в области аудио-ориентированных технологий.