OpenAI выпустила новый endpoint в API, упрощающий задачи семантического поиска и анализа данных.
Кратко:
●OpenAI представила endpoint /embeddings для API.
●Эмбеддинги помогают в семантическом поиске и классификации.
●Модели основаны на GPT-3 и используют contrastive pre-training.
●Примеры успешного использования в реальных проектах.
Новые возможности для обработки текста и кода
25 января 2022 года OpenAI объявила о запуске нового endpoint /embeddings в своём API. Этот инструмент позволяет преобразовывать текст и код в векторные представления, которые могут быть использованы в задачах семантического поиска, кластеризации, тематического моделирования и классификации.
Что такое эмбеддинги
Эмбеддинги — это векторные представления текстов или кода, которые отражают их смысловое содержание. Чем ближе эмбеддинги двух текстов в высокоразмерном пространстве, тем более они схожи по смыслу. Например, фраза «canine companions say» будет ближе к «woof», чем к «meow».
Описание API и возможности моделей
Эндпоинт /embeddings поддерживает несколько семейств моделей:
●Text similarity: text‑similarity-[ada, babbage, curie, davinci]-001 — для задач кластеризации, регрессии и классификации.
●Code search: code‑search-[ada, babbage]-{code, text}-001 — для поиска кода по запросу на естественном языке.
Эти модели наследуются от GPT-3 и используют контрастивное предобучение, что позволяет достигать высоких результатов.
Технические преимущества и результаты
Эмбеддинги существенно улучшают результаты в задачах поиска и анализа. Например, в задачах семантического поиска достигается улучшение на 23.4% на MSMARCO. В код-сёрче улучшения составляют 20.8%.
Примеры использования в реальных проектах
●JetBrains Research использует эмбеддинги для поиска астрономических событий и классификации источников с точностью 99.85%.
●FineTune Learning добилась top-5 точности 89.1% в поиске учебного материала.
●Fabius обнаруживает в два раза больше примеров в клиентских транскриптах.
Научное обоснование: contrastive pre-training
Контрастивное предобучение на масштабных неаннотированных данных даёт высококачественные векторные представления. Это позволяет улучшить результаты как в задачах классификации, так и в семантическом поиске.
Перспективы использования
Эмбеддинги открывают новые возможности в области анализа данных, позволяя создавать более точные и эффективные системы поиска и классификации. Они уже нашли применение в различных областях, от науки до образования.
Частые вопросы
Что такое эмбеддинги?
Эмбеддинги — это векторные представления текста или кода, отражающие их смысловое содержание.
Какой эффект дают эмбеддинги в реальных задачах?
Они улучшают точность классификации и поиска, например, в JetBrains Research и FineTune Learning.
Какие модели поддерживает endpoint `/embeddings`?
Он поддерживает модели для текстового и кодового поиска, такие как text-similarity и code-search.
В чём заключается контрастивное предобучение?
Это метод обучения, который улучшает качество эмбеддингов за счёт использования неаннотированных данных.