HealthBench — это новый стандарт оценки ИИ в медицине, созданный с участием 250+ врачей и ориентированный на реалистичные сценарии.
Кратко:
- ●HealthBench оценивает ИИ модели в медицинских сценариях.
- ●Включает 5 000 диалогов и 48 562 критерия.
- ●Три варианта: HealthBench, Hard и Consensus.
- ●Версия Professional расширяет задачи на реальные клинические примеры.
Новый стандарт в оценке ИИ
OpenAI представила HealthBench в мае 2025 года как новый открытый эталон для оценки возможностей моделей ИИ в здравоохранении. Этот инструмент направлен на замену устаревших тестов, таких как MedQA, на более реалистичные сценарии взаимодействия с пациентами и врачами.
Структура и особенности
HealthBench включает 5 000 многоповоротных, мультиязычных диалогов между ИИ и пользователями. Они охватывают разнообразные медицинские специальности и сложности. Более 260 врачей из 60 стран участвовали в создании рубрик для оценки ответов моделей.