Microsoft и Hugging Face представили ThinkingBox для проверки надёжности AI-агентов. Проект выявил, что агенты часто завершают задачи с ошибками в базе данных.
Кратко:
- ●ThinkingBox проверяет фактические изменения в базе данных.
- ●67,24% задач завершаются с ошибками на уровне данных.
- ●Claude Opus 5.5 лидирует по метрике pass@1.
- ●Необходима проверка состояния данных перед завершением задач.
Новый стандарт надежности AI-агентов
Сегодня Microsoft и Hugging Face представили инновационный проект ThinkingBox, направленный на улучшение оценки эффективности AI-агентов. Проект нацелен на устранение разрыва между заявляемыми агентами результатами и фактическим состоянием данных.
ThinkingBox и его функции
ThinkingBox предоставляет изолированную среду, где агенты запускаются в отдельных MCP-сессиях. Основной акцент делается на проверку конечного состояния базы данных, а не только на корректность инструментальных вызовов. Этот подход позволяет выявить, насколько надежно агенты выполняют свои задачи.