Terminal-Bench-Science: Evaluating AI agents on scientific research workflows
Як ця новина вийшла в дайджесті
Новий відкритий бенчмарк Terminal-Bench-Science оцінює можливості AI-агентів виконувати реальні наукові робочі процеси з різних дисциплін: найкраща модель зараз вирішує тільки 30% таких завдань, але платформа вже формує новий стандарт для розвитку AI у науці
Повний текст — на сайті видання
Ми не передруковуємо статті. Посилання веде напряму до Hacker News.
Читати оригінал →
Як новина потрапила у випуск
Множники, з яких склався ранг
0,69
=
0,95
релевантність
×
0,73
свіжість · 8,1 год
×
1,00
резонанс · 1 видання
×
0,99
вага джерела
«Новина про оцінювання AI агентів у наукових дослідженнях — це наукове дослідження, отже рубрика Science.» — класифікатор, 0,95
Ще з теми Science того дня
Увесь випуск за 28 серпня
Усе, що дійшло до випуску того дня, і чому саме воно
До випуску →