d1g3st. Читати в Telegram

Terminal-Bench-Science: Evaluating AI agents on scientific research workflows

Як ця новина вийшла в дайджесті

Новий відкритий бенчмарк Terminal-Bench-Science оцінює можливості AI-агентів виконувати реальні наукові робочі процеси з різних дисциплін: найкраща модель зараз вирішує тільки 30% таких завдань, але платформа вже формує новий стандарт для розвитку AI у науці

Повний текст — на сайті видання Ми не передруковуємо статті. Посилання веде напряму до Hacker News.
Читати оригінал →

Як новина потрапила у випуск

Роль у випуску
Пункт випуску
Ранг
0,69
У дайджесті
Множники, з яких склався ранг
0,69 = 0,95 релевантність × 0,73 свіжість · 8,1 год × 1,00 резонанс · 1 видання × 0,99 вага джерела

«Новина про оцінювання AI агентів у наукових дослідженнях — це наукове дослідження, отже рубрика Science.» — класифікатор, 0,95

Ще з теми Science того дня

Увесь випуск за 28 серпня Усе, що дійшло до випуску того дня, і чому саме воно
До випуску →