Бенчмарк Маракуйя ИИ на Terminal-Bench 4 и OSWorld 2
Всем привет! В прошлой статье я гонял Алису и Гигачат как чаты: Arena-Hard, WildBench, MultiChallenge, τ³, ПРАКТ-120. Там модель должнв была отвечать текстом в браузере - как будто она общалас с пользователем, пользователь задавал разные задания и тесты определяли, справляется ли модель. Тут - уже совсем другой экзамен. Агенту дают настоящий компьютер и настоящее задание: починить пайплайн, разобраться с проблемами в консоли сервера, собрать форму, закрыть визу, свести таблицу из почты и банка. На выходе ждут рабочий артефакт. Terminal-Bench 4 и OSWorld 2 - это два теста, которые различные лаборатории сейчас считают маст хэв. Как вы наверное заметили, мне интересно тестировать наши, отечественные модели, отечественные решения. Почему? Ну потому что в первую очередь я верю в мозги наших разработчиков, которые во всем мире всегда считались топовыми. Мне совершенно непонятно почему мы так отстаем в ИИ, и я отказываюсь в это верить. Хотя нет, понятно - все дело в отсутствии венчура, поддержки от государства и увядших мозгах наших чиновников, но это уже предмет другого обсуждения и холиворов, которые мне тут не нужны. Я общаюсь с несколькими командами, которые развиват ИИ решения в России, и все они классные и я уверен, покажут интересные результаты, а я о них напишу или даже скоро потестирую и поделюсь результатами. Надеюсь, что общение с командой Гигачата разовьется в нечто большее, чем самостоятельное проведение мной предыдущих бенчмарков, надеюсь что и разработчики Алисы сомной подружатся и мы вместе сделаем что-то интересное и полезное. Сейчас же самое интересное и просто топовая новость - агентская обвязка команды Маракуйи прошла одни из самых сложных тестов в мире с очень крутыми показателями. Читать этот жЫр полностью
