Depository of News

Наш бенчмарк ИИ-агентов: собачьи бега моделей LLM, в которых Алиса выигрывает

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/57b/67b/35c/57b67b35c45fe5a54f30c3d6f252d8f5.jpeg" /><p> Всем привет. На связи Сергей Игнатенко, основатель ИИ-платформы VibePilot. Мы сделали свой бенчмарк моделей ИИ на реальных задачах: сметы, договоры, многостраничный Excel. 1 198 задач, 22 сбоя, 1,8%. Считается, что суверенные модели слишком слабы для агентов. Внутри жёсткого конвейера Алиса делает смету с разделами за 19 секунд и обгоняет Qwen3-235B в четыре раза. </p> <a href="https://habr.com/ru/articles/1080744/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1080744#habracut">Смотреть результаты забегов</a>

Read full article →