Depository of News

Дело о лишних размышлениях: почему вредно много думать

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/205/10e/722/20510e7226ae6235ac060a41663ce2ed.png" /><p>…Еще играясь с Qwen3.6 я дал ей стандартную handoff задачу от своей AI команды по проекту SwiftUI и QWEN cli ее так и не решил. Просто ушел в постоянные размышления. В итоге я его просто закрыл и сделал вывод, что Qwen3.6 не может решать такие задачи. И как оказалось я поспешил…</p><p>В предыдущем расследовании <a href="https://habr.com/ru/articles/1075706" rel="noopener nofollow">https://habr.com/ru/articles/1075706</a> мы искали скорость локальной Qwen3.8-27B на Mac Studio. Вывод был довольно жёстким: для интерактивной работы радикально ускорить 27-миллиардную модель можно прежде всего уменьшив объём её весов, то есть квантизацией. В связке с DFlash2 версия 8-bit дошла до 38 токенов в секунду.</p><p>Но это был только первый вопрос.</p><p>Быстро отвечать и хорошо работать — не одно и то же. Особенно когда модель должна не пересказать текст, а разобрать инцидент, соблюдать строгий формат, написать и отладить код.</p><p>Я хотел найти не самую быструю версию Qwen3.8-27B, а модель, которую можно реально использовать каждый день: чтобы не ждать ответ по минуте и не получать взамен очень убедительную чепуху.</p><p>Казалось, что план очевиден. BF16 берём как эталон качества. 8-bit и 4-bit сравниваем с ним. А чтобы квантизованные версии точно не потеряли в сложных задачах, включаем им максимальный уровень рассуждений — <code>reasoning_effort=xhigh</code>.</p><p>Это была вполне логичная гипотеза.</p><p>И она оказалась неверной.</p> <a href="https://habr.com/ru/articles/1079274/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1079274#habracut">Читать далее</a>

Read full article →