Depository of News

LLMCOD перешёл на Qwen 3.8: 2× параллельность, 32K контекст и MTP-ускорение на V100

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/d7d/950/514/d7d9505147332092b66a7434603d7626.jpg" /><p>До обновления API LLMCOD работал на Qwen 3.6. Модель справлялась, но по мере роста числа клиентов и усложнения промптов (длинные базы знаний, многошаговые диалоги, агенты) стало понятно: нужен более свежий бэкенд с лучшим качеством推理 и более эффективным использованием GPU.</p><p>Цель — получить максимум от имеющегося железа (Tesla V100-SXM2-32GB), не покупая новый GPU.</p> <a href="https://habr.com/ru/articles/1080846/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1080846#habracut">Читать далее</a>

Read full article →