[Перевод] Как запустить Qwen3.8-Flash-Next 125B на 6 ГБ VRAM
<img src="https://habrastorage.org/getpro/habr/upload_files/981/6ac/86f/9816ac86f9b32d459a341e7d2695ea49.jpg" /><p>Qwen3.8-Flash-Next - открытая 125B-модель на архитектуре, которая станет основой Qwen4. По опубликованным Qwen результатам она конкурирует с закрытыми frontier-моделями в задачах программирования, работы с агентами и computer use.</p><p>Мы запустили полный checkpoint <code>Qwen/Qwen3.8-Flash-Next</code> на одной RTX 4090. Пиковое потребление VRAM составило 5,95 ГБ, без 4-битной квантизации и дистилляции. Использовался полный checkpoint в bf16, который генерировал обычные токены.</p><p>По сравнению с Opus 4.6 Max, согласно собственным данным Qwen: </p> <a href="https://habr.com/ru/articles/1079902/?utm_source=habrahabr&utm_medium=rss&utm_campaign=1079902#habracut">Читать далее</a>
