Depository of News

Контекст растёт, KV-кэш — нет: Qwen3.8-27B на ограниченной VRAM с CMF формате

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/54c/fb7/a59/54cfb7a59e66f3ff799a4d7eeeedece2.png" /><p>Qwen3.8-27B в Q4TP занимает около 14,3 GB весов, но при длинном контексте упирается ещё и в KV-кэш. Для 16 full-attention слоёв этой гибридной модели FP16 KV-state растёт на 65 536 байт с каждым токеном: на 64K это около 4 ГиБ только для K/V.</p><p>В экспериментальном режиме O(1) рантайм CMF заменяет растущий KV-кэш этих 16 слоёв фиксированным состоянием: четыре sink-токена, точное окно последних 128 токенов и 32 опорных представлений для дальней части. В использованном профиле GPU-state attention составляет 44,1 МиБ, и не увеличивается с длиной контекста.</p> <a href="https://habr.com/ru/articles/1080216/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1080216#habracut">Читать далее</a>

Read full article →