Depository of News

Я прогнал топ VRAM-калькуляторов для LLM — все ошибаются в одном и том же

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/93a/e33/d10/93ae33d10e7aed71ba1488bae54a2146.jpg" /><p>Наивная формула «веса + KV &lt; VRAM» промахивается по двум причинам, и обе стоят денег. Первая: движок (vLLM, SGLang, TensorRT-LLM) резервирует почти всю память под свой пул ещё до того, как вы посчитали KV — поэтому ответ «сколько запросов влезет» всегда мимо, в сторону «влезет», а потом OOM под нагрузкой. Вторая, которую в уме не посчитать: на DeepSeek-V2-Lite обычная формула завышает KV в 7–11 раз, и промах уже в обратную сторону — зря откажетесь ставить модель.</p><p>Я прогнал топ VRAM-калькуляторов из выдачи Google, показал на скриншотах, где ломается каждый (даже лучший), сверил числа с живым vLLM на A100/H100 — расхождение ~1% — и собрал ridgepoint: калькулятор, который считает как движок, а не как учебник. Ставится локально (<code>pip install ridgepoint</code>), GPU не нужен.</p> <a href="https://habr.com/ru/articles/1079788/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1079788#habracut">Сколько реально влезет</a>

Read full article →