Depository of News

Что значит развернуть LLM локально: два дня с vLLM, DGX Spark и настоящими ограничениями

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/41e/448/740/41e448740d56782c91e2fdd8bb6d1a78.jpg" /><p>Когда меня однажды спросили, что такое инференс и как выглядит локальное развёртывание модели, я ответил правильно, но слишком общо. Через несколько дней пришлось пройти этот путь целиком: поднять две LLM на NVIDIA DGX Spark, отдельную ASR-модель на AMD GPU и подключить всё к мультиагентной платформе. В статье — инженерный разбор того, почему файлы модели ещё не сервис, как длинный контекст конкурирует с KV-кэшем и параллелизмом, почему tokens/sec не описывают пользовательскую задержку и зачем иногда откатывать более быструю модель из-за качества.</p> <a href="https://habr.com/ru/articles/1081324/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1081324#habracut">Читать далее</a>

Read full article →