Depository of News

«Извини, я не могу тебе с этим помочь»: почему LLM отказывается выполнять запросы

newsdepo.com · world

<img src="https://habrastorage.org/getpro/habr/upload_files/81b/b87/b47/81bb87b472844e116455edb0461ff3c9.png" /><p>Вы просите модель разобрать демонстрационный код с соревнования по компьютерной безопасности, перевести подозрительный фрагмент программы для отчёта или продолжить вполне невинный рассказ. Вместо ответа получаете знакомое: «Извини, но я не могу помочь с этим запросом».</p><p>Иногда причина понятна. Иногда модель отказывается обсуждать то, что лежит в первой ссылке из поисковой выдачи. А рядом на Hugging Face опубликована версия той же Qwen, Gemma или GLM со словом <code>Uncensored</code>. Автор обещает, что она будет отвечать без лишних нравоучений.</p><p>Но чем отличаются такие LLM? Неужели кто-то повторно обучил модели на сотни миллиардов параметров? Или просто удалили системную инструкцию? Может, нашли в весах переключатель <code>censorship = false</code>?</p><p>На самом деле, отказ может быть записан в весах модели, задан системной инструкцией или добавлен внешним классификатором на уровне сервиса. Поэтому под «снятием ограничений» скрываются разные процессы: от подмены инструкции до точечного редактирования матриц без градиентного обучения.</p><p>В этой статье постараемся ответить на три вопроса: откуда в LLM появляется отказ, как его ослабляют в открытых моделях и где можно взять "безотказную" модель.</p> <a href="https://habr.com/ru/articles/1080284/?utm_source=habrahabr&amp;utm_medium=rss&amp;utm_campaign=1080284#habracut">Читать далее</a>

Read full article →