Практика
RAG или fine-tuning: что выбрать компании
RAG или fine-tuning: когда подключать поиск по документам, когда дообучать модель (LoRA) и когда нужна оптимизация под метрику. Сравнение, чек-лист, цены.
Коротко. Выбор «RAG или fine-tuning» зависит от того, чего не хватает модели. Если ей не хватает знаний о вашей компании — документов, цен, регламентов, данных о клиентах, — нужен RAG: поиск по вашим источникам в момент ответа. Если не хватает навыка — формы ответа, стандарта, профессионального суждения ваших лучших специалистов, — нужно дообучение (fine-tuning, чаще всего в варианте LoRA). Если требуется стабильное улучшение бизнес-метрики, добавляют обучение с подкреплением (RL). Лаборатория Viviar формулирует это коротко: знание — в поиск, навык — в дообучение, результат — в оптимизацию. Большинство рабочих систем сочетают несколько рычагов, а начинать почти всегда стоит с поиска и измерения качества.
Для ИТ-директоров, руководителей цифровых проектов и владельцев продуктов, которые решают, как сделать универсальную языковую модель полезной именно для своей компании.
Три рычага адаптации: знание, навык, результат
Современные языковые модели — сильные универсальные «мыслители», но они не знают вашего бизнеса и не измеряются вашей метрикой. В методологии лаборатории Viviar по адаптации открытых моделей (2026) задача разложена на три рычага.
- Знание → поиск (RAG). Retrieval-Augmented Generation — подход, при котором система сначала находит релевантные фрагменты в ваших источниках, а затем модель формирует ответ на их основе. Метод описан в работе Lewis et al. (2020).
- Навык → дообучение (LoRA). Low-Rank Adaptation — способ дообучить модель на небольшом наборе дополнительных параметров, не меняя базовые веса (Hu et al., 2021). Так обучают стиль, формат и суждение, а не факты.
- Результат → оптимизация (RL). Обучение с подкреплением направляет поведение модели к целевому показателю. Известный пример — обучение на основе оценок людей (RLHF) в работе Ouyang et al. (2022).
Главное различие. RAG меняет то, что модель видит в момент ответа. Дообучение меняет то, как модель себя ведёт. Оптимизация под метрику меняет то, к какому результату она стремится.
RAG или fine-tuning: сравнение подходов
| Критерий | RAG (поиск) | Fine-tuning (дообучение, LoRA) | RL (оптимизация под метрику) |
|---|---|---|---|
| Что добавляет модели | знание: актуальные факты из ваших источников | навык: форму, стиль, стандарт, суждение | результат: поведение, которое улучшает метрику |
| Как обновлять | заменить документ или данные в источнике | собрать новые примеры и дообучить заново | обновить оценку и продолжить обучение |
| Ссылка на источник | есть, ответ проверяется по фрагменту | нет, знание «растворено» в весах | нет |
| Что нужно для старта | документы и данные, права доступа к ним | проверенные примеры «вход — правильный результат» | измеримая метрика и надёжный способ оценки |
| Учёт прав доступа | выдачу можно фильтровать по правам пользователя | нет: модель «знает» всё, на чём обучена | нет |
| Главный риск | плохой поиск: ответ по нерелевантным фрагментам | запоминание данных из обучения, устаревание | модель учится «обманывать» метрику |
| Когда выбирать | вопросы о фактах, документах, каталоге, регламентах | нужен стабильный формат и профессиональный стиль | процесс с чёткой целью и большим числом повторов |
Когда достаточно RAG
- ассистент по внутренним документам, регламентам и договорам;
- чат-бот поддержки по базе знаний и каталогу;
- данные меняются часто: цены, остатки, правила, условия;
- нужны ссылки на источник и проверяемость ответа;
- разные сотрудники имеют право видеть разные документы.
Поиск — самый быстрый рычаг, и в него часто вкладывают меньше, чем нужно. Качество RAG определяется не столько моделью, сколько подготовкой данных: разбиением документов на фрагменты, метаданными, фильтрацией по правам, переранжированием результатов и проверкой, что ответ действительно опирается на найденный фрагмент. Отдельная тема — безопасность: поиск без учёта прав превращает ассистента в способ обойти разграничение доступа (подробнее — в статье о безопасном внедрении AI).
Хороший признак того, что поиск работает, — ответ можно проверить: пользователь видит, из какого документа и раздела взята информация, а при отсутствии подходящего фрагмента система честно сообщает, что ответа в базе нет. Если это выполняется, а ошибки остаются, переходите к следующему рычагу.
Когда нужно дообучение
Дообучение оправдано, когда поиск настроен, а модель всё равно:
- не соблюдает формат вывода — структуру заключения, карточки, отчёта;
- пишет не тем языком и тоном, который принят в компании;
- не воспроизводит суждения ваших лучших специалистов: как классифицировать обращение, что считать существенным риском, что выносить в резюме;
- требует длинного промпта с десятками примеров, который дорого и медленно передавать в каждом запросе.
Данные для дообучения — это не «все документы компании», а отобранные пары «вход — правильный результат», проверенные экспертами; их качество важнее количества. Дообучать на фактах — типичная ошибка: модель запомнит состояние на дату обучения и будет уверенно выдавать устаревшие сведения, что на практике выглядит как галлюцинации ИИ в бизнес-процессах. Кроме того, персональные данные из обучающей выборки могут всплыть в ответах, поэтому их из примеров лучше убирать.
Когда подключать оптимизацию под результат
Обучение с подкреплением — самый сложный и самый ценный рычаг. Оно имеет смысл, когда у процесса есть измеримая цель — меньше эскалаций, выше доля обращений, решённых с первого раза, ниже стоимость обработки одной заявки — и достаточно повторяющихся ситуаций, чтобы модель училась на результате. Условие успеха — надёжная оценка: если метрику можно формально «накрутить», модель найдёт способ, и показатель вырастет, а реальный результат нет. Поэтому RL подключают последним, когда поиск и навык уже работают и измеряются.
Как принять решение: пошагово
- Шаг 1. Сформулируйте задачу и метрику. Что должна делать система и как вы поймёте, что она делает это хорошо.
- Шаг 2. Соберите тестовый набор. Реальные запросы с эталонными ответами, включая сложные случаи и вопросы, на которые ответа нет.
- Шаг 3. Проверьте базовую модель с хорошим промптом. Иногда этого уже достаточно.
- Шаг 4. Добавьте поиск, если ошибки связаны с незнанием фактов, и измерьте снова.
- Шаг 5. Добавьте дообучение, если оставшиеся ошибки — в форме, стиле и суждении.
- Шаг 6. Подключите RL, если есть измеримый бизнес-результат и надёжная оценка.
- Шаг 7. Запустите сначала в реальном процессе у себя, затем масштабируйте. Так устроен принцип «сначала на себе», по которому работает Viviar.
Чек-лист перед адаптацией модели
- Определены задача и бизнес-метрика
- Собран тестовый набор с эталонными ответами
- Понятно, каких ошибок больше: в фактах или в форме и суждении
- Для RAG: источники актуальны, у данных есть владелец и порядок обновления
- Для RAG: выдача фильтруется по правам пользователя
- Для дообучения: примеры проверены экспертами и очищены от лишних персональных данных
- Решено, где работает модель — в вашем контуре или у внешнего поставщика
- Выполнены требования 99-З к обработке персональных данных
- Каждый рычаг вводится по одному, с замером качества до и после
- Запланирован повторный замер при смене модели или данных
Данные, безопасность и стоимость
Если в поиск или обучение попадают персональные данные, действуют требования Закона № 99-З «О защите персональных данных»: основание обработки, меры защиты, а при использовании зарубежного облачного сервиса — оценка трансграничной передачи. Открытые модели удобны тем, что их можно развернуть в собственной инфраструктуре, и данные не покидают компанию.
Ассистента с поиском по документам для одного канала и одного источника данных закрывает «AI-Ассистент под ключ» — от 11 600 BYN, для 2–3 каналов — от 23 200 BYN. Дообучение и оптимизация под метрику — отдельная услуга адаптации моделей, объём которой зависит от задачи и данных.
Частые вопросы
Что лучше: RAG или fine-tuning?
Зависит от того, чего не хватает модели. Если знаний о вашей компании — документов, цен, регламентов, — выбирайте RAG: он даёт актуальные факты и ссылки на источник. Если навыка — формата, стиля, профессионального суждения, — нужно дообучение. На практике рабочие системы часто сочетают оба подхода, а начинают с поиска.
Можно ли дообучить модель на всех документах компании?
Технически можно, но для фактов это плохой путь. Модель запомнит состояние документов на дату обучения, не сможет сослаться на источник и не будет учитывать права доступа сотрудников. Документы лучше подключать через поиск, а дообучение использовать для навыков: формата ответа, стиля и суждений на отобранных экспертами примерах.
Что такое LoRA простыми словами?
LoRA (Low-Rank Adaptation) — способ дообучить большую языковую модель, меняя не все её параметры, а небольшой набор дополнительных. Базовая модель остаётся нетронутой, а адаптация получается дешевле и быстрее полного дообучения. Такой подход удобен, чтобы научить модель формату, стилю и типовым решениям конкретной компании.
Когда нужно обучение с подкреплением?
Когда у процесса есть измеримая цель, например меньше эскалаций или больше обращений, решённых с первого раза, и надёжный способ оценить результат. RL подключают после того, как поиск и дообучение уже работают и измеряются. Без качественной оценки модель может научиться улучшать показатель формально, не улучшая реальный результат.
Можно ли адаптировать модель так, чтобы данные не уходили из компании?
Да, если использовать открытую модель, развёрнутую в вашей инфраструктуре: поиск, дообучение и хранение данных остаются под вашим контролем. При использовании зарубежного облачного сервиса нужно учитывать требования Закона № 99-З, включая оценку трансграничной передачи персональных данных, а также условия договора с поставщиком модели.
Вывод
Вопрос «RAG или fine-tuning» решается тем, чего не хватает модели: знания, навыка или результата. Знание — в поиск с актуальными источниками и ссылками, навык — в дообучение на проверенных примерах, результат — в оптимизацию под метрику, и каждый шаг — с измерением качества до и после. Если нужно понять, какой рычаг подходит вашей задаче, — опишите процесс и данные, предложим путь адаптации.
Источники: Viviar, «Поиск, дообучение, RL: практическое руководство по адаптации открытых моделей», 2026; Lewis P. et al., «Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks», NeurIPS, 2020; Hu E. J. et al., «LoRA: Low-Rank Adaptation of Large Language Models», 2021; Ouyang L. et al., «Training language models to follow instructions with human feedback», 2022; Закон Республики Беларусь от 07.05.2021 № 99-З «О защите персональных данных» (pravo.by).