Большая языковая модель
Материал из MachineLearning.
| | Статья написана с использованием LLM Claude Sonnet 4 и проверена участником Emil Petrov 19:45, 14 июля 2026 (MSD)
Промпт приводится полностью в Обсуждение:Большая языковая модель |
|
Больша́я языкова́я мо́дель (англ. large language model, LLM) — класс моделей машинного обучения на основе глубоких нейронных сетей, обученных на огромных корпусах текстов и способных понимать, генерировать и преобразовывать текст на естественном языке. Современные LLM, как правило, строятся на архитектуре трансформера и содержат от сотен миллионов до нескольких триллионов параметров. Благодаря самообучению на разнородных данных они умеют решать широкий круг задач без отдельного дообучения под каждую из них: перевод, ответы на вопросы, суммаризация, написание кода, ведение диалога.
LLM лежат в основе систем вроде GPT, Claude, Gemini, LLaMA, DeepSeek и Qwen и считаются ключевым компонентом современного искусственного интеллекта.
Архитектура трансформера и механизм внимания
Основой большинства LLM служит трансформер, предложенный в работе «Attention Is All You Need» (Vaswani et al., 2017)[1]. Он отказался от рекуррентных и свёрточных слоёв и целиком построен на механизме внимания. Это позволило эффективнее обрабатывать длинные тексты и распараллеливать вычисления — критично при обучении на гигантских корпусах.
Само-внимание (self-attention)
Центральный элемент — многоголовое само-внимание (multi-head self-attention). Идею удобно пояснить аналогией с библиотекой: есть запрос (query), у каждой книги — ключ (key, описание) и содержание (value, полный текст). Внимание сопоставляет запрос с ключами, оценивает релевантность и взвешенно суммирует содержимое.
Формально для входных векторов (токенов) строятся матрицы запросов , ключей
и значений
:
где — размерность ключей. Softmax по строке превращает скалярные произведения в веса; деление на
стабилизирует градиенты.
Иначе говоря, каждое слово «смотрит» на все остальные и решает, насколько они важны в данном контексте. Так модель улавливает дальние зависимости — например, связь местоимения с именем, упомянутым несколькими предложениями ранее.
Многоголовое внимание и позиционное кодирование
Вместо одного внимания используют несколько «голов»: каждая работает в своём подпространстве и следит за своим типом связей (синтаксис, семантика, кореференция). Выходы голов объединяют и линейно преобразуют.
Сам по себе attention не знает порядка слов (он перестановочно инвариантен), поэтому к встраиваниям токенов добавляют позиционные кодировки. В оригинале — синусоидальные; позже — обучаемые; в современных LLM часто вращающиеся (RoPE), лучше обобщающиеся на длинный контекст.
Энкодер, декодер и современные варианты
Классический трансформер — энкодер + декодер. В LLM чаще используют только декодер (decoder-only), как в GPT: модель предсказывает следующий токен по предыдущим с маскированным само-вниманием, запрещающим «заглядывать вперёд». Такой режим естественно подходит для генерации и легче масштабируется.
Авторегрессионная модель факторизует вероятность последовательности:
История развития больших языковых моделей
Появление термина LLM
Точное авторство термина «Large Language Model» установить сложно: он появлялся описательно по мере роста моделей. В академической литературе закрепился после GPT-2 (Radford et al., 2019) и особенно GPT-3 (Brown et al., 2020) с 175 млрд параметров[1]. К 2020–2021 году LLM стало общепринятым названием для трансформерных моделей, предобученных на огромных корпусах и насчитывающих миллиарды параметров. Понятие «большая» исторически смещалось: BERT-Large (340 млн, 2018) когда-то казался огромным.
Основные вехи развития
Ранние языковые модели (2013–2018). Практический старт дали статические встраивания Word2Vec и GloVe, затем контекстные ELMo и BERT с предобучением и fine-tuning.
GPT, T5 и эра масштабирования (2018–2020). GPT-1/2 — decoder-only трансформеры на предсказании следующего слова. T5 унифицировал задачи в формате «текст → текст». GPT-3 продемонстрировал in-context learning: решение новых задач по нескольким примерам в промпте без обновления весов — и фактически запустил индустрию LLM.
InstructGPT и выравнивание (2022). Метод RLHF позволил настраивать модели под инструкции и предпочтения людей. InstructGPT показал: относительно небольшая выровненная модель даёт более полезные и безопасные ответы, чем сырая крупная GPT-3. На этом подходе вырос ChatGPT[1].
LoRA и эффективная адаптация (2021–2022). Полное дообучение гигантских моделей дорого. LoRA добавляет низкоранговые обучаемые матрицы к замороженным весам, резко снижая стоимость адаптации и открывая массовый community fine-tuning[1].
Рассуждения и цепочка мыслей (2022–2025). Chain-of-Thought (Wei et al., 2022) показал: если модель явно пишет промежуточные шаги, качество сложных задач растёт. Дальше появились модели, специально обученные «думать» дольше на этапе вывода (o1, DeepSeek-R1): больше compute на инференсе вместо только на обучении.
Смесь экспертов (MoE). В MoE для каждого токена активируется лишь часть «экспертов» (параллельных FFN). Ёмкость модели растёт при умеренной стоимости инференса. Подход используют GPT-4, Gemini, Mixtral, DeepSeek-V2/V3, Qwen-MoE.
RAG (2020). Retrieval-Augmented Generation соединяет генерацию с поиском по внешней базе: модель опирается на найденные документы, снижает галлюцинации и даёт актуальные ответы без переобучения — основа корпоративных QA-систем[1].
Внешняя / дифференцируемая память. Направление вроде Engram и родственных memory-модулей дополняет параметрическую «память в весах» внешним хранилищем фактов — чтобы точнее извлекать знания и лучше контролировать, что модель «помнит».
Диффузионные языковые модели (LLDM). Классические LLM генерируют текст авторегрессивно. Альтернатива — диффузионные языковые модели (например, LLaDA): генерация из зашумлённой последовательности с итеративным «очищением». Это даёт параллелизм и иную управляемость генерации.
Законы масштабирования
Kaplan et al. (2020) и Hoffmann et al. (2022, Chinchilla) показали: потери убывают степенным образом от числа параметров и объёма данных
:
При фиксированном compute-бюджете оптимальна не «максимально огромная» модель, а баланс размера и числа токенов обучения.
Современные мировые LLM: сравнение
По состоянию на 2026 год лидеры различаются открытостью, мультимодальностью, длиной контекста и специализацией.
| Модель | Организация | Открытость | Мультимодальность | Сильные стороны |
|---|---|---|---|---|
| GPT-4o / o-серия | OpenAI | Проприетарная | Текст, изображение, аудио | Экосистема, инструменты, универсальность |
| Claude 4 | Anthropic | Проприетарная | Текст, изображение | Длинный контекст, аккуратность, код и анализ документов |
| Gemini 2.x Pro | Google DeepMind | Проприетарная | Текст, изображение, аудио, видео | Очень длинный контекст, связь с поиском, научные задачи |
| Llama 4 | Meta | Открытые веса | Текст, изображение | Локальный деплой, дообучение, сообщество |
| DeepSeek-V3 / R1 | DeepSeek | Открытые веса | Текст (и расширяющиеся модальности) | Эффективность MoE, сильные рассуждения, низкая стоимость |
| Qwen3 | Alibaba | Открытые веса | Текст, изображение, аудио, видео | Мультиязычность, размерный ряд, мультимодальность |
Практический вывод для новичка: закрытые API удобны «из коробки»; открытые веса нужны, если важны контроль данных, дообучение и стоимость на своём железе. Для профессионала: выбирать стоит не по маркетинговому названию, а по связке «задача → длина контекста → latency/cost → возможность RAG/tool-use → требования к приватности».
Ограничения и риски
- Галлюцинации — уверенные, но ложные утверждения; лечатся RAG, верификацией и отказом «выдумывать».
- Предвзятости обучающих данных — модель их воспроизводит и усиливает.
- Злоупотребления — дезинформация, фишинг, вредоносный код.
- Непрозрачность — внутренние решения плохо интерпретируемы; внимание ≠ объяснение.
- Стоимость и экология — обучение и инференс крупных моделей дороги по compute и энергии.
Качество ответа сильно зависит от промпт-инжиниринга: ясная роль, задача, формат и ограничители часто важнее «сырой» мощности модели.
См. также
- Трансформер (модель)
- Механизм внимания
- Обучение с подкреплением из обратной связи человека (RLHF)
- Промпт-инжиниринг
- Нейросетевое встраивание
- Диффузионная модель
- Смесь экспертов
Примечания
Литература
- Vaswani A. et al. Attention Is All You Need // NeurIPS. — 2017. — Т. 30.
- Brown T. et al. Language Models are Few-Shot Learners // NeurIPS. — 2020. — Т. 33.
- Kaplan J. et al. Scaling Laws for Neural Language Models // arXiv preprint. — 2020.
- Hoffmann J. et al. Training Compute-Optimal Large Language Models // arXiv preprint. — 2022.
- Ouyang L. et al. Training language models to follow instructions with human feedback // NeurIPS. — 2022. — Т. 35.
- Hu E. J. et al. LoRA: Low-Rank Adaptation of Large Language Models // ICLR. — 2022.
- Lewis P. et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks // NeurIPS. — 2020. — Т. 33.
- Wei J. et al. Chain-of-Thought Prompting Elicits Reasoning in Large Language Models // NeurIPS. — 2022.
- DeepSeek-AI DeepSeek-V3 Technical Report // arXiv preprint. — 2024.

