Фундаментальная модель
Материал из MachineLearning.
| | Статья написана с использованием LLM ChatGPT 5.5 и проверена участником Liliia Davletova |
Фундаментальная модель
Фундаментальная модель (Foundation Model) — класс моделей машинного обучения, предварительно обученных на очень больших и разнообразных наборах данных, способных служить универсальной основой для решения широкого спектра прикладных задач посредством дообучения, обучения с инструкциями, контекстного обучения (in-context learning), RAG и других методов адаптации.
Термин был предложен исследователями Stanford Center for Research on Foundation Models в 2021 году в работе On the Opportunities and Risks of Foundation Models, ставшей одной из наиболее цитируемых обзорных работ по современной архитектуре систем искусственного интеллекта.
Определение
В классическом определении фундаментальная модель обладает двумя ключевыми свойствами:
- обучается на широкомасштабных данных общего назначения (broad data at scale);
- может быть адаптирована для множества различных последующих задач (downstream tasks) без обучения новой модели "с нуля".
Таким образом, фундаментальная модель представляет собой не законченное прикладное решение, а универсальную основу, из которой строятся специализированные модели.
История
До появления фундаментальных моделей большинство систем машинного обучения создавались под конкретную задачу:
В 2018–2020 годах стало очевидно, что масштабное предварительное обучение на неразмеченных данных позволяет получать универсальные представления объектов.
В области обработки естественного языка важную роль сыграли модели
Позже аналогичная парадигма распространилась на изображения (CLIP, DINO, SAM), мультимодальные данные (Flamingo, PaLI, GPT-4V) и биологические последовательности.
Обзор статьи «On the Opportunities and Risks of Foundation Models»
Статья Боммасани и соавторов, опубликованная в 2021 году коллективом из более чем ста исследователей Stanford University, стала не просто обзором существующих больших моделей, а попыткой сформулировать новую исследовательскую программу в области искусственного интеллекта. Авторы утверждают, что в развитии машинного обучения произошёл качественный переход: если раньше модели создавались для решения отдельных задач, то теперь центральным объектом исследования становятся универсальные модели, служащие фундаментом для большого числа приложений.[1] :contentReference[oaicite:0]{index=0}
От специализированных моделей к универсальным
Авторы рассматривают историю развития машинного обучения как последовательность нескольких этапов.
В ранних системах каждая задача — машинный перевод, распознавание речи, классификация изображений — требовала разработки собственной модели и собственного обучающего набора данных.
Позже широкое распространение получил перенос обучения, когда предварительно обученная модель могла использоваться как отправная точка для новой задачи. Однако даже в этом случае область применения модели обычно оставалась достаточно узкой.
Фундаментальные модели отличаются тем, что они обучаются не для некоторого семейства задач, а для моделирования структуры данных вообще. После такого предварительного обучения оказывается возможным решать широкий спектр задач посредством сравнительно дешёвой адаптации.
По мнению авторов, именно этот переход является главным изменением современной парадигмы искусственного интеллекта. :contentReference[oaicite:1]{index=1}
Почему масштаб оказался качественным фактором
Одной из центральных идей статьи является утверждение, что масштабирование моделей приводит не только к количественному росту качества, но и к появлению новых свойств.
Авторы связывают это с одновременным увеличением
- числа параметров;
- объёма обучающих данных;
- вычислительных ресурсов.
В результате модель начинает осваивать представления, пригодные для решения задач, которые не были явно сформулированы во время обучения.
Именно поэтому современные большие языковые модели способны выполнять перевод, реферирование, ответы на вопросы, генерацию программного кода и многие другие задачи без отдельного обучения для каждой из них.
Позднее данное наблюдение было подтверждено исследованиями по Scaling Laws и стало одной из основ современной практики разработки больших языковых моделей. :contentReference[oaicite:2]{index=2}
Эмерджентные способности
Особое внимание в статье уделяется явлению Emergence — возникновению новых способностей модели при достижении определённого масштаба.
Авторы подчёркивают, что некоторые навыки невозможно предсказать по результатам обучения меньших моделей. Они проявляются скачкообразно после увеличения числа параметров или объёма данных.
В качестве примеров рассматриваются
- обучение по нескольким примерам (few-shot learning);
- решение новых задач посредством текстовой инструкции;
- перенос знаний между различными предметными областями;
- способность выполнять цепочки логических преобразований.
В 2021 году происхождение этих способностей оставалось практически необъяснимым и было обозначено как одно из важнейших направлений дальнейших исследований. :contentReference[oaicite:3]{index=3}
Гомогенизация искусственного интеллекта
Одним из наиболее оригинальных понятий статьи является гомогенизация (homogenization).
Авторы отмечают, что по мере распространения фундаментальных моделей тысячи прикладных систем начинают использовать одну и ту же предварительно обученную модель.
Подобная унификация имеет двойственный характер.
С одной стороны,
- значительно сокращается стоимость разработки;
- ускоряется внедрение новых систем;
- улучшается воспроизводимость результатов;
- достижения одной исследовательской группы становятся доступны всему сообществу.
С другой стороны, ошибки фундаментальной модели автоматически наследуются всеми производными системами. Если предварительно обученная модель содержит смещения, уязвимости безопасности или фактические ошибки, они будут воспроизводиться во множестве приложений.
Авторы рассматривают гомогенизацию как одно из наиболее важных последствий современной архитектуры искусственного интеллекта. :contentReference[oaicite:4]{index=4}
Междисциплинарный характер проблемы
Значительная часть статьи посвящена не алгоритмам, а последствиям широкого распространения фундаментальных моделей.
Авторы подчёркивают, что подобные системы становятся инфраструктурой для экономики, образования, медицины, права и государственного управления. Поэтому их исследование невозможно ограничить исключительно вопросами точности моделей.
В докладе выделяются несколько взаимосвязанных направлений исследований:
- качество обучающих данных;
- интерпретируемость моделей;
- устойчивость к атакам;
- безопасность;
- влияние на рынок труда;
- экологические последствия масштабного обучения;
- правовые вопросы;
- вопросы справедливости и недискриминации.
Таким образом, фундаментальная модель рассматривается как социотехническая система, требующая сотрудничества специалистов по машинному обучению, информатике, экономике, юриспруденции и социальным наукам. :contentReference[oaicite:5]{index=5}
Развитие идей после 2021 года
После публикации статьи многие сформулированные в ней гипотезы получили экспериментальное подтверждение, а некоторые направления исследований существенно изменились.
Большие языковые модели как основной тип фундаментальных моделей
В 2021 году авторы рассматривали фундаментальные модели как общий класс систем, включающий модели языка, изображений, робототехники и биоинформатики.
Однако уже после появления ChatGPT в конце 2022 года именно большие языковые модели стали наиболее успешным представителем этого класса. Практически вся индустрия генеративного искусственного интеллекта стала строиться вокруг одной предварительно обученной языковой модели, дополненной этапами обучения с инструкциями, обучения с подкреплением по обратной связи человека (RLHF) и различными способами интеграции внешних знаний. :contentReference[oaicite:6]{index=6}
От fine-tuning к instruction tuning
В статье 2021 года основным способом адаптации фундаментальных моделей считалось дообучение.
Позднейшие исследования показали, что для больших языковых моделей значительно более эффективными оказываются
- instruction tuning;
- RLHF;
- Direct Preference Optimization (DPO);
- Parameter-Efficient Fine-Tuning (LoRA, QLoRA и др.).
В результате изменилось само представление о жизненном цикле фундаментальной модели: после масштабного предварительного обучения следует длительный этап post-training, определяющий поведение модели при взаимодействии с пользователем. :contentReference[oaicite:7]{index=7}
От языковых моделей к мультимодальным
Авторы статьи предполагали, что единая модель сможет работать сразу с несколькими типами данных.
В последующие годы эта идея получила практическое воплощение в мультимодальных фундаментальных моделях, одновременно обрабатывающих текст, изображения, звук, видео и программный код. Такие модели используют единое пространство представлений и позволяют переносить знания между различными модальностями. :contentReference[oaicite:8]{index=8}
Развитие открытых фундаментальных моделей
В 2021 году большинство наиболее мощных моделей были закрытыми.
После появления семейств Llama, Mistral, Gemma и других открытых моделей сформировалось самостоятельное направление исследований Open Foundation Models. В центре внимания оказались вопросы открытости весов моделей, воспроизводимости исследований и оценки рисков свободного распространения мощных моделей. Эти вопросы подробно рассматриваются в работе On the Societal Impact of Open Foundation Models (2024). :contentReference[oaicite:9]{index=9}
От технических вопросов к вопросам управления
Если статья 2021 года лишь обозначила необходимость исследования социальных последствий фундаментальных моделей, то в последующие годы именно эта тема стала одной из центральных.
Развитие фундаментальных моделей привело к появлению новых исследований в области
- регулирования генеративного искусственного интеллекта;
- оценки рисков;
- безопасности наиболее мощных моделей;
- прозрачности обучения;
- открытости моделей;
- конкуренции на рынке вычислительных ресурсов.
В частности, отдельные разделы, посвящённые фундаментальным моделям, появились в европейском AI Act и ряде национальных документов по регулированию искусственного интеллекта. :contentReference[oaicite:10]{index=10}
Современное понимание фундаментальных моделей
Если в 2021 году термин Foundation Model обозначал прежде всего новую научную концепцию, то к середине 2020-х годов он стал использоваться как обозначение базовой вычислительной инфраструктуры современного искусственного интеллекта.
Современные обзорные статьи рассматривают фундаментальные модели не только как большие языковые модели, но и как универсальную технологическую платформу для обработки текста, изображений, аудио, видео, молекулярных структур, биологических последовательностей и робототехнических систем. При этом основные идеи статьи 2021 года — масштабное предварительное обучение, универсальность, адаптация к множеству задач и необходимость комплексной оценки рисков — сохраняют свою актуальность и остаются основой современной исследовательской программы. :contentReference[oaicite:11]{index=11}
Основная идея
Фундаментальная модель обучается не решению одной конкретной задачи, а моделированию структуры большого массива данных.
В зависимости от модальности используются различные цели обучения:
- самоконтролируемое обучение;
- контрастивное обучение;
- маскирование токенов;
- авторегрессионная языковая модель;
- диффузионная модель.
После такого предварительного обучения модель можно адаптировать к новой задаче значительно дешевле, чем обучать новую модель.
Архитектуры
Наиболее распространёнными архитектурами фундаментальных моделей являются
- Transformer;
- Vision Transformer;
- Mixture of Experts;
- диффузионные модели;
- мультимодальные трансформеры.
Практически все современные большие языковые модели основаны на архитектуре Transformer.
Методы адаптации
После предварительного обучения фундаментальная модель может использоваться различными способами.
Полное дообучение
Все параметры модели обновляются на новой задаче.
Преимущества:
- высокая точность;
- максимальная адаптация.
Недостаток — высокая вычислительная стоимость.
Parameter-Efficient Fine-Tuning
В современных системах широко используются методы
Они позволяют обучать лишь небольшую часть параметров модели.
In-context learning
Некоторые фундаментальные модели способны решать новую задачу исключительно по нескольким примерам во входном запросе без изменения весов модели.
Это свойство стало одной из отличительных особенностей современных больших языковых моделей.
Масштабирование
Одной из причин успеха фундаментальных моделей являются так называемые законы масштабирования (Scaling Laws).
Экспериментально было показано, что увеличение
- числа параметров;
- объёма обучающих данных;
- вычислительных ресурсов
ведёт к предсказуемому улучшению качества модели в широком диапазоне задач.
Данное наблюдение легло в основу разработки современных больших языковых моделей.
Эмерджентные свойства
При увеличении размера модели начинают проявляться способности, отсутствовавшие у более компактных моделей:
- решение новых задач без специального обучения;
- многошаговые рассуждения;
- генерация программного кода;
- перенос знаний между предметными областями;
- мультимодальное понимание.
Такие свойства получили название эмерджентных (Emergent Abilities). Несмотря на большое количество эмпирических наблюдений, механизмы их возникновения остаются предметом активных исследований.
Примеры фундаментальных моделей
Язык
Компьютерное зрение
Генерация изображений
Мультимодальные модели
Преимущества
Основные достоинства фундаментальных моделей:
- универсальность;
- переносимость знаний;
- высокая эффективность адаптации;
- возможность обучения на неразмеченных данных;
- единая инфраструктура для множества приложений;
- быстрое внедрение новых прикладных систем.
Ограничения
Несмотря на впечатляющие результаты, фундаментальные модели имеют ряд существенных ограничений.
Высокая стоимость
Предварительное обучение крупнейших моделей требует тысяч графических процессоров и миллионов долларов вычислительных затрат.
Галлюцинации
Большие языковые модели способны генерировать правдоподобную, но ложную информацию.
Смещения
Модель наследует статистические закономерности обучающих данных, включая различные виды социальных и культурных смещений.
Интерпретируемость
Причины принятия конкретного решения моделью часто остаются неизвестными.
Экологические издержки
Обучение крупнейших моделей сопровождается значительным энергопотреблением и углеродным следом.
Эти проблемы активно обсуждаются в современной научной литературе.
Современные направления исследований
Наиболее активно развиваются следующие направления:
- открытые фундаментальные модели;
- мультимодальные модели;
- агентные системы на основе фундаментальных моделей;
- методы эффективного дообучения;
- интерпретируемость;
- оценка безопасности;
- механистическая интерпретация нейронных сетей;
- обучение на синтетических данных.
См. также
- Машинное обучение
- Глубокое обучение
- Нейронная сеть
- Transformer
- Большая языковая модель
- Самоконтролируемое обучение
- Перенос обучения
- Дообучение
- LoRA
- Контекстное обучение
- Генеративный искусственный интеллект
Примечания
Литература
- Bommasani R., Hudson D. A., Adeli E. и др. On the Opportunities and Risks of Foundation Models // arXiv. — 2021.
- Brown T. B., Mann B., Ryder N. и др. Language Models are Few-Shot Learners // NeurIPS. — 2020.
- Kapoor S., Bommasani R. и др. On the Societal Impact of Open Foundation Models // arXiv. — 2024.
- Vaswani A., Shazeer N., Parmar N. и др. Attention Is All You Need // NeurIPS. — 2017.
- Goodfellow I., Bengio Y., Courville A. Deep Learning. — MIT Press, 2016.

