Dense Contrastive Learning

Материал из MachineLearning.

Перейти к: навигация, поиск
Статья написана с использованием LLM Gemini Pro 3.1 и проверена участником Nikita Zinoviсh 17:44, 19 июля 2026 (MSD)


Содержание

Аннотация

В статье рассматривается плотное контрастивное обучение (Dense Contrastive Learning, DCL) — метод самообучения (self-supervised learning), направленный на извлечение локальных пространственно-инвариантных представлений из неразмеченных данных. В отличие от классических подходов, оперирующих глобальными векторными представлениями объектов в целом, плотное контрастивное обучение формализуется как оптимизационная задача на тензорных полях представлений. В работе приводится строгая математическая постановка задачи, основанная на теории вероятностных пространств и случайных величин, вводится функционал качества Dense InfoNCE и дается его теоретико-информационное обоснование через максимизацию нижней границы локальной взаимной информации.

1. Введение и мотивация

1.1. Задача самообучения

Фундаментальная задача самообучения в анализе данных заключается в построении измеримого отображения (энкодера) из исходного высокоразмерного пространства объектов в пространство представлений меньшей размерности, сохраняющего существенные статистические закономерности распределения данных без использования внешней разметки. Подобное отображение позволяет аппроксимировать структуру истинного распределения объектов и максимизировать полезную взаимную информацию между различными компонентами или видами одного и того же объекта.

1.2. Ограничения глобального контрастивного обучения

Классические методы контрастивного обучения минимизируют функционал качества, заданный на глобальных векторах представлений, полученных путем применения оператора глобального усреднения к выходному тензору энкодера. Пусть \mathbf{x} \in \mathcal{X} — случайный элемент пространства объектов. Глобальный энкодер реализует отображение:

f: \mathcal{X} \to \mathbb{R}^d

Данный подход максимизирует инвариантность представлений относительно стохастических преобразований, однако приводит к потере высокочастотной пространственной информации. Это делает результирующие признаки неоптимальными для задач плотного предсказания, таких как семантическая сегментация или детекция объектов, где критически важна точная локализация паттернов.

1.3. Концепция Dense Contrastive Learning

Плотное контрастивное обучение преодолевает данное ограничение путем переноса оптимизационной задачи с глобальных векторов на локальные поля признаков. Вместо максимизации сходства интегральных характеристик двух видов одного и того же объекта, DCL максимизирует локальное сходство между пространственно соотнесенными парами векторов, извлеченных из различных топологических участков объекта, что позволяет сохранять геометрию и локальные свойства распределения.

2. Теоретико-вероятностные основы контрастивного обучения

2.1. Вероятностное пространство и стохастические преобразования

Пусть задано основное вероятностное пространство (\Omega, \mathcal{F}, \mathbb{P}). Случайный элемент (изображение) X принимает значения в измеримом пространстве (\mathcal{X}, \mathcal{B}_{\mathcal{X}}). Определим семейство стохастических преобразований (аугментаций) \mathcal{T} = \{t^\omega \mid \omega \in \Omega_t\}, где каждое t является измеримым отображением t: \mathcal{X} \to \mathcal{X}. Для заданного объекта X применение двух независимых случайных преобразований t_1, t_2 \sim \mathcal{T} порождает пару коррелированных случайных элементов:

X^1 = t_1(X), \quad X^2 = t_2(X)

2.2. Математическая формулировка функции потерь InfoNCE

В глобальном контрастивном обучении для выборки, состоящей из одного положительного примера X^2 и N-1 отрицательных примеров \tilde{X}_j (независимых от X и распределенных в соответствии с маргинальным распределением данных \mathbb{P}_X), функция потерь InfoNCE определяется как математическое ожидание следующего вида:

\mathcal{L}_{\mathrm{InfoNCE}} = - \mathbb{E} \left[ \log \frac{\exp(\mathbf{z}_1^T \mathbf{z}_2 / \tau)}{\exp(\mathbf{z}_1^T \mathbf{z}_2 / \tau) + \sum_{j=1}^{N-1} \exp(\mathbf{z}_1^T \mathbf{z}_j^{-} / \tau)} \right]

где \mathbf{z}_1 = f(X^1), \mathbf{z}_2 = f(X^2), \mathbf{z}_j^{-} = f(\tilde{X}_j) — нормированные векторы в пространстве представлений на единичной гиперсфере \mathbb{S}^{d-1}, а \tau \in \mathbb{R}^+ — гиперпараметр масштабирования (температура).

3. Математическая постановка задачи Плотного Контрастивного Обучения (DCL)

3.1. Формализация пространства локальных признаков

Пусть локальный энкодер представляет собой измеримое отображение g: \mathcal{X} \to \mathbb{R}^{H \times W \times C}, где H и W — пространственные размерности (высота и ширина дискретной сетки признаков), а C — количество каналов представлений. Таким образом, для объекта X выход представляет собой упорядоченный набор локальных векторов признаков. Для упрощения индексации перейдем к линейному множеству пространственных индексов K = \{1, \dots, H \times W\}, тогда представление объекта записывается как семейство векторов:

g(X) = \{\mathbf{v}_k \in \mathbb{R}^C \mid k \in K\}

3.2. Проблема пространственного соответствия

Поскольку стохастические преобразования t_1 и t_2 включают пространственные трансформации (случайное кадрирование, аффинные отображения), геометрические координаты сеток представлений g(X^1) и g(X^2) не соответствуют друг другу напрямую. Введем отношение пространственного соответствия между множествами индексов K_1 и K_2 двух аугментированных видов. Пусть \Pi \subset K_1 \times K_2 — множество пар индексов (m, n), таких что локальный вектор \mathbf{v}_m^1 \in g(X^1) и локальный вектор \mathbf{v}_n^2 \in g(X^2) соответствуют одному и тому же подмножеству физического пространства исходного объекта X. Координатное преобразование задается измеримой функцией взаимного отображения, однозначно определяемой параметрами геометрических трансформаций в t_1 и t_2.

3.3. Структурирование локальных контрастивных множеств

Для каждого фиксированного индекса m \in K_1 определим:

  • Множество положительных индексов P(m) = \{n \in K_2 \mid (m, n) \in \Pi\}. В частном случае взаимно-однозначного соответствия |P(m)| = 1.
  • Множество отрицательных примеров M^-(m), формируемое как из локальных векторов других пространственных позиций того же объекта (k \in K_2 \setminus P(m)), так и из векторов пространственных полей других объектов текущей выборки.

4. Оптимизационная задача и Dense InfoNCE

4.1. Конструирование функции потерь Dense InfoNCE

Функционал локальной контрастивной потери для фиксированной пространственной позиции m \in K_1 при наличии истинного соответствия n \in P(m) определяется как логарифмическая функция правдоподобия:

\mathcal{L}_{\mathrm{local}}(m, X^1, X^2) = - \log \frac{\exp(\langle \mathbf{v}_m^1, \mathbf{v}_n^2 \rangle / \tau)}{\exp(\langle \mathbf{v}_m^1, \mathbf{v}_n^2 \rangle / \tau) + \sum_{\mathbf{u} \in M^-(m)} \exp(\langle \mathbf{v}_m^1, \mathbf{u} \rangle / \tau)}

где \langle \cdot, \cdot \rangle обозначает скалярное произведение векторов, предварительно нормированных по евклидовой норме (\|\mathbf{v}\|_2 = 1). Полная целевая функция плотного контрастивного обучения представляет собой математическое ожидание усредненной по пространственной сетке локальной потери:

\mathcal{L}_{\mathrm{DenseInfoNCE}} = \mathbb{E}_{X, t_1, t_2} \left[ \frac{1}{|K_+|} \sum_{m \in K_1, P(m) \neq \emptyset} \mathcal{L}_{\mathrm{local}}(m, X^1, X^2) \right]

где K_+ — подмножество индексов m \in K_1, для которых существует непустое множество пространственных соответствий в K_2.

4.2. Вычислительная сложность и аппроксимация

Прямое вычисление знаменателя в локальной потере сопряжено с высокой вычислительной сложностью, так как мощность множества отрицательных примеров |M^-(m)| масштабируется как \mathcal{O}(B \cdot H \cdot W), где B — размер мини-пакета. Для минимизации вычислительных затрат применяется стохастическая аппроксимация контрастивного множества с использованием скользящей очереди локальных представлений (memory queue), обновляемой в режиме импульса (momentum update) без вычисления градиентов для старых элементов.

5. Теоретико-информационная интерпретация DCL

5.1. Взаимная информация локальных представлений

Пусть V_m^1 и V_n^2 — случайные векторы, представляющие локальные признаки в пространственно соотнесенных позициях. Их взаимная информация задается через расхождение Кульбака — Лейблера между совместным распределением и произведением маргинальных распределений случайных векторов:

I(V_m^1; V_n^2) = \int \int p(\mathbf{v}_m^1, \mathbf{v}_n^2) \log \frac{p(\mathbf{v}_m^1, \mathbf{v}_n^2)}{p(\mathbf{v}_m^1)p(\mathbf{v}_n^2)} \, d\mathbf{v}_m^1 \, d\mathbf{v}_n^2

5.2. Максимизация нижней границы взаимной информации

Минимизация функционала качества Dense InfoNCE эквивалентна максимизации нижней границы локальной взаимной информации. На основании многомерного обобщения теоремы об оценке плотности (InfoMax principle) выполняется неравенство:

I(V_m^1; V_n^2) \ge \log(N) - \mathcal{L}_{\mathrm{local}}(m, X^1, X^2)

где N — общая мощность контрастивного множества локальных фрагментов. Таким образом, оптимизация целевой функции гарантирует максимизацию объема информации о локальной геометрической и текстурной структуре объекта, инвариантной к примененным стохастическим преобразованиям.

5.3. Декомпозиция глобального информационного ограничения

При глобальной контрастивной оптимизации максимизируется граница взаимной информации интегральных представлений объектов I(f(X^1); f(X^2)). В силу свойств субаддитивности энтропии, глобальный вектор ограниченной размерности статистически неспособен сохранить локальные энтропийные характеристики всех субрегионов:

I(f(X^1); f(X^2)) \le \sum_{m} I(V_m^1; V_{n(m)}^2)

Локальная максимизация информации в рамках парадигмы DCL декомпозирует общую оптимизационную задачу на систему независимых локальных информационных ограничений, предотвращая коллапс пространственно-высокочастотных признаков в низкочастотный глобальный тренд.

См. также

Литература

  • Van den Oord A., Li Y., Vinyals O. Representation learning with contrastive predictive coding // arXiv preprint arXiv:1807.03748. — 2018.
  • Wang X., Zhang R., Shen C., Kong T., Li L. Dense contrastive learning for self-supervised visual representation learning // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2021. — С. 10208-10217.
  • He K., Fan H., Wu Y., Xie S., Girshick R. Momentum contrast for unsupervised visual representation learning // Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition. — 2020. — С. 9729-9738.
Личные инструменты