Create your own
Lesson illustration

Вывод логарифмической формы собственной информации из аддитивности и монотонности

Здравствуйте! Начинаем курс с самого малого объекта теории информации: не со средней неопределённости распределения, а с информации, принесённой одним наблюдённым событием. В этом модуле мы постепенно перейдём от этой величины к энтропии Шеннона, условной энтропии и цепным правилам.

Сегодняшняя цель фундаментальна: показать, что формула

не является произвольным соглашением. Если мера «удивления» зависит от вероятности события, возрастает для более редких событий и складывается для независимых наблюдений, то она неизбежно имеет логарифмический вид — с точностью до выбора масштаба, то есть единицы измерения.


От «удивления» к функциональному уравнению

Пусть событие имеет вероятность

Ищем функцию , которая измеряет собственную информацию, или surprisal, наблюдения этого события:

Здесь уже заложено важное предположение: содержание информации зависит только от вероятности, а не от семантической метки события. Если модель считала токен Paris вероятностью , то факт его появления несёт столько же self-information, сколько появление любого другого события с вероятностью .

Потребуем от три естественных свойства.

  1. Достоверное событие не сообщает нового.

    Если событие ожидалось с вероятностью , его наступление не меняет знания наблюдателя.

  2. Редкое событие информативнее частого. Функция должна быть строго убывающей по :

  3. Независимые наблюдения должны складываться по информации. Если и независимы, то

    Узнать оба результата должно означать получить сумму информации:

    Поэтому для любых допустимых необходимо

Последнее равенство — центральное функциональное уравнение. Вероятности независимых событий перемножаются, а информация о них должна складываться. Логарифм — именно та операция, которая переводит произведение в сумму.

MaDL - Information and Entropy

Посмотрите фрагмент «MaDL – Information and Entropy» от Tübingen Machine Learning. Он коротко и наглядно формулирует требования к собственной информации, затем проверяет их на бросках монеты.

В отрывке аксиомы обратите внимание на три требования: нулевую информацию при вероятности один, убывание по вероятности и аддитивность независимых событий. Затем посмотрите пример монеты, чтобы зафиксировать, почему два независимых равновероятных результата дают два бита, а не некоторую новую произвольную шкалу.

Обычная интуиция «редкое значит информативное» сама по себе ещё не фиксирует формулу. Например,

тоже убывает по и даёт ноль при . Но она не согласуется с композицией независимых наблюдений:

То есть она неверно измеряет «объём» двух независимых фактов. Аддитивность резко сужает пространство возможных мер.


Вывод: монотонное решение обязано быть логарифмом

Теперь выведем форму аккуратно, не просто проверим её постфактум.

Из аддитивности сразу следует нормировка для достоверного события:

откуда

Чтобы превратить умножение вероятностей в сложение аргументов, введём новую функцию:

Это не трюк, а естественная замена координат: любая вероятность единственным образом представляется как

Подставим и в аддитивность:

Итак, удовлетворяет аддитивному уравнению Коши на неотрицательной полуоси:

Само по себе уравнение Коши допускает патологические решения, если не накладывать никаких условий регулярности. Здесь регулярность уже даёт наша содержательная аксиома монотонности:

  • строго убывает по ;
  • строго убывает по ;
  • следовательно, строго возрастает по .

Монотонной аддитивной функции достаточно, чтобы получить линейность. Обозначим

Тогда для натурального

Для рационального числа имеем

значит,

Наконец, рациональные числа можно приблизить к любому вещественному снизу и сверху. Монотонность зажимает между соответствующими значениями на рациональных приближениях. Поскольку на рациональных аргументах функция уже равна , получаем для всех :

Возвращаемся к вероятности. Так как ,

Строгое убывание требует . Следовательно, единственное семейство мер собственной информации, согласованных с аксиомами, имеет вид

для некоторой положительной константы .

Эту константу удобнее записать как выбор основания логарифма. Если выбрать так, что

то получаем привычную форму:

Information content - Wikipedia

Прочитайте раздел «Derivation» из статьи Information content на Wikipedia. Он повторяет аксиоматическую мотивацию через функциональное уравнение и явно связывает множитель перед логарифмом с выбором единицы измерения.

В подразделе “Derivation” начните с абзаца, который вводит зависимость информации от вероятности: постановка функции. Затем найдите абзац, начинающийся словами “Further, by definition” и прочитайте переход к аддитивности: независимость превращает совместную вероятность в произведение. Закончите абзацами от “The only continuous functions”, где дано логарифмическое решение и обсуждается выбор основания. В источнике регулярность формулируется как непрерывность; в нашем выводе ту же техническую роль играет более содержательное условие монотонности.


Масштаб информации: биты, наты и нормировка

После вывода остаётся свобода масштаба. Она не меняет сравнений и аддитивности, но меняет численное значение информации.

Основание НормировкаЕдиница
бит
нат
хартли

В ML наиболее часто встречаются две конвенции:

  • наты, когда loss записан через естественный логарифм, как в большинстве библиотек и выводов правдоподобия;
  • биты, когда важна интерпретация через двоичные вопросы, сжатие или bits per token.

Перевод между ними — обычное изменение масштаба:

Например, событие с вероятностью имеет информацию

бит, или

ната. Это одно и то же наблюдение в разных единицах.

График показывает зависимость \(I(x)=-\log_2 P(x)\) от вероятности: событие с вероятностью \(0.1\) несёт примерно \(3.32\) бита, а событие с вероятностью \(0.4\) — примерно \(1.32\) бита.

Важны и граничные случаи:

При собственная информация неограниченно растёт:

Строго говоря, не определён. Интерпретация предела такова: если модель приписала реализовавшемуся событию нулевую вероятность, наблюдение бесконечно сильно противоречит модели. В реальных нейросетевых моделях softmax обычно оставляет вероятности положительными, но численно очень малые вероятности уже соответствуют большим отрицательным log-probability и большим loss.


Почему это уже язык ML

Для модели, предсказывающей категориальное распределение , собственная информация наблюдённого класса равна

Это и есть negative log-likelihood для одного наблюдения. Она не оценивает качество модели в среднем и ещё не является энтропией: это стоимость конкретного факта, который модель заранее считала вероятностью .

Логарифм особенно важен для последовательностей. Если авторегрессионная модель задаёт вероятность текста через условные вероятности, то вероятность всей последовательности равна произведению:

Взяв отрицательный логарифм, получаем сумму token-level surprisals:

Здесь не предполагается независимость токенов: зависимость учтена через условный контекст . Полный разбор этого равенства для language models появится в модуле об энтропии и оценке языковых моделей; пока существенен принцип: логарифм делает вероятностную композицию аддитивной и поэтому превращает likelihood последовательности в удобную сумму оптимизационных слагаемых.

Небольшая проверка на Python фиксирует это свойство численно:

import math

def surprisal(p: float, base: float = 2.0) -> float:
    if not 0.0 < p <= 1.0:
        raise ValueError("p must lie in (0, 1].")
    return -math.log(p, base)

p_a = 0.4
p_b = 0.1

joint = surprisal(p_a * p_b)
separate = surprisal(p_a) + surprisal(p_b)

print(surprisal(0.5))   # 1.0 bit
print(surprisal(0.01))  # about 6.64 bits
print(joint, separate)  # equal up to floating-point error

assert math.isclose(joint, separate, rel_tol=1e-12)

Здесь joint измеряет информацию совместного наступления двух независимых событий с вероятностями и . Важно не подменять это утверждение независимыми маргиналами, когда события зависимы. Для зависимых событий разложение должно использовать условную вероятность:

Именно эта идея позднее станет основой условной энтропии и цепного правила.


Итог

Собственная информация события с вероятностью определяется не эстетическим выбором формулы, а структурой требований:

  • она зависит от вероятности события;
  • редкие события должны приносить больше информации;
  • информация независимых наблюдений должна складываться;
  • монотонность исключает патологические решения функционального уравнения.

Поэтому неизбежно получается семейство логарифмических мер:

Основание задаёт единицу: чаще всего биты при и наты при . Для ML это тот же объект, который на одном наблюдении выглядит как negative log-likelihood, а для последовательностей превращает произведение вероятностей в сумму token-level вкладов.

В следующем уроке мы усредним self-information по всем возможным исходам распределения и получим энтропию Шеннона — среднюю неопределённость в битах или натах.

Can't find a good explanation? Sign up and we'll make it for you

Sign up