Полушуточный прогнозный аппарат · v1.0.0 English

Как это считается

Короткий ответ: из одного числа. Всё, что показывает сервис, выведено из горизонта автономных задач METR — длины работы, которую модель доводит до конца сама. На 2025 год опорная точка — 320 минут при 50% успеха (Claude Opus 4.5).

Что здесь измерено, а что придумано

Разделение принципиальное, и его стоит держать в голове всё время, пока вы двигаете ползунки.

  • Измерено: исторические точки горизонта METR и время удвоения. Это внешние данные со ссылкой на источник.
  • Придумано: коэффициенты сложности, лаги внедрения, веса ступеней, множители триггеров, потолки митигации. Это экспертное суждение автора модели. Ни одно из этих чисел не измерено и не может быть измерено.

Вторая группа несёт основную нагрузку. Именно поэтому все её значения выставлены ползунками наружу, а не спрятаны в коде: спорить надо про них.

Экстраполяция

D_эфф = время удвоения × трение × Π(множители триггеров)
log₂H(t) = log₂H₀ + (t − t₀) / D_эфф

Линия закреплена в последней точке, а не подогнана под историю. Отсюда две вещи, которые выглядят как ошибки, но ими не являются: линия расходится с ранними точками METR, а рост трения сдвигает будущие даты вправо и одновременно уводит уже пройденные глубже в прошлое.

Расчёт ведётся в логарифме горизонта, а не в самом горизонте. Это не эстетика: при минимальном удвоении и двух ускоряющих триггерах 2^1590 к 2100 году переполняет число с плавающей точкой, и вместо даты пользователь увидел бы NaN.

Даты по строкам разбивки

дата = дата(коэф × порог × надёжность) + лаг × множитель группы

Коэффициент сложности — во сколько раз более длинную цепочку рассуждений требует область относительно программной инженерии, на которой METR и меряет горизонт. Лаг внедрения — годы на железо, капитал, доверие и регуляторов после того, как способность технически появилась. Планка надёжности 80% вместо 50% умножает требуемый горизонт на 5: по METR 80%-горизонт примерно впятеро короче.

Обоснование каждого коэффициента лежит внутри соответствующей строки в разделе «Сингулярность» — раскройте строку.

Лестница катастроф

λᵢ(t) = (умысел·wᵢ + отказ контроля·uᵢ) · cᵢ(t) · d(t) · (1 − митигация·eᵢ) · aᵢ(t)

Четыре множителя, каждый из которых вы задали на глаз. Произведение таких множителей даёт величину с точностью в лучшем случае порядка — все знаки после запятой в датах суть вежливая ложь интерфейса.

Ступени вложены

Кривая уровня — это вероятность события этого уровня или хуже. Поэтому нижняя ступень всегда лежит выше верхней: глобальная катастрофа по определению включает в себя и «≥1 000 погибших». В прототипе ступени считались независимо, и при некоторых допущениях модель заявляла, что вымирание вероятнее локального инцидента. Это было исправлено.

Окно уязвимости

Множитель aᵢ(t) гасит риск после того, как способности упёрлись в потолок: мир учится жить с тем, что уже произошло. Без него любая кривая уходит в 100%, и модель перестаёт что-либо означать. Ползунок «окно уязвимости» на 100 годах фактически отключает затухание.

Отсчёт идёт с сегодня

Интегрирование начинается с текущего года, а не с фиксированного. Иначе через несколько лет сервис накапливал бы риск за годы, которые заведомо пережиты, и все кривые ползли бы вверх просто от хода времени.

Часы судного дня

минут до полуночи = max(0.2; 15 × (1 − P(глобальный) к 2100))

Пятнадцать минут — глобальная катастрофа исключена, полночь — гарантирована. Шкала придумана здесь и к настоящим Часам Судного дня Bulletin of the Atomic Scientists отношения не имеет, кроме визуальной отсылки.

Красные линии

Сервис оперирует числами жертв. Это накладывает обязательства, и они соблюдаются:

  • никаких персональных предсказаний и никаких геотаргетированных прогнозов;
  • не называется ни одна конкретная компания, лаборатория или страна в качестве виновника будущих событий;
  • сценарии в карточках катастроф описаны на уровне механизма — «каскадный отказ» — без операционных деталей, которые кто-то мог бы прочитать как инструкцию;
  • триггеры сформулированы как наблюдаемые критерии, а не как призывы или прогнозы.

И главное

Этот аппарат не предсказывает будущее и не может. У события, которое не происходило ни разу, нет обучающей выборки, нет валидации и нет способа отличить хорошую модель от красивой. Всё, что тут делается, — раскладывание допущений по полочкам так, чтобы стало видно, какое из них несёт всю нагрузку. Если ползунок «отказ контроля» двигает глобальную дату на сорок лет, а «удвоение горизонта» — на пять, то спорить надо про первое. В этом вся ценность; даты — побочный продукт.

Открытость

Код открыт под MIT, константы модели и тексты — под CC BY 4.0. Модель, чьи допущения нельзя посмотреть, не имеет права претендовать на серьёзность, поэтому все коэффициенты лежат в одном версионированном файле и меняются через pull request с обоснованием.