Anthropic предложила три метрики темпа развития передового ИИ
Anthropic опубликовала методику, которая должна сделать развитие передовых моделей наблюдаемым извне. Компания предлагает отслеживать три класса показателей: насколько ИИ участвует в создании следующего поколения ИИ, насколько хорошо люди видят и останавливают действия агентов, а также какие вычислительные ресурсы направляются на обучение, безопасность и исследовательскую работу.
Что изменилось
Первая метрика оценивает AI-led R&D
Компания предлагает отделять работу, выполненную моделями, от человеческой работы при создании следующих моделей. Простого числа запросов недостаточно: агент может много писать, но не влиять на критический путь разработки. Полезная методика должна учитывать сложность задачи, качество принятого результата, объем человеческого исправления и то, ускорила ли автоматизация обучение, оценку или безопасность. Иначе рост использования легко ошибочно принять за ускорение прогресса.
Вторая метрика касается способности наблюдать за агентами
Чем больше действий выполняет система, тем важнее знать, какую их долю люди могут восстановить, понять и остановить вовремя. Anthropic предлагает измерять надзор и возможность вмешательства в действия моделей на внутренних системах. Для практического применения нужны отдельные показатели: полнота журналов, задержка обнаружения, доля действий без объяснимой причины, время блокировки и успешность восстановления после ошибки.
Третья метрика показывает распределение вычислений
Общий объем вычислительных ресурсов не объясняет, на что именно они расходуются. Методика предлагает разделять ресурсы, используемые для роста возможностей, оценок, исследований безопасности и других задач. Такой срез может показать, успевает ли контроль за темпом наращивания возможностей. Однако одинаковое количество вычислений в разных архитектурах не гарантирует одинакового результата, поэтому показатель нельзя читать как прямую шкалу интеллекта.
Данные должны проверять независимые стороны
Anthropic связывает предложение с планом допустить сторонних оценщиков к процессам, системам и данным на уровне, сопоставимом с внутренними риск-командами. Внешняя проверка нужна, потому что лаборатория сама определяет категории, собирает телеметрию и заинтересована в интерпретации результата. Для доверия потребуется единый словарь, стабильные периоды наблюдения и публикация изменений методики, иначе показатели разных месяцев или компаний нельзя сравнивать.
Метрики дополняют, а не заменяют тесты возможностей
Предлагаемые показатели описывают производство моделей, а не их конечные способности. Они должны использоваться вместе с оценками опасных возможностей, системными карточками и отчетами по политике ответственного масштабирования. Лаборатория может иметь хороший аудит процессов и все равно выпустить модель с новым риском. Обратная ситуация тоже возможна: рост вычислений не обязательно означает резкий скачок конкретной способности.
Что это дает пользователю
Заказчикам и регуляторам полезно требовать не одну сводную оценку безопасности, а отдельные данные о возможностях, процессе разработки, надзоре и исправлении инцидентов.
Команды с внутренними агентами могут применить тот же принцип в меньшем масштабе: измерять долю принятых AI-изменений, покрытие журналами и время вмешательства человека.
Показатели нужно публиковать сериями. Одна точка не показывает темп, а изменение определения между периодами способно создать ложный тренд.
При сравнении лабораторий важно проверять границы измерения: какие команды, модели, вычисления и среды вошли в расчет, а какие были исключены.
Что нужно учитывать
Это предложение Anthropic, а не согласованный стандарт отрасли.
Внутренние показатели трудно проверить без доступа к закрытым системам и данным.
Вычисления и объем AI-работы не позволяют напрямую вывести уровень способностей модели.
Регулярность публикации и единая форма сравнения между лабораториями пока не установлены.
Коротко
Предложение Anthropic полезно тем, что переносит разговор с абстрактной скорости ИИ на наблюдаемые процессы внутри лаборатории. Три группы метрик показывают, кто фактически строит новые модели, насколько контролируемы агенты и куда направлены ресурсы. Но числа будут иметь смысл только при независимой проверке, стабильных определениях и сопоставлении с реальными возможностями. Сейчас это заготовка для прозрачности, а не готовый прибор измерения прогресса.
