Автономность ИИ · вердикт 2026

Может ли нейросеть работать за тебя: 3 признака и правда 2026

Полтора года назад нейросеть тянула задачу на 30 секунд человеческой работы. Сегодня, по замеру исследовательской организации METR (обновление 8 мая 2026 года), самая свежая модель справляется с задачей длиной больше 14 часов человеческой работы - но справляется лишь в половине попыток, и это ключевая деталь, которую реклама автоматизации обычно не договаривает

К концу статьи будет ясно: что из обещаний «нейросеть работает за тебя» подтверждено живыми замерами исследователей, а что остаётся рекламной формулировкой без цифры за ней, где реально проходит граница присмотра для задач 2026 года, и по каким трём признакам заранее понять, потянет ли нейросеть именно твою задачу без тебя рядом. Если решишь после этого собрать себе такого помощника - отдельный гайд ИИ-агенты: что это простыми словами и как собрать своего разберёт это по шагам

Проверь одну вещь у своей задачи: сколько шагов подряд без твоей проверки она требует. Одна-две минуты работы нейросеть тянет почти всегда, а вот задачу на несколько часов подряд без единой сверки с тобой не тянет ни одна модель 2026 года - слишком высокий шанс, что мелкая ошибка на середине пути испортит весь результат

Откуда вообще взялось обещание «нейросеть заменит тебя на работе»

Реклама сервисов автоматизации звучит одинаково у всех: подключи агента, распишись под задачей, а дальше он сам. Формулировка не выдумана из воздуха - у неё есть реальное основание, просто урезанное до одной цифры без контекста

Компания Anthropic в собственном отчёте об использовании прямо пишет, что всё больше сессий с Claude состоят не из короткого диалога, а из «длинных агентных задач» - то есть модель правда стала брать на себя больше шагов подряд, чем ещё год назад (полный разбор, что такое агенты Claude и как они устроены внутри, есть в отдельном гайде агенты для Claude Code). Проблема рекламной версии этого факта не в том, что она врёт про направление тренда - тренд реальный. Проблема в том, что она молчит про два числа, без которых обещание нельзя проверить: сколько именно шагов подряд модель тянет и с какой вероятностью не срывается на середине пути

Сколько часов подряд нейросеть правда тянет без тебя

У исследовательской организации METR есть прямой замер этого вопроса, и он не про мнение, а про счётчик. Они называют его time horizon - протяжённость задачи, измеренная в часах человеческой работы, на которой модель справляется в половине попыток

Как читать цифру time horizon

  1. Что мерят берут больше сотни разных программистских задач, где заранее известно, сколько времени тратит на них живой человек-эксперт
  2. Как считают смотрят, на какой длине задачи модель успевает ровно в половине попыток - это и называется 50%-time horizon
  3. Что это значит для тебя если твоя задача длиннее этой планки, шанс, что модель доведёт её до конца без единой ошибки, уже ниже 50% - это не мнение автора статьи, а прямое определение метрики
График METR о длине задач, которые нейросети решают в половине попыток, снят живьём 04.09.2026
METR, «Task-Completion Time Horizons of Frontier AI Models», снята 04.09.2026: обновление от 8 мая 2026 года, самая свежая точка на графике - Claude Mythos Preview

По последнему обновлению METR от 8 мая 2026 года, самая способная модель на графике достигает планки около 14-16 часов человеческой работы - и сами исследователи прямо помечают на графике, что измерения выше 16 часов уже ненадёжны на их наборе задач. Скорость роста этой планки при этом впечатляющая: с 2019 по 2025 год она удваивалась примерно раз в 7 месяцев, а к 2024-2025 годам темп ускорился до удвоения раз в 4 месяца, по данным независимого разбора AI Digest на тех же измерениях METR

Здесь и прячется главное расхождение между рекламой и фактом. Реклама читает эту цифру как «нейросеть тянет 14 часов работы» и на этом останавливается. Факт звучит иначе: на задаче такой длины модель проваливается в половине случаев. Для короткой задачи (пара минут) успех почти гарантирован, а вот доверить агенту рабочий день целиком без единой проверки - это по факту монетка

Куда идёт планка дальше: прогноз на несколько лет вперёд

Раз планка растёт по предсказуемой кривой, у неё есть и прогноз на будущее - AI Digest прямо экстраполирует тот же темп удвоения на ближайшие годы. Прогноз не означает, что планка обязательно дойдёт до этих значений точно в срок: экспонента может замедлиться, а может и ускориться, сами авторы разбора называют это именно продолжением тренда, а не гарантией

ГодПланка time horizon по прогнозуЧто это по-человечески
20278 часоводин полный рабочий день
202840 часоводна полная рабочая неделя
2029167 часоводин полный рабочий месяц

Таблица прокручивается вбок →

Даже если прогноз сбудется буквально, смысл цифры остаётся тем же самым, что и сегодня у 14 часов: это планка, на которой модель справляется в ПОЛОВИНЕ попыток, а не гарантированно. Растущая планка не отменяет монетку на её собственной границе - она просто отодвигает эту границу дальше

Почему длинная задача разваливается чаще короткой

Дело не в том, что модель вдруг резко глупеет к вечеру пятого часа работы. Дело в том, как устроены длинные многошаговые задачи в принципе: каждый шаг имеет свой небольшой шанс мелкой ошибки, а ошибки внутри одной цепочки складываются, а не гасят друг друга (базовый рабочий цикл из шести шагов, на котором строится любая такая цепочка, разобран в гайде Claude: рабочий цикл для новичка)

Представь задачу из десяти последовательных шагов, где каждый отдельный шаг модель делает верно в 85 случаях из 100 - на первый взгляд отличный результат для одного шага. Но чтобы вся цепочка из десяти шагов прошла без единой осечки, нужно, чтобы все десять сработали подряд - а вероятность этого события намного ниже, чем 85%: перемножение шансов по цепочке уводит итоговый результат в район 20% успеха на весь десятишаговый путь целиком

Как считается эта арифметика на разной длине цепочки

Правило простое: вероятности отдельных шагов перемножаются, а не усредняются. Если взять тот же самый шаг с надёжностью 85% и просто увеличивать число шагов подряд, итоговый шанс полного успеха падает быстрее, чем кажется на глаз

Число шагов подрядШанс пройти всю цепочку без единой ошибки
1 шаг85%
3 шага61%
5 шагов44%
10 шагов20%
20 шагов4%

Таблица прокручивается вбок →

Отсюда и вытекает практический вывод раздела про три признака ниже: чем короче автономный прогон, тем ближе итоговый шанс успеха к надёжности одного шага. Длинная цепочка не прощает даже небольшую вероятность ошибки на каждом отдельном шаге - она копит её

Живой пример: почему 1600 попыток закончились в основном провалом

Исследователи из Беркли прогнали больше 1600 записанных попыток семи разных мульти-агентных систем и разложили каждый провал на причину. Итог по всей выборке жёсткий: от 41 до почти 87 процентов попыток заканчивались неудачей на стандартных проверочных заданиях, в зависимости от конкретной системы

График AI Digest про темп удвоения времени автономной работы нейросетей на данных METR, снят живьём 04.09.2026
AI Digest, «A new Moore's Law for AI agents», снята 04.09.2026: «today, AI agents can autonomously do coding tasks that take humans over fourteen hours»
Причина провалаДоля всех отказов
Задачу изначально плохо поставили или систему плохо спроектировали41,8%
Агенты внутри системы не поняли друг друга при передаче работы36,9%
Результат никто толком не проверил перед сдачей21,3%

Таблица прокручивается вбок →

Самая частая причина провала - даже не сбой модели в моменте, а изначально нечёткая постановка задачи и слабое разделение ролей между агентами. Это прямое опровержение самой рекламной версии тезиса «дальше он сам»: если задачу изначально сформулировали расплывчато, автономность не чинит эту проблему, а усиливает - ошибка просто разгоняется дальше по цепочке шагов, пока кто-то её не заметит (полный разбор рисков автономных агентов и как их снижать - в гайде безопасность автономных ИИ-агентов)

Какие именно системы проверяли и на чём

Исследователи из Беркли не брали одну систему - в выборку попали семь разных мульти-агентных систем, каждая со своим бенчмарком и своей моделью внутри. Это важно: провалы - не баг одного конкретного продукта, а закономерность, которая повторяется у разных команд и разных архитектур

СистемаПроверочное заданиеМодель внутри
ChatDevProgramDevGPT-4o
MetaGPTProgramDevGPT-4o
HyperAgentSWE-Bench LiteClaude-3.7-Sonnet
AppWorldTest-CGPT-4o
AG2 (MathChat)GSM-PlusGPT-4
Magentic-OneGAIAGPT-4o
OpenManusProgramDevGPT-4o

Таблица прокручивается вбок →

Разброс моделей внутри систем говорит о том же, о чём и общий итог: дело не в конкретной модели, которую взяли за основу, а в том, как вообще устроена передача задачи между несколькими агентами внутри одной системы

Что значит «автоматизация» у самого вендора, а не в рекламе

Компания Anthropic - та самая, что делает Claude - в собственном отчёте об использовании прямо разводит два разных режима работы с нейросетью, и определение стоит прочитать буквально, а не по пересказу маркетинга

Разговор считается «автоматизацией» тогда, когда модель выполняет задачу «с минимальным участием пользователя или вовсе без него» - и в отчёте это конкретно означает короткую прямую команду («переведи этот документ») или короткую петлю правок («сделай письмо более неформальным»). Второй режим - «augmentation», усиление: человек и модель работают вместе над задачей, обмениваясь репликами дольше одной команды

График Anthropic о доле задач, доступной ИИ, по доходу страны, снят живьём 04.09.2026
Anthropic, «Anthropic Economic Index report: Cadences», снята 04.09.2026: Figure 3.4, доля задач-кандидатов на автоматизацию обратно связана с уровнем дохода страны

Здесь и находится вторая скрытая деталь рекламы: слово «автоматизация» у вендора значит «модель сделала шаг с минимальным вводом от тебя», а вовсе не «отпустил и полностью забыл на весь день». В том же отчёте виден дополнительный живой факт: доля задач, которую люди СЧИТАЮТ доступной для ИИ, в среднем на 10 процентных пунктов ниже в странах с высоким доходом, чем в странах с низким. Восприятие «нейросеть заменит меня» и реальная граница автономности - это две разные шкалы, и они расходятся ещё до всякой рекламы

Где проходит граница: три признака задачи, которую можно доверить целиком

После всех цифр выше есть практический вопрос - как заранее понять, потянет ли нейросеть именно твою задачу без присмотра. Три признака вместе дают достаточно надёжный фильтр

Три признака задачи, которую можно отдать без постоянной проверки

  • Короткая по времени минуты, максимум десятки минут человеческой работы - на такой длине шанс полного успеха у моделей 2026 года ощутимо выше, чем на многочасовой
  • Обратимая если результат можно откатить, переделать или проверить одним взглядом до того, как он куда-то уйдёт (письмо, платёж, публикация) - цена ошибки низкая
  • С чётким критерием готово / не готово задача, где легко проверить результат одним взглядом («файл появился», «сумма сошлась»), а не задача, где «готово» - вопрос вкуса или контекста, который знаешь только ты

Задача, которая проходит все три признака сразу, - хороший кандидат на автономный прогон без твоей ежеминутной проверки. Задача, которая проваливает хотя бы один признак, требует присмотра: не значит «нейросеть не справится вообще», значит «не оставляй её одну на всю длину, проверяй по частям»

Что делать, если задача не проходит эти три признака

Не выбрасывать идею целиком, а сузить кусок. Длинную многошаговую работу можно разбить на несколько коротких прогонов с твоей проверкой между ними - это не откат к ручному труду, а способ снизить длину каждого отдельного автономного шага до той зоны, где модель ошибается реже

Практический приём: раздели задачу на этапы так, чтобы после каждого этапа появлялся артефакт, который ты можешь проверить одним взглядом за минуту - файл, черновик, промежуточный расчёт. Чем чаще в цепочке появляется такая точка проверки, тем меньше шанс, что мелкая ошибка ранних шагов доедет незамеченной до самого конца и испортит весь результат целиком. Готовую лесенку уровней, от «правит текст под присмотром» до «делает цепочку задач сама», разбирает отдельный гайд 5 уровней автоматизации на Claude

Где нейросеть реально ошибается, даже когда кажется, что закончила

Отдельная ловушка - модель может честно написать «готово», хотя задача не решена или решена не так, как нужно. Это не выдумка и не редкость: у меня есть отдельный разбор именно этого случая с конкретной проверочной последовательностью из четырёх шагов - агент говорит «готово»: 4 шага, чтобы доделать до конца. Похожий, но не тождественный случай - когда модель формально ответила, но ответ мимо задачи целиком, разбор шести причин и правок собран в гайде Claude делает не то, что просил

Связь с этой статьёй прямая: слово «готово» от модели не отменяет третий признак из раздела выше - чёткую проверку результата тобой. Даже короткая обратимая задача с понятным критерием готовности всё равно нуждается в одном взгляде на результат перед тем, как считать её закрытой

Полный список гайдов про нейросети и инструменты на этом же сайте собран в разделе нейросети и инструменты

Что почитать дальше на этом же сайте

Источники

Все страницы проверены прямым запросом 4 сентября 2026 года, у METR, AI Digest и Anthropic дополнительно сняты кадры живым Playwright headless

Памятка: может ли нейросеть работать за тебя

Шесть строк, которые закрывают суть статьи и что с этим делать

Сохрани себе

  • METR (8 мая 2026): топовая модель тянет задачу длиной около 14-16 часов человеческой работы, но справляется лишь в половине попыток
  • Скорость роста этой планки удваивалась каждые 7 месяцев (2019-2025), затем ускорилась до 4 месяцев (2024-2025)
  • MAST-исследование Berkeley: 41-87% провалов мульти-агентных систем на стандартных задачах, чаще всего из-за нечёткой постановки задачи, а не сбоя модели в моменте
  • Anthropic называет «автоматизацией» короткую команду или короткую петлю правок с минимальным вводом от тебя - не «отпустил на весь день»
  • Три признака задачи под автономный прогон - короткая, обратимая, с чётким критерием готовности
  • Не проходит признаки - не отказ от идеи, а разбивка на этапы с твоей проверкой между ними

Порог входа

Вердикт прочитал бесплатно, разбор своей задачи - тоже

Всё, что нужно, чтобы честно ответить себе на вопрос «может ли нейросеть работать за меня», ты только что прочитал бесплатно: живые цифры METR и Berkeley, определение автоматизации от самого вендора и три признака задачи под автономный прогон. Следующий шаг - разобрать твою конкретную задачу за три дня Лагеря - тоже стоит ровно ноль

Забрать путёвку в ИИ-Лагерь

Заявка в закрытый канал, одобряю сразу. Бот сам напишет первым и покажет, как забрать три дня Лагеря. Бесплатно

Частые вопросы

Может ли нейросеть работать за тебя полностью, без единой проверки?

На задачах в пару минут - почти всегда да, судя по замерам METR. На задачах длиннее нескольких часов - нет, и это не оценочное мнение: сама метрика time horizon прямо означает, что на такой длине модель проваливает попытку примерно в половине случаев. Граница проходит по длине задачи и числу шагов, а не по общему ощущению «модели стали умнее»

Почему тогда реклама сервисов автоматизации звучит так уверенно?

Потому что берёт верхнюю границу возможностей («14 часов работы») и опускает вторую половину факта - вероятность успеха на этой границе. METR прямо публикует обе цифры вместе, реклама обычно берёт только первую

Если агент часто ошибается на длинных задачах, значит, автономность - это миф?

Нет, и дело не в мифе, а в масштабе задачи. На короткой обратимой задаче с понятным критерием готовности автономность работает предсказуемо хорошо уже сегодня. Миф - это конкретно формулировка «подключи и забудь про любую задачу», а не сам факт растущей автономности

Что делать, если моя рабочая задача явно длиннее, чем модель тянет надёжно?

Разбить на этапы с точками проверки между ними, как описано в разделе про три признака. Это не откат к ручной работе целиком, а способ держать длину каждого отдельного автономного шага в зоне, где модель ошибается реже. Готовую лесенку такого разбиения для Claude смотри в гайде 5 уровней автоматизации

Чем это отличается от вопроса «агент сказал готово, а не готово»?

Это соседний, но другой вопрос. Здесь статья про заранее оцениваемую вероятность успеха по длине задачи. Тот вопрос - про то, что происходит уже ПОСЛЕ прогона, когда модель формально отчиталась о завершении, но результат не соответствует задаче. Полный разбор с проверочными шагами - в отдельном гайде агент говорит «готово»