Мы дали инструменту на базе искусственного интеллекта полный контроль над ноутбуком. Преднастроенные приложения. Полный доступ в интернет. Вопрос был простым, как можно уместить на салфетке: действительно ли искусственный интеллект способен выполнять офисную работу?

Руководители, безусловно, думают иначе. Только в этом году более 200 технологических компаний сократили около 120 000 рабочих мест. Сайт Layoffs.fyi отслеживает эти потери, и такие гиганты, как Meta и Oracle, указывают на ИИ как на главную причину увольнений. Генеральный директор Cloudflare после сокращения 1 100 сотрудников не стал ходить вокруг да около: он ожидает, что ИИ заменит сотрудников среднего звена, а также специалистов по финансам и маркетингу.

Мы решили проверить эти агенты на практике. И ответ оказался не чистым «да» или «нет». Это запутанное «иногда».

Тестирование ИИ-агентов на реальных офисных задачах

Мы развернули ИИ-«агентов», чтобы они имитировали офисных работников. Цель состояла в том, чтобы увидеть, способны ли они принимать автономные решения на основе подробных инструкций. Для симуляции реальных условий мы использовали benchmarks (тестовые задания) от Университета Карнеги-Меллона и OpenAI. Тесты включали сгенерированные таблицы, служебные записки и списки сотрудников, а также тщательно составленные промпты (запросы), определяющие роль ИИ и доступные ему инструменты.

Запуск агентов осуществлялся через приложение Anthropic Claude Cowork. Эта настройка позволила ИИ взять управление компьютером в свои руки. Но управление — это одно дело. Компетентность — совсем другое.

Агенты блестяще справлялись с задачами, требующими написания компьютерных программ. Со всем остальным у них возникали трудности.

Справится ли ИИ с человеческой нюансностью и дизайном интерфейсов?

Наш первый тест заключался в сборе обратной связи от коллег в Slack. Мы создали ботов, имитирующих коллег, и подали ИИ заранее подготовленные ответы. Агент успешно справился с несколькими неожиданными поворотами. Когда имя было написано с ошибкой («Sara» вместо «Sarah»), он всё равно отправил сообщение правильному человеку. Когда участник не ответил, агент не стал ждать вхолостую. Он зафиксировал сотрудника со счётом ноль и перешёл к следующему шагу.

Простые вещи. Но затем мы предложили ему что-то более сложное.

Агенту нужно было проанализировать документы и определить, какие должности подлежат сокращению для бюджета государственного агентства. Ему предстояло решить, какие роли можно считать лишними. Результат? Он подготовил отчёт из трёх документов. В основном точный. Он верно определил, что пенсии и увольнения по собственному желанию могут помочь выполнить бюджетные цели без массовых увольнений.

Но в нём была и значимая ошибка. Агент пометил сотрудников, ушедших в отпуск, как подлежащих увольнению. Он объединил их в одну кучу, не учитывая тот факт, что они планировали вернуться.

Где человек инстинктивно спросил бы, как долго продлится отпуск, ИИ предположил, что они ушли навсегда. Он сделал вывод о постоянном сокращении штата на основании временного отсутствия.

«ИИ может быть менее способен заменить неявные знания — специфические навыки и приёмы, которые накапливаются с опытом». — Стэнфордский университет и Национальное бюро экономических исследований (NBER)

Неявные знания. То, чему учатся на практике, а не из книг. У ИИ этого пока нет.

Почему ИИ-агенты предпочитают программирование кликам мышью

ИИ также испытывал трудности с базовой навигацией в интерфейсах. Он путался в интерфейсе Google Drive. Он неуклюже работал с таблицами. Когда ему поручили изменить организационную структуру в Preview или Google Slides, он сразу же сдался. Он решил, что использование приложения «слишком непрактично», и вместо этого написал код.

Грэм Нойберг, профессор Университета Карнеги-Меллона и соавтор проекта AgentCompany, отметил, что агенты работают «очень нечеловеческим образом». Они предпочитают программирование типичным пользовательским интерфейсам.

Наш агент подтвердил эту предвзятость. Несмотря на прямые инструкции попробовать сначала приложения, он проигнорировал их. Примерно через 30 секунд он переключился на код. Он понял, что хорош в написании кода, и осознал, что плохо справляется с нажатием кнопок, предназначенных для человеческих глаз.

Следующая задача закрепила эту закономерность. Агенту нужно было заполнить 17 форм подтверждения трудоустройства, используя данные из таблицы. Он загрузил их в Google Drive.

И снова он избегал приложений. Он писал код. Решение оказалось хорошим. Он даже добавил проверку форматов для телефонных номеров и номеров социального страхования (SSN). Он легко справился с задачей, которая была бы утомительной для человека.

Затем он застрял. Тривиальный шаг для любого офисного работника: загрузка готовых PDF-файлов в нужную папку на Google Drive. Агент запнулся. Код обработал логику, но работа с интерфейсом дала сбой.

Вердикт: ИИ нужен человеческий руководитель

Наш эксперимент совпал с более широкими выводами в индустрии. Компания Scale AI недавно протестировала агентов на реальных фриланс-проектах. Модель с наилучшими результатами выдавала готовые для клиента результаты лишь в 16% случаев.

ИИ может преуспевать в конкретных, изолированных задачах. Он может обрабатывать структурированные данные. Он может писать код. Но он терпит неудачу в нюансных, интуитивных и требующих работы с интерфейсами частях большинства рабочих процессов. Он не понимает офисной политики. Он не знает, когда кто-то просто сделал перерыв, а когда уволился.

Он может добавлять ценность в определённые сферы workforce (рабочей силы). Но пока что ИИ всё ещё нуждается в человеке, который будет присматривать за ним. В начальнике. Кто-то должен исправлять застрявшие загрузки. Кто-то должен корректировать ошибки при найме.

Инструменты становятся лучше. Но разрыв между «выполнить задачу» и «выполнить работу» по-прежнему широк.