Ми надали інструменту на базі штучного інтелекту повний контроль над ноутбуком. Передбачені програми. Повний доступ до Інтернету. Питання було простим, як можна вмістити на серветці: чи справді штучний інтелект здатний виконувати офісну роботу?
Керівники, безперечно, думають інакше. Лише цього року понад 200 технологічних компаній скоротили близько 120 000 робочих місць. Сайт Layoffs.fyi відстежує ці втрати, і такі гіганти, як Meta та Oracle, вказують на ІІ як на головну причину звільнень. Генеральний директор Cloudflare після скорочення 1 100 співробітників не став ходити навколо: він очікує, що ІІ замінить співробітників середньої ланки, а також фахівців з фінансів і маркетингу.
Ми вирішили перевірити ці агенти практично. І відповідь виявилася не чистою «так» чи «ні». Це заплутане “іноді”.
Тестування ІІ-агентів на реальних офісних завданнях
Ми розгорнули ІІ-агентів, щоб вони імітували офісних працівників. Ціль полягала в тому, щоб побачити, чи здатні вони приймати автономні рішення на основі докладних інструкцій. Для симуляції реальних умов ми використовували benchmarks (тестові завдання) від Університету Карнегі-Меллона та OpenAI. Тести включали згенеровані таблиці, службові записки та списки співробітників, а також ретельно складені промпти (запити), що визначають роль ІІ та доступні йому інструменти.
Запуск агентів здійснювався через програму Anthropic Claude Cowork. Ця настройка дозволила ІІ взяти керування комп’ютером у свої руки. Але управління – це одна справа. Компетентність – зовсім інше.
Агенти блискуче справлялися із завданнями, які вимагають написання комп’ютерних програм. З рештою вони виникали труднощі.
Чи впорається ІІ з людською нюансністю та дизайном інтерфейсів?
Наш перший тест полягав у збиранні зворотного зв’язку від колег у Slack. Ми створили ботів, що імітують колег, і подали ІІ заздалегідь підготовлені відповіді. Агент успішно впорався з кількома несподіваними поворотами. Коли ім’я було написане з помилкою (“Sara” замість “Sarah”), він все одно надіслав повідомлення правильній людині. Коли учасник не відповів, агент не став чекати вхолосту. Він зафіксував співробітника з рахунком нуль і перейшов до наступного кроку.
Прості речі. Але потім ми запропонували йому щось складніше.
Агенту потрібно було проаналізувати документи та визначити, які посади підлягають скороченню для бюджету державного агентства. Він мав вирішити, які ролі можна вважати зайвими. Результат? Він підготував звіт із трьох документів. Здебільшого точний. Він чітко визначив, що пенсії та звільнення за власним бажанням можуть допомогти виконати бюджетні цілі без масових звільнень.
Але в ньому була і значна помилка. Агент помітив співробітників, які пішли у відпустку, як підлягають звільненню. Він об’єднав їх в одну купу, не враховуючи того, що вони планували повернутися.
Де людина інстинктивно запитала б, як довго триватиме відпустка, ІІ припустив, що вони пішли назавжди. Він зробив висновок про постійне скорочення штату на підставі тимчасової відсутності.
«ІІ може бути менш здатним замінити неявні знання – специфічні навички та прийоми, які накопичуються з досвідом». – Стенфордський університет та Національне бюро економічних досліджень (NBER)
Неявні знання. Те, чого навчаються на практиці, а не з книжок. В ІІ цього поки що немає.
Чому ІІ-агенти воліють програмування кліків мишею
ІІ також відчував труднощі з базовою навігацією в інтерфейсах. Він плутався в інтерфейсі Google Drive. Він незграбно працював із таблицями. Коли йому доручили змінити організаційну структуру в Preview чи Google Slides, він одразу ж здався. Він вирішив, що використання програми «занадто непрактичне», і натомість написав код.
Грем Нойберг, професор Університету Карнегі-Меллона та співавтор проекту AgentCompany, зазначив, що агенти працюють «дуже нелюдським чином». Вони воліють програмування типовим інтерфейсам користувача.
Наш агент підтвердив цю упередженість. Незважаючи на прямі інструкції спробувати спочатку програми, він проігнорував їх. Приблизно через 30 секунд він перейшов на код. Він зрозумів, що добрий у написанні коду, і усвідомив, що погано справляється із натисканням кнопок, призначених для людських очей.
Наступне завдання закріпило цю закономірність. Агенту потрібно було заповнити 17 форм підтвердження працевлаштування, використовуючи дані таблиці. Він завантажив їх у Google Drive.
І знову він уникав додатків. Він писав код. Рішення виявилося добрим. Він навіть додав перевірку форматів для телефонних номерів та номерів соціального страхування (SSN). Він легко впорався із завданням, яке було б стомливим для людини.
Потім він застряг. Тривіальний крок для будь-якого офісного працівника: завантаження готових PDF-файлів у потрібну папку Google Drive. Агент затнувся. Код обробив логіку, але робота з інтерфейсом дала збій.
Вердикт: ІІ потрібен людський керівник
Наш експеримент збігся з ширшими висновками в промисловості. Компанія Scale AI нещодавно протестувала агентів на реальних фріланс-проектах. Модель із найкращими результатами видавала готові для клієнта результати лише у 16% випадків.
ІІ може процвітати у конкретних, ізольованих завданнях. Він може обробляти структуровані дані. Він може писати код. Але він зазнає невдачі в нюансних, інтуїтивних і потребує роботи з інтерфейсами частинах більшості робочих процесів. Він не розуміє офісної політики. Він не знає, коли хтось просто зробив перерву, а коли звільнився.
Він може додавати цінність у певні сфери праці (робочої сили). Але поки що ІІ все ще потребує людини, яка наглядатиме за нею. У начальнику. Хтось повинен виправляти завантаження, що застрягли. Хтось повинен коригувати помилки під час найму.
Інструменти стають кращими. Але розрив між «виконати завдання» та «виконати роботу», як і раніше, широкий.






























