Обучение ИИ-агента по действиям сотрудника

обучение ИИ-агента по действиям сотрудника
обучение ИИ-агента на примерах
task mining для ИИ-агентов
автоматизация по записи экрана
модель рабочего процесса

Коротко: обучить ИИ-агента по действиям сотрудника можно, но запись экрана и кликов нельзя сразу превращать в инструкцию. Сначала нужно отделить параллельные задачи, восстановить цель каждого фрагмента, описать порядок, циклы и условия остановки, удалить чувствительные данные и проверить навык на новых случаях. Свежий эксперимент показывает преимущество такой модели задачи над обычным пересказом, но итоговая точность на отложенных заданиях составила только 18,57%.

Материал предназначен для COO, CTO, руководителей автоматизации, владельцев процессов и команд безопасности. Он рассматривает обучение компьютерного агента на рабочих следах; не оценивает производительность сотрудников, не даёт юридического заключения о мониторинге и не обещает экономический эффект в конкретной компании.

Содержание

Что произошло 20 августа 2026 года

20 августа на arXiv появился препринт Inducing Task Models from Computer-Use Traces. Авторы предложили Task Model Induction, или TMI: метод, который получает естественный след работы — скриншоты, клавиатурные и мышиные события — и строит не плоский список шагов, а отдельную модель каждой обнаруженной задачи.

В такой модели соединены две стороны работы. Модель целей описывает, ради чего выполнялись фрагменты и как большая цель делилась на подцели. Модель процедуры фиксирует порядок действий, ветвления, циклы и условия повторения. Авторы сначала строят эти представления отдельно, а затем согласуют их, чтобы назначение шага не противоречило фактическому порядку выполнения.

Новость важна для бизнеса, потому что task mining уже перестаёт быть только инструментом аналитика. ServiceNow прямо связывает записи ручных действий с blueprint для AI-агентов, а IBM документирует сбор кликов, нажатий клавиш и вводимых данных в выбранных приложениях. Новый вопрос звучит так: какое промежуточное представление нужно, чтобы запись стала переносимым и проверяемым навыком, а не слепой копией одного удачного сеанса?

Что значит обучить ИИ-агента по действиям сотрудника

Обучение ИИ-агента по действиям сотрудника — это извлечение из наблюдаемого рабочего следа такой модели цели и процедуры, которую агент может применить к новому экземпляру той же задачи. Это не обязательно обучение весов модели. Результатом может быть навык, workflow, policy или формальная схема действий, которую агент читает во время выполнения.

Запись показывает, что произошло один раз. Навык должен дополнительно отвечать на вопросы:

  1. Какая бизнес-цель достигалась?
  2. Какие действия относятся к этой задаче, а какие — к соседней?
  3. Что обязательно, а что было случайным обходным путём?
  4. Где последовательность, цикл, условие и точка остановки?
  5. Какие данные и полномочия допустимы?
  6. Как проверить результат независимо от поведения на экране?

Например, сотрудник может одновременно сверять счёт, отвечать в мессенджере и искать реквизиты в CRM. Хронологический пересказ смешает три потока. Агенту же нужна отдельная модель проверки счёта: вход, критерии совпадения, исключения, разрешённые источники и проверяемый выход.

Чем отличаются task mining и модель задачи

Подход Основной вход Что получается Главный риск
Process mining события ERP, CRM и других систем с case ID карта end-to-end процесса и вариантов не видит ручные шаги между системами
Task mining клики, клавиши, приложения, поля, скриншоты детальная картина работы на рабочем столе собирает чувствительные данные и локальный шум
Replay демонстрации один успешный след последовательность для похожего интерфейса копирует случайные шаги и ломается на исключении
Task Model Induction размеченные активности из естественного смешанного следа задачи, иерархия целей и управляющая процедура модель может неверно разделить цели или границы
Исполняемый навык агента проверенная модель задачи плюс policy инструкция для новых случаев перенос не гарантирует правильного бизнес-результата

Microsoft Power Automate напоминает, что классический process mining опирается на event log с идентификатором экземпляра процесса. В естественной записи рабочего стола такой идентификатор часто отсутствует: человек переключается между окнами и задачами, а одинаковые инструменты используются для разных целей. Именно этот разрыв пытается закрыть TMI.

Что показал эксперимент TMI

Исследование использует несколько наборов данных и разные уровни оценки. Человеческая часть HumanWork включает 38 записанных сессий, 15 задач в пяти профессиональных областях, 42,8 часа записи и 48,7 тыс. сырых событий. В среднем одна сессия длилась 68 минут и содержала около 1,3 тыс. событий.

Для проверки смешанных задач авторы синтетически объединяли фрагменты уже записанных сессий. Количество задач менялось от 2 до 15, а число чередующихся сегментов — от 2 до 4. Здесь TMI достиг среднего Adjusted Rand Index 0,974 ± 0,028 при сравнении найденных групп с известной разметкой и средней ошибки числа задач 0,48 ± 0,54.

Проверка TMI Сильнейшая указанная база Что измерялось
Группировка смешанных задач ARI 0,974 не главный baseline статьи согласие с известным разбиением синтетически смешанных фрагментов
Точность описания шагов, судья gpt-5.5 74,9% 30,3% соответствие узлов наблюдаемому выполнению
Корректность операторов, судья gpt-5.5 88,5% 52,7% для direct generation правильность sequence/loop/condition структуры
Исполнимость созданного навыка 67,65% 59,35% workflow summary рубрика SkillLearnBench
Точность на отложенных задачах 18,57% 14,29% workflow summary успех агента на новых задачах того же семейства

Для проверки качества модели целей и процедур использовались два независимых LLM-судьи — gpt-5.5 и claude-sonnet-5. Порядок основных результатов сохранялся, но абсолютные оценки различались. Например, точность описания шагов TMI составила 74,9% по gpt-5.5 и 87,8% по claude-sonnet-5. Это причина хранить рубрику и примеры решений, а не одну итоговую цифру.

Отдельно авторы проверили перенос в навыки на SkillLearnBench. Из одной успешной демонстрации для каждого семейства задач строилась модель, затем один и тот же генератор создавал навык, а gpt-5-mini выполнял отложенные задания. Такой дизайн помогает сравнить источники обучения, но не доказывает универсальность результата для других моделей, интерфейсов или бизнес-процессов.

Почему 30% не означает готовность к production

В аннотации сообщается об улучшении точности на 30,0% относительно сильнейшего baseline. Арифметически это переход с 14,29% до 18,57%: прирост 4,28 процентного пункта, или примерно 30% относительно исходных 14,29%. Оба представления верны, но для решения о внедрении важнее абсолютный уровень.

Точность 18,57% означает, что в данной оценке большая часть отложенных задач не была выполнена успешно. Исследование показывает ценность промежуточной модели по сравнению с обычным пересказом, а не готовый способ автономно заменить сотрудника.

Есть и неожиданный контроль. Навыки, написанные экспертами для бенчмарка, имели покрытие 93,59%, но достигли только 10,00% точности на отложенных задачах. Авторы прямо отмечают: оценка полноты навыка и фактический успех агента не движутся вместе. Красивый регламент нельзя считать доказательством исполнения.

Поэтому production-gate должен стоять после исполнения на новых случаях и независимой проверки результата. Ни качество текста навыка, ни совпадение с демонстрацией, ни относительный прирост сами по себе не дают разрешения на действие.

Где метод ошибается

В анализе 1 107 предсказанных меток задач авторы отнесли 87,1% к корректным или нерелевантным для ошибки. Остальные случаи раскрывают практические ловушки.

Ошибка Доля меток Что это значит для компании
Подцель повышена до отдельной задачи 6,8% агент может раздробить один процесс на ложные независимые навыки
Артефакты программы записи 2,5% запуск, скриншот или остановка рекордера принимаются за рабочую задачу
Общая рабочая область разных задач 2,4% одинаковые окна, файлы или инструменты затрудняют разделение целей
Другие случаи 1,2% остаётся хвост неоднородных ошибок

Часть «лишних» задач возникала из реальной личной или посторонней активности внутри рабочего сеанса. Авторы считают некоторые случаи принципиально неразрешимыми по одному следу: в нём нет контекста, который связывает действия с назначенной задачей.

Нелинейная работа тоже влияет на качество. Исправление ошибок встречалось в 89% человеческих сессий, исследовательский поиск — в 87%, повторения — в 84%, переключение задач — в 61%. Такие фрагменты нельзя автоматически объявлять обязательной процедурой. Иногда это полезное исключение, иногда неудачная попытка, а иногда шум.

Метод СЦЕПКА для безопасного переноса процесса

Предлагаем метод СЦЕПКА — редакционный синтез результатов TMI, практики task mining и требований к проверяемой автоматизации. Это не отраслевой стандарт.

С — Сигналы

Определите минимальный набор наблюдений: приложение, тип действия, объект, время и подтверждённый результат. Не включайте всё «на всякий случай». Для каждого поля задайте владельца, срок хранения и правило удаления.

Ц — Цель

Свяжите фрагмент не с окном программы, а с бизнес-результатом: «сверить реквизиты счёта», а не «открыть Excel». Цель должна иметь вход, критерий готовности и запрещённые исходы. Если цель нельзя сформулировать независимо от конкретного интерфейса, навык получится хрупким.

Е — Эпизоды

Разделите чередующиеся задачи и сохраните связь каждого действия с эпизодом. Для спорных границ оставляйте статус Unknown и отправляйте фрагмент владельцу процесса. Не заставляйте модель выбирать одну задачу там, где доказательств недостаточно.

П — Процедура

Опишите последовательности, ветвления, циклы, условия выхода и обработку ошибок. Отдельно маркируйте наблюдавшийся путь, обязательное правило и гипотезу. Один обходной манёвр сотрудника не должен становиться политикой агента.

К — Контроли

Удалите или замаскируйте персональные данные, секреты, содержимое личных окон и лишние поля до построения производных артефактов. Ограничьте приложения allow-list, роли доступа и действия агента. Microsoft рекомендует уметь приостанавливать запись, удалять чувствительные шаги и screenshots, а также разделять доступ ролями. Авторы TMI отдельно предупреждают, что персональные данные из скриншотов и клавиатурных событий могут перейти в создаваемые навыки; влияние редактирования на качество они не измеряли.

А — Апробация

Проверьте навык на отложенных случаях, которых не было в демонстрации. Сравните не траекторию кликов, а бизнес-результат, нарушения policy, число вмешательств и успешность отката. Необратимое действие остаётся за человеком, пока критерии приёмки не выполнены.

Минимальный контракт можно представить так:

process_case → goal → allowed_data → procedure_version
             → policy_checks → business_result → verifier
             → human_interventions → rollback_reference

СЦЕПКА дополняет аудит процесса перед внедрением ИИ, техническое задание на ИИ-агента и управление автономностью по типам действий: сначала определяется реальная работа, затем исполняемый контракт и допустимый уровень полномочий.

Как провести пилот на одном процессе

Выберите частый, ограниченный и обратимый процесс. Хороший кандидат имеет понятный вход, проверяемый выход, несколько устойчивых вариантов и тестовую среду. Плохой кандидат зависит от негласных переговоров, содержит много персональных данных или сразу меняет деньги, права и договорные обязательства.

  1. Зафиксируйте baseline. Измерьте текущий результат, ошибки, исключения, время и долю ручных возвратов на одном определённом окне.
  2. Согласуйте запись. Определите допустимые приложения, поля, участников, срок хранения, паузу и удаление чувствительных фрагментов вместе с безопасностью, HR и юристом по применимому праву.
  3. Соберите несколько успешных и неуспешных эпизодов. Один идеальный пример скрывает вариативность и обходные пути.
  4. Постройте модель целей и процедуры. Отделите соседние задачи, циклы, условия, проверки и ошибки; спорные места отдайте владельцу процесса.
  5. Создайте минимальный навык. Разрешите только необходимые данные, приложения и действия. Внешние эффекты замените sandbox или dry run.
  6. Проверьте отложенную выборку. Включите новые входы, редкие исключения, изменённый порядок окон и недоступный источник.
  7. Верифицируйте бизнес-результат. Используйте независимый запрос к системе учёта, rule-based проверку или человека, а не самоотчёт агента.
  8. Решите по заранее заданному gate. Расширяйте только после прохождения порогов качества, безопасности и управляемости; иначе ремонтируйте модель задачи или прекращайте пилот.

Руководство ICO по мониторингу работников относится к Великобритании, а не к российскому праву, но полезно как проектный сигнал: screenshots и перехват клавиатуры являются интенсивным мониторингом, который требует обоснования и оценки воздействия. Для вашего рынка и организации правила должен определить профильный юрист.

Какие метрики использовать

Метрика Формула Что она не доказывает
Task separation agreement согласованные человеком назначения / проверенные активности правильность цели каждого эпизода
Procedure fidelity корректно описанные шаги / проверенные шаги успешность на новом случае
Held-out task success принятые результаты / все отложенные случаи безопасность необратимых действий
Policy violation rate нарушения / все попытки действия полноту набора policy
Human intervention rate случаи с вмешательством / все запуски качество результата без классификации причин
Business acceptance rate принятые владельцем результаты / проверенные результаты финансовый эффект
Rollback success подтверждённые откаты / попытки отката отсутствие скрытых побочных эффектов
Redaction coverage очищенные чувствительные поля / найденные поля отсутствие неизвестных персональных данных

У каждой метрики заранее задайте numerator, denominator, окно, источник и владельца. Не переносите ARI 0,974, step accuracy 74,9% или held-out accuracy 18,57% из исследования на свой процесс. Search volume, keyword difficulty, rankings, traffic, CTR, AI citations, стоимость пилота и экономический эффект остаются Unknown без прямых данных.

Когда запись действий не подходит

Не используйте запись рабочего стола как основной источник обучения, если:

  • результат нельзя проверить независимо от поведения пользователя;
  • большая часть решения живёт в разговорах, опыте или нецифровой среде;
  • сбор минимально необходимого следа всё равно раскрывает несоразмерный объём чувствительных данных;
  • процесс выполняется редко и каждый случай уникален;
  • интерфейс быстро меняется, а устойчивого API или system-of-record нет;
  • демонстрация содержит исключительные полномочия, которые нельзя передать агенту;
  • ошибка необратима, а sandbox, approval и rollback отсутствуют.

В таких ситуациях лучше начать с интервью, регламента, событий систем учёта или ассистирующего режима. Компьютерный агент может готовить предложение, но не завершать действие.

Частые вопросы

Можно ли обучить ИИ-агента одной записью экрана

Одной записи достаточно для прототипа гипотезы, но не для production. Она не показывает допустимую вариативность, исключения и границу между обязательным шагом и случайным обходным путём. Нужны разные эпизоды и отложенная проверка.

Нужно ли дообучать саму модель

Не обязательно. В TMI результат превращается в внешний навык для агента; веса базовой модели не обязаны меняться. Для бизнеса часто безопаснее версионировать инструкцию, policy и тесты отдельно от модели.

Чем task mining отличается от process mining

Task mining наблюдает детальные действия на рабочем столе: клики, клавиши, поля, приложения и screenshots. Process mining анализирует end-to-end события информационных систем, обычно связанные case ID. Вместе они дают локальную и сквозную картину процесса.

Что делать с персональными данными в записи

Собирать только необходимое, использовать allow-list, давать возможность паузы, удалять или маскировать чувствительные фрагменты до индукции, ограничивать доступ и срок хранения. Конкретное правовое основание и уведомление определяются применимым правом и внутренними политиками.

Как понять, что навык переносится на новые случаи

Запустить его на заранее отложенной выборке с новыми входами и исключениями, затем независимо проверить бизнес-результат. Совпадение кликов с демонстрацией не является достаточным критерием.

Может ли такой агент заменить сотрудника

Исследование этого не доказывает. Оно показывает, что структурированная модель задачи может быть полезнее raw trace или workflow summary. Решение об автономности зависит от абсолютной точности, риска действия, возможности проверки, approval и rollback в конкретном процессе.

Как AI рассвет помогает превратить рабочий след в управляемого агента

AI рассвет может связать наблюдаемую работу с контролируемой автоматизацией:

  1. Провести аудит одного процесса, его baseline, источников данных, ограничений и критерия приёмки.
  2. Описать задачи, цели, варианты, ошибки и допустимые действия агента в бизнес-системах и интерфейсах.
  3. Спроектировать agentic RPA или интеллектуального агента с журналом, policy checks, human approval и независимой проверкой результата.
  4. Реализовать и протестировать MVP в ограниченной среде, затем подготовить интеграцию, запуск, обучение команды и поддержку.

Безопасный первый шаг — выбрать один процесс, его текущий baseline, источники данных, ограничения и критерий приёмки. После этого можно определить, какой минимальный рабочий след действительно нужен и стоит ли превращать его в навык.

Обсудить задачу

Вывод

Запись действий сотрудника — полезное доказательство того, как работа выполнялась, но ещё не программа для ИИ-агента. Между наблюдением и исполнением нужен слой модели задачи: разделение эпизодов, иерархия целей, процедура, ограничения данных и проверка результата.

Свежая работа TMI показывает, что такое представление превосходит обычный пересказ в контролируемой оценке. Одновременно абсолютная held-out accuracy 18,57%, зависимость от LLM-судей, синтетическое смешивание задач и неоценённое влияние privacy-redaction не позволяют объявлять метод готовым к автономному production.

Практический порядок: минимизировать сигналы, определить цель, разделить эпизоды, формализовать процедуру, поставить контроли и провести апробацию. Агент получает больше полномочий только после независимой проверки на новых случаях.

← Все статьи

Комментарии (0)

Пока нет комментариев. Будьте первым!

Оставить комментарий
Регистрация не требуется