ТЗ на ИИ-агента — это проверяемый контракт между бизнесом, пользователем, разработчиком и операциями. Оно описывает не только «роль и тон», а целевые intents, источники, tools, права, состояния, ошибки, human review, eval, логи и артефакты приёмки.
Обычное ТЗ на форму и API недостаточно: ответы модели недетерминированы, качество зависит от контекста, а tool-вызов может изменить реальную систему. Поэтому требование «точность 95%» без dataset, определения и critical failures не пригодно для приёмки.
Короткий ответ: начните с паспорта на одну страницу: owner, users, one outcome, in/out of scope, critical failure, data contour и approval. Затем добавьте intent contract, source registry, tool cards, authority matrix, state machine, frozen eval и evidence package. Приёмка идёт по зафиксированной версии model/prompt/index/tools, а не по свободной демонстрации.
Главное за минуту
- Опишите outcome и current baseline до выбора модели.
- Каждый intent имеет inputs, output, evidence, tools и stop.
- Каждый источник имеет owner, version, access и authority.
- Чтение и запись — разные tool permissions.
- Неопределённость ведёт к clarification или handoff, а не к выдумке.
- Eval включает обычные, edge, unauthorized и adversarial cases.
- Заказчик получает код, конфиги, eval, логи, runbooks и экспорт.
Содержание
- Метод АГЕНТ
- Паспорт проекта
- Intents и границы
- Источники и данные
- Tools и права
- Состояния и ошибки
- Human control
- Security
- Eval и метрики
- Логи и NFR
- Приёмка и handover
- Частые вопросы
- Как AI рассвет готовит ТЗ и ИИ-агента
- Вывод
Метод АГЕНТ
- А — Акторы и цель: кто просит, кто получает эффект, кто отвечает.
- Г — Границы: in/out of scope, prohibited actions, uncertainty и escalation.
- Е — Evidence: источники, versions, citations, data quality и provenance.
- Н — Набор инструментов: schemas, rights, confirmation, idempotency и rollback.
- Т — Тесты: representative eval, guardrails, monitoring и acceptance evidence.
Паспорт проекта
Одна страница содержит: problem/current workflow, users/affected parties, owner, primary outcome/baseline, scope, top risks, data classification, human decision, launch mode и stop authority. Паспорт утверждают до детальной спецификации.
Требования к законности, privacy и sector rules утверждают квалифицированные лица. NIST GAI Profile полезен как межотраслевой risk reference, но не заменяет конкретные нормы.
Intents и границы
| Поле intent card | Содержание |
|---|---|
| trigger/actor | как начинается и кто имеет право |
| required input | поля, контекст, identity level |
| output | schema, evidence, confidence/unknown |
| tools | read/write, preconditions, limits |
| completion | проверяемое terminal state |
| handoff | triggers, queue, context, owner |
| critical fail | ошибка, блокирующая release |
Out-of-scope пишется так же конкретно: не подписывает, не меняет права, не определяет юридический/медицинский итог, не пишет в production без approval — если эти границы нужны.
Источники и данные
Source card: system/URI, owner, authority, scope, effective/version, refresh, access, retention и conflict rule. ТЗ определяет, какой ответ нуждается в citation, что делать при stale/conflict/not found и как не показать неразрешённый fragment.
Для RAG описывают ingestion, chunk metadata, ACL, retrieval, citations, deletion и index version. Детальная архитектура — в руководстве по RAG.
Tools и права
Tool card: purpose, input/output JSON schema, identity/role, read/write, preconditions, confirmation, timeout, retry, idempotency, partial result, reconciliation, rate/cost limit, audit fields и rollback/compensation. LLM не формирует произвольный API request: gateway валидирует schema и policy.
Authority matrix сопоставляет actor × intent × tool × data × environment. Агент не наследует полные права service account «потому что так проще».
Состояния и ошибки
Action truth table разделяет proposed, awaiting_confirmation, submitted, confirmed, rejected, failed, unknown и compensated. HTTP 200 от tool не всегда означает business completion. После timeout агент сначала читает status, а не слепо повторяет write.
Специфицируются ambiguous input, missing source, tool unavailable, unauthorized, rate limit, partial success, stale state и human unavailable. Каждый failure имеет user message, internal state, retry owner и terminal outcome.
Human control
Для каждого выхода задают auto, review, approve, two-person или prohibited. Reviewer видит input, источники, proposed action, affected object, diff и uncertainty. Approval привязан к конкретным параметрам и истекает при их изменении.
Handoff содержит queue, owner/SLA, transcript, summary, evidence, actions, reason и next safe step. В ручном режиме бот не перебивает оператора.
Security
Список OWASP для agentic applications выделяет behavior hijacking, tool misuse и identity/privilege abuse. Microsoft guidance отмечает, что каждая связь agent–tool/service расширяет attack surface.
В ТЗ входят threat model, trust boundaries, prompt-injection tests, least privilege, secret isolation/rotation, egress/tool allowlist, data minimization, sandbox, confirmation, audit, rate/spend limits, incident, kill switch и recovery. Retrieved текст и tool output всегда недоверенны.
Eval и метрики
| Слой | Primary | Critical guardrail |
|---|---|---|
| intent | correct route | unsafe/missed escalation |
| RAG | supported answer | invented/stale source |
| tool selection | correct tool/schema | unauthorized tool |
| action | confirmed outcome | wrong/duplicate write |
| human | accepted useful output | hidden material uncertainty |
| operations | latency/completion | stuck state/unnoticed failure |
Frozen eval содержит representative, edge, missing, conflicting, unauthorized, injection, tool-failure и handoff cases. Пороги задаются по intent и severity. NIST AI RMF Core требует документировать test sets, metrics, tools и проверять условия, похожие на deployment.
Логи и NFR
Трасса: request/conversation/actor IDs; model/prompt/policy/index/tool versions; retrieval IDs; tool inputs/outputs с redaction; approvals; latency; tokens/cost; errors; final state. Лог не должен сам создавать утечку.
NFR: availability/degraded mode, latency distributions, capacity/rate, recovery, retention/deletion, localization/accessibility, model/provider fallback, change/regression gate, monitoring/alert ownership, cost budgets и decommission. Цифры задают после baseline, а не копируют из чужого ТЗ.
Приёмка и handover
Приёмка проходит на release candidate с frozen eval и экспортом raw results. Отдельно: functional intents, critical guardrails, security/adversarial, permissions, failure/recovery, performance/cost, handoff и rollback.
Передаются source/code, environment/config, prompt/policy, tool schemas, data/index pipeline, eval/graders/answers, dashboards/alerts, runbooks, architecture/data-flow/threat model, decision log, credentials rotation procedure, training и export/decommission. Связь ТЗ с быстрым экспериментом — в плане AI MVP.
Частые вопросы
Нужно ли указывать модель в ТЗ?
Фиксируйте release model/version для воспроизводимости, но описывайте acceptance по поведению. Тогда смену модели можно проверить regression eval.
Как задать точность?
По intent и операции: classification, retrieval, supported facts, tool/action outcome. Опишите dataset, denominator, scorer, uncertainty, threshold и critical failures.
Нужен ли в ТЗ system prompt?
Нужны требования к поведению, authority и границам. Prompt — один версионный артефакт реализации, а не всё ТЗ.
Кто утверждает ТЗ?
Business/process owner, product/analyst, domain reviewer, IT/data, security/privacy/legal по применимости и владелец acceptance. Разработчик не утверждает бизнес-риск за заказчика.
Как принять агента без реальных write-действий?
Используйте sandbox/stub, recorded fixtures и shadow. Проверьте schema, selection, approval, idempotency, status/reconciliation и rollback до production permission.
Что если API ещё нет?
Опишите ожидаемый contract и mock отдельно, а blocker оставьте Unknown. Не принимайте интеграцию по mock как готовую production-связь.
Как AI рассвет готовит ТЗ и ИИ-агента
AI рассвет может обследовать процесс, собрать паспорт и ТЗ, подготовить source/tool/authority contracts и eval, разработать RAG/агента/интеграции, настроить human review, security, observability, приёмку, запуск, обучение и поддержку.
Безопасный первый шаг — выбрать один intent, назначить owner и пользователей, зафиксировать baseline, outcome, out-of-scope, sources, один read-only tool, approval и critical failure, затем собрать representative eval. Обсудить задачу.
Вывод
Хорошее ТЗ на ИИ-агента описывает не магию модели, а воспроизводимый социотехнический процесс. АГЕНТ связывает акторов, границы, evidence, инструменты и тесты.
Принимайте каждый intent, источник, tool и failure по явному контракту. Сохраняйте human authority для материальных действий и требуйте raw evidence вместо приёмки «на глаз».