Коротко: агентный анализ видео не просматривает запись равномерно. Модель сама выбирает, какие интервалы, кадры, аудио и фрагменты расшифровки изучить глубже. Это может резко сократить расход токенов на длинных записях, но создает отдельный риск: важный эпизод останется за пределами выбранного маршрута. Поэтому до внедрения нужно сравнить agentic-режим со статическим анализом и текущим процессом на размеченном наборе компании.
Материал предназначен для руководителей операций, продукта, безопасности, обучения и медиапроизводства, а также CTO/CIO и ML-команд. В scope входят пакетный анализ записей, поиск эпизодов, проверка качества и пилот. Непрерывное видеонаблюдение в реальном времени, биометрическая идентификация, юридическая квалификация записей и выбор конкретного поставщика не входят.
Содержание
- Что изменилось 1 сентября 2026 года
- Как агентный анализ отличается от статического
- Что доказывают цифры Google
- Почему агент может пропустить важное событие
- Для каких задач подходит каждый режим
- Метод КАДР для проверки на своих видео
- Какие метрики фиксировать
- Как собрать пилот
- Данные, приватность и аудит
- Ограничения доказательств
- Частые вопросы
- Как AIrassvet помогает проверить видеоаналитику
- Вывод
Что изменилось 1 сентября 2026 года
1 сентября Google DeepMind представила agentic video understanding для Gemini 3.7 Flash, 3.6 Flash и 3.5 Flash-Lite. В отличие от фиксированной выборки кадров модель может динамически перемещаться по таймлайну, обращаться к кадрам, аудио и транскрипту и повторно изучать выбранный интервал.
Google сообщает результаты собственных тестов: до 88% меньше токенов, до 66% ниже стоимость анализа и до 7% выше качество на стандартных benchmark-задачах. Формулировка «до» принципиальна: это лучшие наблюдавшиеся изменения, а не обещание для любого видео. Компания отдельно связывает выигрыш с длинными материалами — от десятиминутных инструкций до многочасовых записей.
Режим доступен через Gemini API и Gemini Enterprise Agent Platform. Документация Gemini API уточняет, что static-режим по умолчанию извлекает кадры с частотой 1 FPS, а agentic-режим сам выбирает сегменты, частоту кадров и разрешение. Для коротких роликов менее пяти минут, где важна задержка или покадровая полнота, Google советует рассматривать static.
Как агентный анализ отличается от статического
Разница не сводится к новой модели. Меняется способ получения доказательств из записи.
| Режим | Как смотрит | Сильная сторона | Основной риск |
|---|---|---|---|
| Static | берет кадры с фиксированной частотой и обрабатывает их одним проходом | предсказуемое покрытие и простой аудит | лишние токены; быстрое событие может попасть между кадрами |
| Agentic | строит маршрут, ищет кандидатов, пересматривает выбранные интервалы | длинные записи и точечные вопросы | ложный маршрут поиска оставит эпизод непросмотренным |
| Специализированный детектор | непрерывно ищет заранее определенный класс событий | стабильная массовая задача с узкой онтологией | дорого расширять на новые вопросы; ошибки зависят от датчика и домена |
| Человек | понимает локальный контекст и последствия | редкие, неоднозначные, критичные случаи | время, стоимость, усталость и непостоянство решений |
Agentic-режим похож не на ускоренное воспроизведение, а на работу аналитика с архивом: сначала поиск, затем приближение и перепроверка. Поэтому качество зависит и от восприятия видео, и от плана поиска. Один удачный ответ не показывает, был ли просмотр достаточно полным.
Что доказывают цифры Google
Официальный запуск подтверждает, что на выбранных Google benchmark-наборах новый режим способен занять лучшую точку в компромиссе качество–стоимость. Он не публикует в статье полную таблицу по каждому набору, распределение ошибок, интервалы неопределенности или результат на ваших камерах и записях экранов.
Из цифр нельзя вывести, что система:
- найдет 88% событий или станет точнее на 88%;
- сократит весь счет за видеообработку на 66%;
- одинаково работает на совещаниях, производстве и CCTV;
- подходит для реального времени или юридически значимого контроля;
- превзойдет специализированный детектор;
- окупится в конкретной компании.
Стоимость запроса — не полный TCO. В нее могут не входить загрузка и хранение файлов, разметка эталона, повторные прогоны, интеграция, ручная проверка, журналирование и цена пропущенного события.
Почему агент может пропустить важное событие
Независимый ориентир дает предварительная работа VideoGAIA, опубликованная 12 августа 2026 года. Авторы собрали 271 задачу в шести категориях; каждую проверили минимум три эксперта. Задачи требуют не только смотреть видео, но и пользоваться инструментами, искать внешние сведения и объединять доказательства.
В едином agentic-контуре проверили 20 передовых мультимодальных моделей. Все показали менее 60% точности; лучший результат составил 58,30%. Это другой тест, не проверка нового режима Gemini 3.7 Flash и не опровержение цифр Google. Но он показывает более широкую границу: умение динамически смотреть еще не делает сложный видеоагент надежным исполнителем.
Авторы разобрали 615 неправильных ответов пяти моделей. Главной причиной была ошибка восприятия видео — 36,8–48,0% ошибок. На web retrieval приходилось 20,3–31,0%, на рассуждение по доказательствам — 14,2–28,6%, а на формулировку ответа лишь 2,4–3,3%. В расширенном анализе остальных моделей восприятие видео оставалось крупнейшей категорией — 34,9–57,3%.
Практический вывод: красивый итоговый текст плохо локализует сбой. Система могла неверно распознать исходный объект, найти не тот внешний источник, правильно найти факт, но неправильно связать его с кадром, либо сломать вызов инструмента. Нужен след просмотра, а не только ответ.
Для каких задач подходит каждый режим
| Задача | Стартовый кандидат | Почему |
|---|---|---|
| найти несколько моментов в двухчасовом вебинаре | agentic | вопрос узкий, запись длинная, полный контекст дорог |
| сделать резюме совещания с опорой на речь | agentic плюс transcript baseline | можно сравнить вклад изображения и расшифровки |
| проверить каждый кадр на краткий опасный эпизод | specialized/static | полнота покрытия важнее экономии выборки |
| посчитать быстрые повторяющиеся движения | парный тест agentic и high-FPS detector | динамическое приближение полезно, но пропуск дорог |
| обработать короткий ролик с минимальной задержкой | static | agentic-планирование может увеличить time to first token |
| вынести санкцию сотруднику или клиенту | human decision | контекст, права человека и цена ошибки требуют отдельного процесса |
Задача «найти ответ на конкретный вопрос» и задача «доказать отсутствие события» асимметричны. В первом случае достаточно обнаружить подтверждающий эпизод. Во втором нужно обосновать покрытие всей записи. Agentic-режим по умолчанию лучше соответствует поиску, чем доказательству отсутствия.
Метод КАДР для проверки на своих видео
Предлагаем метод КАДР. Это редакционный синтез документации Google, результатов VideoGAIA и практики оценки AI-систем; он не является стандартом Google или авторов benchmark.
| Шаг | Что фиксировать | Условие перехода |
|---|---|---|
| К — Контрольная задача | один тип видео, точный вопрос, цена false positive и false negative | задача ограничена и решение обратимо |
| А — Аннотация эталона | события, интервалы, допустимая погрешность таймкода, двойная разметка спорных случаев | эталон закрыт от команды настройки |
| Д — Двойной прогон | agentic, static/детектор и текущий человек-процесс на одних файлах | версии, промпты, токены, задержка и следы сохранены |
| Р — Разбор и решение | ошибки по слоям, сегменты, стоимость, abstention и пороги | роль системы выбрана по заранее заданному правилу |
К — Контрольная задача
Не начинайте с «понимать все видео». Выберите, например, поиск момента, когда оператор пропустил обязательный этап инструкции, или извлечение трех решений из записи встречи. Задайте единицу оценки: событие, видео или вопрос. Зафиксируйте, что хуже — лишняя тревога или пропуск.
А — Аннотация эталона
Соберите записи с обычными, редкими и неудобными случаями: темнота, блики, шум, несколько языков, мелкий текст, быстрые движения, монтаж, длинные паузы. Два специалиста независимо размечают критичные эпизоды; расхождения разрешаются до запуска моделей. Команда настройки не видит ответы holdout-набора.
Д — Двойной прогон
На каждом видео запустите agentic и честный baseline: static с зафиксированным FPS, текущий специализированный детектор, transcript-only либо человека — в зависимости от процесса. Сохраните идентификатор файла, хэш, версии модели и промпта, параметры, ответ, таймкоды, шаги обработки, токены, задержку и ручную оценку.
Р — Разбор и решение
Классифицируйте каждую ошибку: восприятие, навигация по видео, retrieval, reasoning, инструментальный сбой или ответ. Затем выберите роль: автономная, с подтверждением, только подсказка или отказ от внедрения. Средняя точность не должна скрывать провал на критичном сегменте.
Какие метрики фиксировать
| Метрика | Как считать | Что защищает |
|---|---|---|
| Event recall | найденные истинные события / все истинные события | от скрытых пропусков |
| Precision | верные находки / все находки | от потока ложных тревог |
| Timestamp tolerance | доля событий в допустимом окне | от «правильного» ответа с бесполезным таймкодом |
| Critical false-negative rate | пропущенные критичные события / все критичные | от усреднения редкого риска |
| Abstention rate | ответы «недостаточно данных» / все задачи | делает неопределенность видимой |
| Trace completeness | решения с воспроизводимым путем к кадру / решения | позволяет расследовать ошибку |
| Tokens and latency | распределение, а не только среднее | выявляет дорогие хвосты |
| Cost per verified result | весь измеренный расход / принятые человеком результаты | связывает экономию с полезным исходом |
Порог задают до просмотра holdout. Для поиска учебных эпизодов допустим один баланс precision/recall, для охраны труда — другой. Универсального порога источники не дают.
Как собрать пилот
- Заморозьте корпус. Возьмите один процесс и отдельные development/holdout партии. Не смешивайте видео, нарезанные из одного исходника, по обе стороны split.
- Опишите вход. Форматы, длительность, языки, звук, разрешение, камеры, сезонность и допустимые преобразования.
- Соберите baseline. Не сравнивайте новый режим с отсутствием решения, если уже есть transcript search, детектор или ручная выборка.
- Зафиксируйте контракт ответа. Событие, уверенность, таймкод, короткое объяснение и ссылка на доказательный фрагмент.
- Запустите слепой holdout. Не меняйте промпт после просмотра отдельных ошибок; новая версия получает новый прогон.
- Проведите shadow-период. Система формирует подсказки, но не меняет реальный процесс без человека.
- Примите роль. Автоматизируйте только обратимые действия и сегменты, где выполнены пороги; остальные маршрутизируйте на проверку.
Если модель, processing mode, FPS, prompt, формат видео или набор инструментов изменились, объект оценки изменился тоже. Вердикт старой сборки нельзя переносить автоматически.
Данные, приватность и аудит
Видео часто содержит лица, голоса, экраны, документы и фоновые разговоры. До загрузки определите владельца данных, цель обработки, допустимые регионы и поставщиков, сроки хранения, роли доступа и процедуру удаления. Минимизируйте фрагмент до необходимого интервала, когда это возможно.
В stateless-многоходовом режиме документация Gemini предупреждает: шаги processing_call и processing_result нужно передавать дальше для сохранения видеоконтекста; они участвуют во входных токенах. Для аудита это еще и отдельный класс артефактов, который может раскрывать содержание выбранных фрагментов.
NIST AI RMF Core рекомендует документировать контекст применения, тестовые наборы и метрики, оценивать систему в условиях, похожих на развертывание, и управлять риском на всем жизненном цикле. Это добровольная рамка, а не сертификат и не юридическое заключение для России.
Минимальный журнал решения должен содержать хэш файла, версии сборки, вопрос, выбранные интервалы, источники, ответ, уверенность/abstention, действие человека и итог процесса. Само видео храните отдельно и не дублируйте в журнал без необходимости.
Ограничения доказательств
Цифры Google получены поставщиком и описаны как результаты на стандартных benchmark-наборах. Публичная статья не дает полного протокола, всех исходных результатов и независимого воспроизведения именно Gemini 3.7 Flash agentic mode.
VideoGAIA — arXiv v1 и не подтвержденная здесь рецензированная публикация. Его 271 задача построена из публичных видео через многоступенчатый human–model pipeline; это не записи российских компаний. Benchmark измеряет работу общего агента с внешними инструментами, тогда как Google сравнивает способы обработки видео на других задачах. Эти результаты нельзя складывать или объявлять прямым противоречием.
Не наблюдались независимые production-данные по точности нового режима, безопасности, стоимости полного контура, влиянию на решения и ROI. Search volume, difficulty, rankings, traffic, CTR страницы, backlinks и AI citations также остаются Unknown.
Частые вопросы
Что такое агентный анализ видео?
Это режим, в котором модель сама выбирает, какие части таймлайна, кадры, аудио и расшифровку запросить для ответа, вместо равномерной обработки всей записи.
Он всегда дешевле статического анализа?
Нет. Google сообщает выигрыш до 66% на своих тестах, особенно для длинных видео. На коротких клипах внутреннее планирование может увеличить задержку, а полный TCO зависит от хранения, повторов и проверки.
Можно ли использовать его для камер безопасности?
Для поиска по архиву — после проверки на своем корпусе. Для непрерывного обнаружения критических событий лучше начинать со специализированного или статического контура и отдельно доказывать полноту agentic-режима.
Какой baseline выбрать?
Текущий рабочий процесс плюс ближайшую техническую альтернативу: static с фиксированным FPS, transcript-only или специализированный детектор. Сравнение должно идти на одних и тех же видео.
Почему нужен след просмотра?
Без выбранных интервалов и источников нельзя понять, модель не увидела событие, увидела и неверно интерпретировала его или потеряла факт позже в рассуждении.
Когда можно убрать человека?
Только для обратимых действий, после выполнения заранее заданных порогов на закрытом holdout и shadow-периоде. Критичные исключения остаются на подтверждении.
Как AIrassvet помогает проверить видеоаналитику
AIrassvet может собрать проверяемый контур вокруг одного видео-процесса:
- провести аудит процесса и зафиксировать baseline, типы видео, риски и критерий приемки;
- подготовить данные и прототип компьютерного зрения или мультимодальной интеграции;
- настроить парный тест режимов, журнал версий, таймкоды, abstention и ручную проверку;
- интегрировать принятый сценарий, провести тестирование, запуск и обучение команды.
Первый безопасный шаг — выбрать один процесс, его baseline, источники данных, ограничения и критерий приемки. Обсудить задачу.
Вывод
Агентный анализ делает просмотр длинного видео целевым: система ищет, приближает и перепроверяет только нужные фрагменты. Это может снизить расход токенов и стоимость, но одновременно переносит часть риска в маршрут поиска.
Рабочий порядок: контрольная задача → независимая аннотация → парный прогон agentic и baseline → разбор ошибок → shadow mode → ограниченная роль. Экономию оценивайте на один подтвержденный результат, а надежность — по пропускам критичных событий и воспроизводимому следу.