Облачная или локальная LLM сравниваются не по цене токена и не по стоимости GPU отдельно, а по TCO одинакового сервиса. Сначала обе конфигурации должны пройти один quality/safety gate и обеспечить одинаковые SLO, доступ к данным и функции. Затем учитываются usage, инфраструктура, люди, поддержка, отказоустойчивость, безопасность, изменения и выход из решения.
API часто выигрывает при неопределённой или редкой нагрузке и быстром старте. Self-hosted контур может быть оправдан при устойчивой загрузке, подходящей модели, жёстких ограничениях данных или наличии платформенной команды. Между ними есть managed dedicated и cloud self-hosted; гибрид часто практичнее бинарного выбора.
Короткий ответ: снимите representative traces, задайте service envelope, протестируйте quality/latency на 2–3 архитектурах, соберите dated cost ledger и посчитайте low/base/high на 12–36 месяцев. Break-even имеет смысл только для вариантов с сопоставимым качеством и резервом мощности.
Главное за минуту
- Не сравнивайте frontier API и маленькую local model без quality parity.
- Считайте input/output, cache, RAG/tool calls, retries, batch и мультимодальность.
- Для local важны p95 concurrency, idle time, VRAM/KV cache и HA, не только средний токен.
- Для cloud добавьте storage, embeddings/reranking, egress, logs, support и commitments.
- Для local добавьте power/cooling, rack/network, licenses, MLOps/on-call, spares и refresh.
- Data residency не заменяет access, encryption, logs, backup и incident response.
- Цена и модели меняются: храните дату, регион, валюту, quote и assumptions.
Содержание
- Какие варианты сравнивать
- Метод КАЛИБР
- Service envelope
- Карточка нагрузки
- TCO облака
- TCO локального контура
- Безопасность и контроль
- Quality gate
- Break-even и sensitivity
- Пилот и приёмка
- Эксплуатация
- Частые вопросы
- Как AI рассвет сравнивает архитектуры LLM
- Вывод
Какие варианты сравнивать
| Вариант | Что оплачивается/управляется | Типичный риск модели расчёта |
|---|---|---|
| Shared API | usage и сопутствующие сервисы | непредсказуемый объём/цена/лимиты |
| Managed dedicated | зарезервированная capacity | низкая utilization при commitment |
| Cloud self-hosted | GPU instances, platform, people | считать как API и забыть operations |
| On-prem | CAPEX/lease, DC, platform, people | считать только сервер |
| Hybrid/router | несколько контуров и routing | двойная сложность и неучтённые fallbacks |
Решение принимается по use-case, не для «всех LLM компании» сразу. Классификация писем, RAG, код, голос и document extraction имеют разные quality, context, latency и burst.
Метод КАЛИБР
- К — Качество: eval set, critical errors, safety и модель/версия.
- А — Активность: traces, tokens, cache, tools, batch, growth и seasonality.
- Л — Латентность/нагрузка: concurrency, p50/p95, throughput, burst и availability.
- И — Инфраструктура: API tiers или GPU/CPU/RAM/storage/network/DC/platform.
- Б — Безопасность: data classes, region, access, encryption, logs, retention и audit.
- Р — Риски/резерв: people, support, HA, incident, refresh, lock-in, exit и uncertainty.
Service envelope
Зафиксируйте task, languages, maximum context/output, tools/RAG, structured output, model-quality thresholds, critical vetoes, latency p50/p95, requests/tokens per second, concurrency, availability, RTO/RPO, regions, data classes, retention и support window.
Если local вариант не проходит quality или context, его низкая стоимость не релевантна. Если API не проходит data/residency/availability constraint, его цена тоже не решает задачу. Непрошедший вариант исключается до финансового сравнения.
Карточка нагрузки
Снимите на representative периоде: requests; input/output tokens; cached prefix/read/write; embeddings/rerank; RAG chunks; tool calls; images/audio; retries/timeouts/filtered requests; batch share; hourly/day/seasonal distribution; p95 concurrency и growth. Для нового продукта используйте ranges и явно пометьте их Estimated.
Replay одних и тех же traces на кандидатах измеряет throughput, time-to-first-token, end-to-end latency, quality и resource usage. Среднее за месяц не показывает, сколько capacity требуется для пика и failover.
TCO облака
TCO_cloud = inference + reserved/provisioned capacity + embeddings/rerank + storage + network/egress + logs/evaluation/guardrails + support + integration/platform people + security/governance + exit.
AWS Bedrock показывает, что цена зависит от provider/model/modality и режима: on-demand, batch, tiers или provisioned capacity. Azure OpenAI и Google Cloud также публикуют текущие официальные страницы. В calculator переносите дату, регион, валюту, модель, tier и единицу тарификации — не число из старой статьи.
TCO локального контура
TCO_local = amortized hardware/lease + power/cooling/rack/network + licenses/support + storage/backups + platform/MLOps/on-call + security/compliance + HA/spares + refresh/disposal + integration/governance + exit.
Capacity определяется не только весами модели. Context и concurrency растят KV cache; precision/quantization меняют VRAM, speed и quality. NVIDIA NIM documentation прямо связывает профиль с GPU/VRAM, model weights, KV cache, activations, overhead и parallelism. Для multi-node нужны также подходящие orchestration, storage и networking.
Utilization считайте по useful inference time и SLO reserve, а не по факту включённого GPU. Разделённая capacity/vGPU может улучшить экономику, но добавляет лицензии, isolation и scheduler constraints.
Безопасность и контроль
Составьте data-flow для prompts, retrieved documents, outputs, logs, backups, support access и telemetry. Для каждого варианта проверьте region/residency, training-use terms, retention/deletion, encryption/KMS, private connectivity, identity/least privilege, tenant isolation, audit, vulnerability/patch, incident response и portability.
On-prem снижает некоторые передачи данных, но переносит патчи, секреты, логи, физическую инфраструктуру и incident response на вашу команду. API снимает часть platform work, но требует проверки условий провайдера и архитектуры данных. Риск-работа NIST AI RMF Playbook нужна в обоих случаях.
Quality gate
Соберите frozen eval: representative tasks, expected facts/actions, prohibited outputs, tool/RAG cases и risk slices. Сравните task success, faithfulness/citations, structured-output validity, safety, latency и human review. Версии model/runtime/quantization/prompt фиксируются.
Оптимизация стоимости допускается только при сохранении acceptance. Кэш, меньшая модель, batching, speculative decoding или quantization могут изменить качество и latency; после каждого изменения нужен regression.
Break-even и sensitivity
Упрощённо: Q* = (Fixed_local − Fixed_cloud) / (Variable_cloud_per_unit − Variable_local_per_unit). Но единица должна быть workload unit с одинаковым service envelope, например тысяча принятых task completions, а не просто миллион tokens.
Сделайте low/base/high по объёму, output ratio, cache hit, peak/average, hardware utilization, electricity, staffing, support, price change, FX, growth и refresh horizon. Отдельно покажите downside: capacity простаивает или продукт растёт быстрее прогноза. Break-even — диапазон с assumptions, не точка-обещание.
Пилот и приёмка
- Выберите один use-case, baseline и 2–3 реалистичных варианта.
- Зафиксируйте service envelope и одинаковый eval/trace set.
- Получите dated official prices/quotes и инвентаризируйте local capacity/people.
- Проведите trace replay и нагрузочный тест с burst/HA scenario.
- Заполните full-cost ledger и low/base/high sensitivity.
- Проверьте data-flow, failure, support, rollback и exit.
- Примите architecture decision record с владельцами и датой пересмотра.
Пакет приёмки: workload traces; eval set/results; SLO report; capacity model; cost ledger/formulas; quotes and price dates; asset/license/support inventory; staffing/on-call; data-flow/security controls; HA/DR tests; sensitivity/break-even; decision record; monitoring и review trigger.
Эксплуатация
Ежемесячно отслеживайте accepted tasks, token/output ratio, cache, tool/RAG usage, p95 concurrency/latency, API spend или GPU utilization/power, failures, quality regression, support effort и unit cost. Аномалия цены без quality/outcome context может поощрить нежелательное сокращение ответа или capacity.
Пересматривайте решение при изменении объёма, SLO, data class, модели/лицензии, provider price, hardware availability, staffing или quality gap. Общая рамка бюджета внедрения — в статье о стоимости ИИ для бизнеса.
Частые вопросы
Когда локальная LLM дешевле API?
Когда comparable модель проходит quality/SLO, нагрузка достаточно устойчива, capacity хорошо утилизируется, а полная стоимость команды, HA, энергии, лицензий и refresh учтена.
Достаточно ли сравнить цену миллиона токенов?
Нет. Отличаются output ratio, cache, tools/RAG, retries, batch, context, quality и принимаемые задачи. Сравнивайте unit одного бизнес-сервиса.
Локальная модель безопаснее?
Не автоматически. Она сокращает некоторые внешние передачи, но требует собственной защиты доступа, секретов, логов, бэкапов, патчей и реагирования.
Нужно ли покупать GPU для пилота?
Обычно нет: можно арендовать сопоставимую capacity или использовать временный стенд. Покупка до trace replay фиксирует архитектуру слишком рано.
Что выбрать при редких пиках?
API или hybrid часто лучше поглощают burst; локальный контур приходится резервировать под peak или дополнять cloud overflow. Решение проверяется нагрузочным сценарием.
Как часто пересчитывать TCO?
По расписанию и при изменении модели, цены, нагрузки, SLO, команды, оборудования, лицензии или требований к данным. Храните versioned inputs и decision record.
Как AI рассвет сравнивает архитектуры LLM
AI рассвет может обследовать use-case и данные, собрать traces/eval, спроектировать API, dedicated, self-hosted и hybrid варианты, провести quality/load tests, capacity/TCO model, security review, прототип, интеграцию, monitoring, приёмку и поддержку.
Безопасный первый шаг — один use-case: фиксируем baseline, service envelope, representative traces, eval/critical vetoes, data constraints, 2–3 варианта и dated cost inputs, затем проводим trace replay без необратимой закупки. Обсудить задачу.
Вывод
Облако и локальная LLM — не идеологический выбор. КАЛИБР заставляет сравнить качество, активность, нагрузку, инфраструктуру, безопасность и риски в одном service envelope.
Начните с traces и quality gate, затем считайте полный ledger и sensitivity. API, on-prem и hybrid могут меняться местами по мере роста продукта; поэтому важны воспроизводимый расчёт, exit plan и дата пересмотра, а не вечный ответ «что дешевле».