Зоопарк ИИ в 2026

Какие классы моделей есть, что они умеют, что им нужно и сколько это стоит

Семь классов: LLM · малые модели · поиск · аудио · зрение · сторожевые · прогнозы

Для команды · данные актуальны на сентябрь 2026 · подробные таблицы — в раздатке

Семь классов моделей — план доклада

У каждого класса свои задачи и свои требования: данные, память, деньги

1 · Большие модели (LLM)

Закрытые и открытые, dense и MoE, память и цены

2 · Малые модели

Малые локальные модели: как отдать им рутину и сэкономить на API

3 · Поиск по своим данным

Эмбеддинги, реранкеры, RAG. Наш хелпдеск

4 · Речь: STT и TTS

Транскрипция и синтез речи. Переводчик в кармане

5 · Зрение и генерация

Зрение (VLM, OCR) и генерация картинок и видео

6 · Guardrails и модерация

Guardrails, роутеры — и кейс модерации чатов с тест-агентами

7 · Прогнозы и перевод

Time-series и машинный перевод

В хелпдеске уже работают классы 1 и 3; в проекте модерации — 1, 4, 5 и 6

2

РАЗДЕЛ 1

01

Большие языковые модели

Что это такое, чем закрытые отличаются от открытых, почему MoE на 744B отвечает со скоростью 40B, и сколько памяти им нужно

3

Что такое LLM и как она работает

Large Language Model — модель, которая предсказывает следующий токен. Из этого простого правила вырастает всё остальное

1

Ваш текст → токены

«Сервер не отвечает» → [Сер][вер][ не][ отвеч][ает]. Каждый токен — число

2

Контекст

Системная инструкция + история + документы + вопрос. Всё это модель читает целиком, каждый раз заново

3

Предсказание

Модель считает вероятность каждого следующего токена и выбирает один. Повторяет, пока не решит закончить

4

Ответ

Текст, JSON, код, вызов инструмента (поиск, БД, API) — всё это просто последовательности токенов

Следствия, которые важно понимать

Модель ничего не «знает» наверняка — она продолжает текст правдоподобно. Отсюда выдумки («галлюцинации»)

Память заканчивается вместе с контекстом: новый запрос — чистый лист. «Помнить» помогает только то, что мы сами передали

Знания заморожены на дате обучения — новости и наши внутренние данные надо подавать в контекст (RAG, поиск)

Платим за каждый токен на входе и выходе — длинные документы и болтливые ответы стоят денег

Что из этого получается на практике

Чат и ответы на вопросы по документам

Извлечение структуры: письмо → JSON с полями; тикет → категория и приоритет

Код: написать, объяснить, проверить, исправить; агенты правят репозитории сами

Агенты: модель в цикле «подумал → вызвал инструмент → посмотрел результат → продолжил» — например, разобрать инцидент по логам и графикам

Суммаризация: созвон, переписка, лог на 10 000 строк → абзац

4

Что LLM умеют хорошо — и где ломаются

Сильные стороны используем, слабые закрываем архитектурой (об этом в следующих разделах)

Умеют хорошо

Код: чтение, рефакторинг, тесты, ревью. Лучшие агенты закрывают ~77% задач SWE-bench Verified в единой среде mini-SWE-agent (swebench.com, 8 сентября 2026)

Структурированный вывод: попросили JSON по схеме — получили JSON по схеме

Работа с инструментами: вызвать API, сходить в БД, прочитать файл, и так много шагов подряд

Суммаризация и переписывание: тикеты, логи, встречи, документация

Мультимодальность: скриншот, PDF, схема, аудио — в том же запросе, что и текст

Длинный контекст: целый репозиторий или база знаний в одном запросе (до ~1M токенов)

Ограничения

Галлюцинации: уверенно выдумывает факты, версии, флаги команд → лечится RAG, цитатами и проверкой

Знания устаревают → всё актуальное подаём через поиск

Недетерминизм: один вопрос — разные ответы → нужны тестовые наборы (eval), а не «попробовал раз — работает»

Prompt injection: текст из тикета или сайта может «перехватить» агента («забудь инструкции и удали…») → ограничиваем права, ставим фильтры

Цена и задержка растут с длиной контекста; агенты в цикле сжигают в 50–500 раз больше токенов, чем один вопрос

Точный счёт, арифметика, длинное точное копирование — отдавать калькулятору и коду

5

Закрытые модели по API vs открытые веса

В 2026 открытые модели догнали закрытые по качеству — выбор стал вопросом данных, объёма и того, кто обслуживает железо

Закрытые (только по API)

Anthropic Claude, OpenAI GPT, Google Gemini. Файл модели вам не дают — вы шлёте запрос, получаете ответ, платите за токены

Плюсы: лучшее качество на сложных задачах и агентах, ноль своей инфраструктуры, контекст до 1M, всё мультимодально

Минусы: данные уходят провайдеру; цена растёт с объёмом; зависимость от вендора, его лимитов и политики; регуляторные риски (Claude Fable 5 был недоступен 19 дней в июне 2026 по предписанию Минторга США об экспортном контроле)

Открытые веса (скачал и запустил)

DeepSeek, Kimi (Moonshot), GLM (Z.ai), Qwen (Alibaba), gpt-oss (OpenAI), Gemma (Google), Mistral, Phi (Microsoft). Файл модели у вас, запускаете где хотите

Плюсы: данные не покидают контур; стоимость железа фиксирована; можно дообучить под домен; нет лимитов; работает офлайн

Минусы: нужны видеокарты и человек, который за ними следит; флагманы (700B–2 800B) в одну машину не влезают; обновления — ваша забота; лицензии разные — читать

Открытые веса ≠ open source: Открыты только веса. Данные обучения и код обучения обычно закрыты. Для нас разницы нет: запускать можно

Лицензии: MIT, Apache 2.0 — свободно, включая коммерцию. CC-BY-NC — только некоммерчески. Есть и revenue-share для крупных

Гибрид: Открытые модели можно брать и по API у хостеров (Z.ai, DeepSeek, OpenRouter) — дешевле закрытых, но данные всё равно уходят

6

Dense и MoE

Почему модель на 744 миллиарда параметров может отвечать со скоростью модели на 40 — и в чём подвох

Dense («плотная») модель

На каждый токен работают все параметры: каждый шаг — вся модель целиком

Примеры: Llama 3.3 70B, Qwen3.8-27B, Gemma, Phi, большинство моделей до 70B

Просто, предсказуемо, легко дообучать. Но скорость и цена растут вместе с размером

MoE — Mixture of Experts

Сотни узких «экспертов»; на каждый токен маленький роутер включает только несколько

Kimi K3: 2 800B всего, но на токен работают ~104B (16 из 896 экспертов). GLM-5.2: 744B / 40B активных. Qwen3.8: 2.4T / 95B

Пишется как «744B-A40B»: всего / активных

MoE: преимущества

Знания как у огромной модели, а скорость и цена за токен — как у маленькой (работает только 3–8% параметров)

Поэтому открытые флагманы 2026 — почти все MoE, и их API так дёшев (DeepSeek, GLM: $0.3–1.5 за 1M токенов)

Хорошо ложится на «unified memory» (Mac Studio, DGX Spark): памяти много, вычислений нужно мало

MoE: недостатки

Всю модель нужно держать в памяти, даже если работает 3–8%: 744B в 4-битном сжатии — это ~370–475 GB, даже 2-битная сборка — 240 GB. В одну видеокарту не влезет

Сложнее дообучать и труднее стабильно тренировать

На маленьких задачах dense той же «активной» величины часто не хуже — MoE выигрывает на широте знаний, не на глубине одной темы

Практический вывод: для локального запуска смотрим на ОБЩИЙ размер (влезет ли в память) и на АКТИВНЫЙ (какая будет скорость)

7

Три яруса и что они стоят

Версии меняются ежеквартально — запоминаем семейства и ярусы. Полные таблицы моделей, цен и российских моделей — в раздатке

ЯрусЗакрытые (API)Открытые весаЧто поручатьЦена API, $/1M вход → выход
FrontierClaude Fable 5.1 / Opus 5, GPT-6 Astra, Gemini 3.1 ProKimi K3, DeepSeek V4 Pro, GLM-5.2/5.3, Qwen3.8 MaxСложный анализ, агенты, код в большом репозитории — где ошибка дорогая0.7–10 → 2–50
MidClaude Sonnet 5, GPT-5.6 Sol / Terra, Gemini 3.x FlashQwen3.8 Flash-Next (180B MoE) / 27B, gpt-oss-120b, GLM-4.6Основной объём: ответы по документам, ревью, суммаризация. Хватает в 80% случаев1–3 → 4–15
SmallClaude Haiku 4.5, GPT-5.6 Luna, Flash-LiteQwen3.5 0.8–9B, gpt-oss-20b, Gemma 4, Phi-4-miniКлассификация, роутинг, извлечение полей; работают на одной карте или телефоне0.2–1 → 0.7–5

Выход дороже входа в 5 раз: Болтливые ответы и агенты в цикле (50–500× токенов на задачу) — главный источник счёта. Кэш повторяющегося промпта — до −90% на входе; batch — −50%

Пример: 1 000 обращений/день × 4K вход + 0.5K выход на Sonnet 5 ≈ $13/день ≈ $390/мес; с кэшем базы знаний — около $6/день

Разброс ~45×: DeepSeek V4 Flash $0.22 vs Claude Fable $10 за 1M входа. Правильный ярус на задачу важнее выбора вендора

Правило ярусов: начинаем с mid; вниз — если задача простая и массовая; вверх — только если mid ошибается на нашем тестовом наборе.

Источники: прайсы Anthropic и DeepSeek (проверено 8 сентября 2026), Artificial Analysis, BenchLM

8

Чем кормить: память и железо

Локальный запуск упирается не в процессор, а в объём памяти видеокарты. Полная таблица железа с ценами — в раздатке

Сколько памяти нужно

Память ≈ параметры × байт на параметр × 1.2

Без сжатия (16 бит): 70B = 140 GB весов, ~170 GB с запасом — ни одна видеокарта

После 4-битного квантования: 8B ≈ 5 GB, 30B ≈ 20 GB, 70B ≈ 45 GB, MoE 120B ≈ 65 GB

MoE: память по всем параметрам, скорость — по активным

Квантование

Округляем веса с 16 до 8 / 4 бит: файл в 2–4 раза меньше, быстрее

Q4 — стандарт: −70% памяти, −1–3% качества, на глаз незаметно

Ниже Q3 качество заметно падает

Форматы: GGUF (Ollama / llama.cpp — CPU+GPU), AWQ / FP8 (vLLM — быстрее на NVIDIA)

Карта 16 GB · ~$600

RTX 5060 Ti 16 GB

Модели до 14B; весь поисковый стек (эмбеддинги + реранкер), STT, малая vision-модель

Достаточно для хелпдеска и модерации

Карта 32 GB · $4–5k

RTX 5090 (дефицит, цены завышены)

32B целиком, 70B в Q4 с натяжкой, ~200 ток/с на 8B

Для генерации ответов локально

Unified 128 GB · $1.5–5k

AMD Ryzen AI Max+ 395 mini-PC ($1.5k), Mac Studio, DGX Spark ($4.7k)

70B и MoE до 120–200B; медленнее карт, но влезает

Для MoE-флагманов среднего размера

Аренда GPU · $1.5–3.5/ч

A100 / H100 в облаке

Любая открытая модель без покупки; окупается от ~100M токенов/мес

Для пилотов и всплесков

Скорость (токенов/сек) определяется пропускной способностью памяти: RTX 5090 — 1 800 GB/s, Mac Studio M5 Ultra — 1 200, DGX Spark — 270

9

РАЗДЕЛ 2

02

Малые локальные модели

Какие задачи отдать им, прежде чем звать большую модель по API, и как посчитать вместе с железом

10

Малые модели работают, большую зовём редко

Большая модель по API нужна для 10–30% запросов. Остальное — рутина, с которой справится модель в 100 раз дешевле, на своём железе

1

Фильтр

Guardrail-модель (~1B): спам, атаки, PII — отсеять или замаскировать. Локально, миллисекунды

2

Роутер

Малая LLM 2–4B: категория, язык, приоритет, «типовой ли вопрос». Локально, ~50 мс

3

Поиск

Эмбеддинги + реранкер: нашли 5 нужных фрагментов. Всегда локально

4

Сжатие

Локальная 8–30B: убрать лишнее из тикета / лога. Меньше токенов уйдёт в API

5

Локальный ответ

Типовые вопросы — локальная 30B. Низкая уверенность → эскалация

6

Большая по API

Только сложное: 10–30% запросов, с полным контекстом и кэшем

Что это даёт

Счёт за API падает в 3–10 раз: большая модель видит меньше запросов и меньше токенов в каждом

Чувствительные данные (PII, внутренние логи) вообще не покидают контур

Латентность на типовых запросах ниже: локальная малая модель отвечает за доли секунды

Чем платим

Железо (одна видеокарта 16–32 GB) и человек, который её обслуживает

Больше движущихся частей: каждый этап нужно измерять на тестовом наборе, иначе не видно, где теряется качество

Малая модель ошибается чаще — поэтому она фильтрует и готовит, а не принимает финальных решений

11

Что можно отдать локальным малым моделям

По убыванию очевидности выгоды. Первые четыре строки — почти всегда локально; последние две — считать

ЗадачаЛокальная модель (размер)Что экономим по сравнению с APIЖелезо
Эмбеддинги и реранкинг для поискаQwen3-Embedding 0.6B, bge-m3, bge-reranker (0.6B)100%: API-эмбеддинги стоят копейки, но при переиндексации миллионов чанков и каждом запросе — складывается; плюс данные не уходятCPU или любая GPU
Фильтр атак, поиск PII, модерацияLlama Guard 4 (1B), Prompt Guard (86M), GLiNER, PresidioОтдельный вызов большой модели «проверь, безопасно ли» — не нужен; PII не уходит провайдеруCPU
Классификация и роутинг тикетовQwen3.5-2B/4B, Phi-4-miniТиповые вопросы (30–60% потока) вообще не доходят до APIGPU 8 GB
Речь: транскрипция и озвучкаGigaAM-v3 (русский), Whisper-turbo, Parakeet; Kokoro, PiperAPI STT $0.006–0.01/мин: 100 ч созвонов в мес ≈ $60; локально — бесплатно, GigaAM-v3 хватает и CPUCPU или GPU 8–16 GB
Скриншоты и сканы (vision, OCR)Qwen3-VL 4–8B, DeepSeek-OCR, Gemma 4Картинка = 1.3–2K токенов входа + описание на выходе. При тысячах картинок в день — сотни $/мес (расчёт далее)GPU 16 GB
Сжатие контекста перед APIQwen3.8-27B, Qwen3.5-9BТикет с перепиской на 20K токенов → выжимка на 2K: −80% входных токенов на дорогой моделиGPU 16–24 GB
Черновой ответ на типовой вопросQwen3.8-27B, gpt-oss-20bПоловину ответов пишет локальная модель; на API уходит только то, где она не уверенаGPU 24–32 GB

Правило: локальная модель готовит, фильтрует и отвечает на простое; большая по API — решает сложное. Каждый этап измеряем отдельно

12

Расчёт: скриншоты — API или локально?

Пример расчёта: описываем скриншоты ошибок из тикетов для поиска и роутинга. Сравниваем API и свою видеокарту с учётом железа, электричества и поддержки

Стоимость через API (Sonnet-ярус)

Картинка 1 500×1 000 px ≈ 1.94K токенов входа (патчи 28×28 px, ярус high-res — картинка не сжимается) + инструкция 0.3K + ответ 0.3K

≈ $0.0045 вход + $0.003 выход ≈ $0.0075 за скриншот

200 скриншотов/день → $45/мес. 2 000/день → $450/мес. 10 000/день → $2 250/мес

Локально: Qwen3-VL-8B на RTX 5060 Ti 16 GB

Железо $585, амортизация 24 мес → $24/мес; электричество ~150 Вт → ~$25/мес; поддержка ~2 ч/мес → ~$100/мес

Итого ≈ $150/мес независимо от объёма — вплоть до ~30 000 картинок/день (1–2 с на картинку)

Качество описания скриншота у 8B-модели для роутинга и поиска — достаточное; для тонкого анализа UI — хуже, чем frontier

Стоимость в месяц, $ — по числу скриншотов в день08251650247533001005001 0002 0005 00010 000скриншотов в деньAPI (Sonnet 5)Локально (RTX 5060 Ti + поддержка)

Точка безубыточности ≈ 670 скриншотов/день. Ниже — API проще и дешевле; выше — локальная модель окупает карту за первый месяц

Допущения: токены на картинку по правилу Anthropic (патчи 28×28 px; ярус high-resolution для Claude 4.7+, кэп 4 784 токена); цены Sonnet 5 $2/$10 по прайсу Anthropic на 8 сентября 2026; ставка инженера $50/ч. Своя карта заодно обслуживает эмбеддинги и STT

13

РАЗДЕЛ 3

03

Поиск по нашим данным

Эмбеддинги находят по смыслу, реранкеры выбирают точно. Как заставить модель отвечать по нашим данным — и хелпдеск как живой пример

14

Что такое эмбеддинг

Обычный поиск ищет слова. Эмбеддинги ищут смысл: «сервер не отвечает» найдёт «хост недоступен по SSH»

1

Текст

«Не могу подключиться к базе после обновления»

2

Embedding-модель

Маленькая нейросеть (0.3–8B) читает текст и выдаёт вектор — список из 256–4 096 чисел

3

Вектор

[0.12, −0.83, 0.44, …]. Смысл закодирован в числах: близкие по смыслу тексты → близкие векторы

4

Поиск

Вопрос тоже превращаем в вектор и ищем ближайшие среди миллионов — за миллисекунды

Где применяется

RAG: найти нужные фрагменты базы знаний и подать их LLM

Поиск похожих тикетов: «такое уже решали?» — по смыслу, а не по словам

Кластеризация и дедупликация: сгруппировать 10 000 обращений по темам без ручной разметки

Классификация без обучения: сравнить вектор тикета с векторами описаний категорий

Не только текст: есть модели для картинок, аудио, кода — и мультимодальные (текст и картинка в одном пространстве)

Что важно знать

Векторы разных моделей несовместимы: сменили модель — переиндексируем всё

Дёшево: модель на 0.6B на карте 16 GB делает ~1 000 фрагментов в секунду; миллион документов — минуты

Ищет смысл, но плохо — точные строки: коды ошибок, ID, имена функций. Поэтому нужен гибрид с обычным поиском (дальше)

У части моделей вектор можно укоротить без переиндексации: 1024 → 256 чисел, −75% места, −2% качества

15

Реранкер и гибридный поиск

Векторный поиск быстрый, но грубый. Два дешёвых приёма поднимают точность на 10–25% без смены модели

1

Запрос

Вопрос пользователя, при необходимости переформулирован малой LLM

2

Смысловой поиск

Эмбеддинг → векторная база. Ловит синонимы и перефразировки. Берём топ-50

3

Словарный поиск (BM25)

Классический поиск по словам: точные коды ошибок, ID, имена. Берём топ-50

4

Слияние (RRF)

Объединяем два списка простой формулой по позициям — без настройки весов

5

Реранкер

Модель читает пару «вопрос + фрагмент» целиком и ставит точную оценку. Топ-5 идут в LLM

Почему гибрид: Для embedding-модели «ERR_4012» — просто набор символов, смысла нет. Словарный поиск найдёт его точно. Вместе — покрывают слабости друг друга

Что такое реранкер: Embedding-модель кодирует вопрос и документ по отдельности (быстро, но приблизительно). Реранкер смотрит на них вместе (медленно, но точно) — поэтому применяем только к топ-50

РеранкерТипЗамечания
bge-reranker-v2-m3 (568M)открытый, Apache 2.0Стандарт де-факто; многоязычный; работает на CPU
Qwen3-Reranker 0.6B / 4B / 8Bоткрытый, Apache 2.0Пара к Qwen3-Embedding; настраивается инструкцией; лучше на коде
Cohere Rerank 3.5 / Voyage rerank-2.5API$2 за 1 000 запросов; без инфраструктуры

Векторные базы (Qdrant, pgvector, Milvus…) и таблица embedding-моделей — в раздатке. Практика: Postgres — источник правды, Qdrant — только векторы

16

Кейс: RAG-хелпдеск (pumba) — как это работает

База быстрых ответов, очищенные тикеты, внутренняя и клиентская wiki, код backend → один поисковый индекс → модель отвечает по найденному

1

Очистка

4 источника → чистый текст

2

Чанкинг

Текст → фрагменты + метаданные

3

Postgres

Источник правды

4

Qdrant

Векторы, быстрый поиск

5

Reranker

Топ-50 → топ-5

6

LLM

Ответ с цитатами

ШагЧто происходитЗачемЧто даёт
1. ОчисткаЧетыре источника: база быстрых ответов; тикеты клиентов, очищенные от персональных данных, подписей и цитат; внутренняя и клиентская wiki без устаревших версий и дублей; исходный код backend — README, конфиги, комментарииМодель отвечает по тому, что нашла. Мусор в индексе = уверенный ответ по устаревшей статьеОтветы по актуальному; PII не попадает ни в индекс, ни в API
2. ЧанкингРежем документы на фрагменты 300–800 токенов с перекрытием; код — по функциям. К каждому прикрепляем заголовок, путь, дату, продуктМодель не может прочитать всю базу за раз — нужны кусочки размером с ответ на один вопрос. Метаданные нужны для фильтров и ссылокТочные попадания вместо «где-то в этом документе»; ссылка на конкретное место
3. PostgresХраним все фрагменты с версиями и правами доступа; при обновлении статьи меняем только её фрагментыЕдинственное место, где данные «настоящие». Отсюда можно переиндексировать что угодно; из векторной базы обратно — нельзяМожно менять чанкинг, embedding-модель или векторную БД без потери данных
4. Qdrant + bge-m3Каждый фрагмент прогоняем через bge-m3 → два вектора (смысловой и «словарный»). Вопрос кодируем так же и ищем ближайшие 50 с фильтром по продукту / датеОбычный поиск ищет слова, смысловой — синонимы и перефразировки; словарный вектор нужен для кодов ошибок и IDКандидаты за миллисекунды из миллионов фрагментов; «сервер не отвечает» находит «хост недоступен»
5. Rerankerbge-reranker читает пары «вопрос + фрагмент» целиком и ставит точную оценку; оставляем 5 лучшихВекторный поиск быстрый, но приблизительный; реранкер точный, но медленный — поэтому только на топ-50+10–25% точности; в модель уходит меньше токенов → дешевле и меньше шума
6. LLM5 фрагментов + вопрос + инструкция «отвечай только по контексту, ставь ссылки» → ответМодель ничего «не знает» о наших продуктах — знает только то, что ей подали. Цитаты = проверяемостьОтвет за десятки секунд со ссылкой; оператор проверяет источник, а не верит на слово

Шаги 1–5 работают локально на одной карте 16 GB (или CPU) — $0 за запрос. Только шаг 6 стоит денег, если LLM берём по API

17

Кейс pumba: что даёт и когда это имеет смысл

RAG — не универсальное решение. Он окупается на определённом типе вопросов и требует ухода за данными

Что даёт

Ответ на типовой вопрос за десятки секунд вместо минут поиска по вики и старым тикетам

Черновик ответа оператору: он проверяет и отправляет, а не пишет с нуля

Автоответ на самые частые вопросы — без человека

Единый поиск по трём источникам сразу: тикеты, вики, код

Знание не уходит с уволившимся сотрудником — оно в индексе

Каждый ответ с ссылкой на источник → можно проверить и исправить статью

Когда имеет смысл

Много повторяющихся вопросов, ответы на которые уже где-то записаны

База знаний большая и живая: людям трудно найти, но ответ есть

Данные внутренние или чувствительные — модель по API их не знает и не должна получить целиком

Ответы должны быть проверяемы (ссылка на источник), а не «модель так думает»

Нужна актуальность: обновили статью — ответы изменились сразу, без переобучения

Когда не имеет смысла

Ответов нет в документах — RAG не сочинит решение, он только находит записанное

Вопросы уникальные, каждый раз новые — поиск не поможет, нужен человек или агент с доступом к системам

База знаний маленькая (< 50 страниц) — проще положить всё в контекст модели целиком

Никто не ухаживает за данными — через полгода индекс полон устаревшего и доверие к ответам падает

Не заменяет права доступа: фрагменты нужно фильтровать по тому, кому можно их видеть

Стоимость: очистка, эмбеддинги, реранкер — локально, $0/запрос; LLM по API (Sonnet-ярус) ≈ $0.01–0.02 за ответ, или локальная 30B для приватных данных

18

Кейс pumba: как это выглядит

Слева — AI-помощник отвечает по базе знаний и ссылается на тикет; справа — подсказка оператору внутри обращения, «Вставить в ответ»

AI-помощник хелпдеска: разбор ошибки по скриншоту Подсказка оператору в обращении со ссылками на документацию

AI-помощник

Вопрос с приложенным скриншотом ошибки → причина, шаги исправления и ссылка на похожий тикет

Два режима: «Простая» модель для типовых вопросов и «Думающая» для сложных

Подсказка оператору

Внутри обращения: ответ по документации с номерами источников, «Уточнить» и «Вставить в ответ»

Оператор проверяет источник и отправляет, а не пишет с нуля

Снимки — интерфейс хелпдеска pumba, сентябрь 2026

19

РАЗДЕЛ 4

04

Речь: STT и TTS

Транскрипция созвонов, голосовые боты — и переводчик в кармане без интернета

20

STT: речь → текст

Speech-to-Text (ASR). Нет одного победителя — есть лучший под задачу: точность, языки, задержка, размер

Что это

Модель слушает аудио и выдаёт текст, часто с пунктуацией и временными метками. Качество меряют WER (доля ошибочных слов): на русском колл-центре GigaAM-v3 даёт ~10%, Whisper-large-v3 — ~24% (карточка GigaAM-v3 на Hugging Face). Рядом всегда работают помощники: VAD (детектор речи — режет тишину) и диаризация («кто говорил»).

Зачем нам — примеры применения

Транскрипция созвонов → LLM делает саммари и задачи в тикет

Голосовые сообщения клиентов → текст → обычный пайплайн хелпдеска

Субтитры и поиск по записям встреч и обучающих видео

Голосовой ввод для операторов и в мобильных приложениях

Первый шаг любого голосового бота и переводчика

МодельЗаметки
Whisper large-v3 / v3-turboOpenAI, открытый. 99 языков, универсал; turbo в 6 раз быстрее. 1.5B / 0.8B
NVIDIA Parakeet TDT v3Потоковый, очень быстрый (>2 000× реального времени), 25 языков. 0.6–1.1B
NVIDIA Canary-Qwen 2.5BЛидер по точности на английском; хорошая пунктуация
Sherpa-ONNX ZipformerПотоковые модели 26–188 MB на язык; SDK для Android / iOS
GigaAM-v3 (Сбер)MIT, 220M. Лучшая открытая для русского: колл-центры, шум; пунктуация; ONNX → CPU и телефон
API: OpenAI, Deepgram, AssemblyAI$0.006–0.01/мин; потоковый режим, диаризация, форматирование

Локально или API? Ограничения

Локально: русский — GigaAM-v3, остальные языки — Whisper-turbo / Parakeet; карта 8–16 GB или CPU. 100 ч созвонов/мес по API ≈ $60, локально $0

API — если нужен потоковый режим «из коробки» и нет железа

Ограничения: акценты, термины, наложение голосов; доменные слова — словарь-подсказка или правка через LLM

Источники: Hugging Face Open ASR Leaderboard, Northflank / AssemblyAI обзоры, август 2026. DeepSpeech и Coqui STT — мертвы, не используем

21

TTS: текст → речь

Text-to-Speech. От 82-миллионных моделей на процессоре до клонирования голоса по трёхсекундному образцу

Что это

Модель превращает текст в звук. Современные TTS звучат почти как человек, умеют эмоции и паузы, а многие — клонировать голос по короткой записи (нужно согласие человека!). Натуральность меряют слепыми сравнениями (TTS Arena, рейтинг Elo). Для диалога важна потоковая выдача: первый звук через 200–400 мс, а не после всего текста.

Зачем нам — примеры применения

Голосовой бот или IVR на базе хелпдеска

Озвучка инструкций и обучающих материалов

Уведомления, доступность (чтение интерфейса)

Последний шаг переводчика и любого голосового ассистента

МодельЗаметки
Kokoro-82MApache 2.0. 54 голоса, 8 языков; работает в реальном времени на CPU; без клонирования
Chatterbox / TurboMIT. Клон с 5 сек, 25 языков, теги [laugh], [sigh]; Turbo — 75 мс задержки
Qwen3-TTS 1.7BApache 2.0. Клон за 3 сек, «дизайн голоса» по текстовому описанию, эмоции
Fish Audio S2 ProОткрытые веса; очень натуральный
PiperMIT. Крошечный, Raspberry Pi; есть русские голоса
Silero TTSЛучший лёгкий русский; CC-BY-NC — только некоммерчески
API: ElevenLabs, OpenAI, CartesiaЭталон качества; $15–30 за 1M символов

Локально или API? Ограничения

Локально: Kokoro или Piper на CPU — для уведомлений и ботов более чем достаточно; Chatterbox / Qwen3-TTS на GPU — для клонирования и эмоций

API: когда нужен голос «как в рекламе» и объём небольшой

Ограничения: русский у открытых моделей заметно хуже английского; клонирование — только с согласия

Источники: TTS Arena V2, Pinggy / BentoML / Modal обзоры, август 2026

22

Кейс: офлайн-переводчик на телефоне

Каскад из трёх маленьких моделей на Snapdragon 8 Elite — против одной облачной модели «речь → речь»

1

Микрофон + VAD

Silero VAD (~2 MB) режет тишину; push-to-talk как запасной вариант

2

STT на устройстве

Sherpa-ONNX Zipformer, 26–188 MB на язык; Whisper-small как альтернатива

3

Перевод

NLLB-200-distilled-600M или Opus-MT en↔ru (~300 MB). Вариант «умнее»: малая LLM Qwen3-1.7B/4B в Q4

4

TTS

Android TTS / Piper / Kokoro. Наушники или «mute mic during TTS», иначе переводит сам себя

Локальный каскад

Задержка 1–3 с на фразу; всё на устройстве, $0, работает в роуминге и метро

Точность перевода средняя (NLLB) — контекст фразы теряется; вариант с малой LLM лучше, но тяжелее

Готовый пример: InstantVoiceTranslate (open source, Android) — ровно этот стек

Облачная альтернатива: GPT-Realtime-Translate

Речь → речь напрямую, задержка ~0.3–0.5 с, сохраняет интонацию, перевод точнее

$0.034/мин — тишина тоже тарифицируется, поэтому VAD обязателен; ≈ $2 за час разговора

Нужен интернет; ключ прячем за своим backend

Тот же каскад STT → (LLM) → TTS — основа любого голосового бота; переводчик — частный случай

23

РАЗДЕЛ 5

05

Зрение и генерация

Модели, которые видят, читают документы и рисуют. И почему зрение — одна из самых выгодных задач для локальных моделей

24

VLM: модели, которые видят

Vision-Language Model — LLM с «глазами»: на вход картинка (или кадры видео) + текст, на выход текст

Что это

К языковой модели пристроен визуальный кодировщик: картинка превращается в ~1–1.6K токенов и читается вместе с текстом. Модель может описать скриншот, прочитать график, ответить на вопрос по фото, найти объект по описанию. Все frontier-модели (Claude, GPT, Gemini) мультимодальны; открытые VLM есть от 2B до 235B.

Зачем нам — примеры применения

Скриншот ошибки в тикете → что на нём, какая ошибка, к какой категории отнести

Проверка интерфейса после деплоя: «на этом экране есть кнопка сохранения?»

Разбор графиков мониторинга и дашбордов словами

Сравнение макета и реализации; описание картинок для поиска и доступности

Видео: понять, что происходит в записи экрана (пока в основном по API)

МодельЗаметки
Qwen3-VL 2B–235BApache 2.0. Лучшая открытая линейка; 4–8B — рабочий вариант для карты 16 GB
Gemma 4 (vision)Google, открытая; малые размеры для устройств
Llama 4 Maverick / ScoutMeta, MoE, длинный контекст с картинками
Kimi K2.6 / K3Открытые; понимают видео (K2.6 — пока по API)
API: Claude, GPT-5.6, Gemini 3.1Самое точное понимание сложных экранов и схем

Локально или API? Ограничения

Локально выгодно: картинка по API стоит как ~1.9K токенов текста + ответ ≈ $0.0075; при сотнях–тысячах картинок в день своя карта окупается за месяц (расчёт в разделе 2). Qwen3-VL-8B на 16 GB: 1–2 с на картинку

API нужен для тонкого анализа: мелкий текст, сложные схемы, видео

Ограничения: мелкие детали и точные координаты даются хуже; на очень больших изображениях режем на части

Прежде чем звать VLM по API — локальная 8B-модель описывает картинку, и дальше работаем с текстом, который в 10 раз дешевле

25

OCR и документы

Сканы, PDF, счета, таблицы, формулы → структурированный текст. Отдельный класс: точность и цена другие, чем у общей VLM

Что это

Классический OCR (Tesseract) распознаёт буквы построчно. Современные модели документов (DeepSeek-OCR, PaddleOCR-VL) понимают структуру страницы: колонки, таблицы, подписи, формулы — и отдают Markdown или JSON. DeepSeek-OCR ещё и сжимает страницу в ~10 раз меньше токенов, чем её текст, при точности 97% (статья DeepSeek, октябрь 2025) — дешёвый способ загрузить в LLM много документов.

Зачем нам — примеры применения

Сканы инструкций и старые PDF → база знаний хелпдеска (RAG)

Счета, договоры, акты → JSON с полями → бухгалтерия и CRM

Каталоги и спецификации с таблицами → поиск по параметрам

Скриншоты логов и консолей в тикетах → текст, который можно искать

Формы и анкеты от клиентов → автоматический ввод

МодельЗаметки
DeepSeek-OCRОткрытая. Таблицы, формулы, схемы, ~100 языков; лучшая по цене за страницу
PaddleOCR-VL / MinerUОткрытые конвейеры «PDF → Markdown» с разметкой структуры
TesseractКлассика, CPU, бесплатно; для чистых сканов печатного текста
Qwen3-VL (в режиме OCR)Универсальная VLM справляется с большинством документов
API: Mistral OCR, Azure Document Intelligence, Google Document AI$1–3 за 1 000 страниц; готовые схемы для счетов и форм

Локально или API? Ограничения

Локально: DeepSeek-OCR или Qwen3-VL-8B на 16 GB — секунда-две на страницу; 10 000 страниц в день — не проблема. Архив на 1M страниц по API ≈ $1–3k, локально — электричество

API: рукописный текст, редкие языки, готовые шаблоны (счёт, паспорт)

Ограничения: рукопись и плохие сканы; после OCR всегда прогоняем через валидацию (суммы сходятся? даты в диапазоне?)

Связка с разделом 3: OCR — это первый шаг очистки для документов, которые попадают в базу знаний

26

Генерация картинок, видео и музыки

Диффузионные модели: из шума «проявляют» картинку под управлением текста. Полезно для маркетинга, документации, игр — и важно знать границы

Картинки

Открытые: FLUX.2, Stable Diffusion 3.5, Qwen-Image, Kandinsky 5.0 (русский промпт, кириллица на картинке). Весят 6–30 GB, 5–20 с на картинку на карте 16–24 GB

API: gpt-image-2, Imagen 4, Midjourney — $0.02–0.20 за картинку, лучшее понимание сложных промптов

Новое поколение хорошо пишет текст на картинке и правит существующую по инструкции («убери фон, добавь логотип»)

Видео, музыка, 3D

Видео открытые: Wan 2.5, HunyuanVideo, LTX-2, Kandinsky 5.0 Video — клипы 5–20 с, минуты на карте 24 GB+; API: Veo 3, Sora 2, Kling — со звуком, $0.05–0.50/с

3D: текст или картинка → текстурированный меш за 10–60 с. Открытые: Hunyuan3D 2.1, TRELLIS.2 (MIT), Stable Fast 3D — карта 10–24 GB; API: Meshy 6, Tripo, Rodin — с авто-риггингом и плагинами для Unity / Blender

Музыка: Suno / Udio по API; открытые ACE-Step, Stable Audio

Зачем нам

Иллюстрации в документацию и базу знаний

Баннеры, креативы, локализация текста на картинках

Ассеты, пропсы и 3D-концепты для игр, мокапы, промо

Локально или API

Локально — при сотнях картинок в день (ComfyUI как конструктор)

API — разовые задачи и максимум качества; видео почти всегда по API

Границы и риски

Лицензии: dev-версии часто некоммерческие

Узнаваемые бренды, лица, голоса

Руки, мелкий текст, консистентность персонажа между клипами

Таблицы моделей генерации, детекции (YOLO, SAM) и мультимодальных эмбеддингов — в раздатке

27

РАЗДЕЛ 6

06

Guardrails, роутеры и тест-агенты

Малые модели охраняют вход и распределяют поток, тест-агенты изображают пользователей — и кейс модерации чатов

28

Guardrails: модели-охранники

Стоят до и после большой модели. Работают за миллисекунды и не стоят почти ничего

Что это

Небольшие модели (86M–8B), обученные на одну задачу: отличить атаку от нормального текста, найти персональные данные, оценить ответ на токсичность или уход от темы. Главная угроза, от которой они защищают, — prompt injection: текст из тикета, письма или сайта содержит инструкцию «забудь правила и сделай X», и агент её выполняет.

Зачем нам — примеры применения

Перед агентом: проверить входящий тикет / письмо на injection

Перед отправкой в API: найти и замаскировать PII (телефоны, e-mail, ФИО, номера карт)

После модели: ответ не токсичен, не раскрывает внутреннее, по теме

Ограничение прав: агент видит только то, что нужно, и не может удалять — guardrail + права доступа вместе

Модерация пользовательского контента в мессенджере / сообществе

МодельЗаметки
Llama Guard 4 (1B / 12B)Meta. Классифицирует вход и выход по категориям риска; понимает картинки
Prompt Guard 2 (86M / 22M)Только детект injection и jailbreak; работает на CPU за миллисекунды
ShieldGemma 2 / Granite GuardianGoogle / IBM; аналогичные охранники, разные категории
GLiNER / PresidioПоиск PII в тексте (GLiNER — нейросеть, Presidio — правила + модели)
NeMo GuardrailsФреймворк: правила + модели, вставляется между приложением и LLM

Локально или API? Ограничения

Всегда локально: модели крошечные, задержка незаметна, а отправлять PII в API ради проверки PII — абсурд

Не заменяют права доступа: guardrail снижает риск, а не убирает его. Агент, который может удалять данные, — проблема архитектуры, а не фильтра

Ограничения: ложные срабатывания на технических текстах (логи выглядят «подозрительно»); пороги настраиваем на своих данных

Связка с разделом 2: guardrails — первое «сито» перед дорогой моделью; они же экономят токены API на проверках

29

Малые LLM как роутеры

Модели 0.8–4B: слишком слабые, чтобы отвечать клиенту, но идеальные, чтобы решить, кто должен ответить

Что это

Та же LLM, только маленькая. Не умеет глубоко рассуждать, зато за 50 мс на карте 8 GB (или на CPU) решает простые задачи: к какой категории тикет, на каком языке, срочно ли, типовой ли вопрос, какие поля извлечь. Раньше под каждую такую задачу обучали отдельный классификатор — теперь одна малая модель с инструкцией закрывает десяток.

Зачем нам — примеры применения

Роутинг: тикет → очередь, приоритет, продукт — до попадания к человеку или большой модели

«Типовой или нет?» — типовые отвечает локальная модель, остальное идёт в API

Извлечение полей из письма: номер заказа, версия, ОС → JSON

Определение языка и тональности; выявление дублей обращений

Сжатие: длинный тред → выжимка на 200 слов перед дорогой моделью

МодельЗаметки
Qwen3.5 0.8B / 2B / 4BApache 2.0; лучшие малые для многоязычных задач
Phi-4-mini (3.8B)Microsoft; 128K контекст; работает без GPU
Gemma 4 smallGoogle; для устройств и телефонов
gpt-oss-20b (MoE, 3.6B актив.)OpenAI; помещается в 16 GB; сильнее на рассуждении
Обученные классификаторы (BERT-класса)Если задача одна и данных много — ещё быстрее и точнее, но нужно обучать

Локально или API? Ограничения

Всегда локально: в этом весь смысл. Карта 8–16 GB обслуживает тысячи запросов в минуту

Оценка качества обязательна: 200 размеченных примеров → точность роутера. Если < 90% — добавляем примеры в инструкцию или дообучаем

Ограничения: сложные многоступенчатые правила, редкие категории, длинные документы — там ошибается; передаём выше по ярусу

30

Кейс: модерация чатов сообщества — каскад

Go-ядро + React-админка, первая площадка Telegram (ядро о мессенджере не знает). Ни одно сообщение не идёт сразу в LLM: этапы по возрастанию цены, первый сработавший «держит»

1

0 · Медиа → текст

Голос → транскрипт (GigaAM-v3 локально), картинка → текст + визуальные скоры. Только для новых авторов; результат кэшируется по ID файла — один спам-стикер шлют массово

2

1 · Правила, без ИИ

Блок-листы, regex, антифлуд, эвристики новичков; нормализация обфускации («kриптa», «заааайм», zero-width). Отсекает основную массу спама бесплатно

3

2 · Moderation API

Специализированный классификатор (OpenAI Moderation / Perspective) за интерфейсом; сейчас заглушка — можно включить без переписывания

4

3 · LLM

Только серая зона: завуалированный скам («пиши в личку»), сарказм, социнженерия, кастомные правила чата. Вход — сообщение + контекст беседы, выход — строгий JSON

Не «да/нет», а вектор скоров и два порога

Каждый этап отдаёт скоры по категориям: spam, scam, toxicity, hate, harassment, nsfw, off_topic, nsfw_visual, violence_visual

На категорию два порога: выше auto_block — автоблок; между review и auto_block — очередь оператору; ниже — пропуск

Один слайдер с двумя ручками покрывает всё от полного автомата до полностью ручного режима

Что это даёт

Самая дешёвая и предсказуемая часть системы — не ИИ. LLM включается только там, где правила принципиально не справляются

Голосовые и «кружки» — частый спам-паттерн новых аккаунтов: транскрипт вливается в текстовый пайплайн и скорится как обычный текст

Тот же каскад «дёшево → дорого», что и в регионе 2, — только для модерации

Заказчик — сообщество поддержки: истории в личку боту, вопросы к аудитории, предупреждения; групповые чаты чистим от спама, скама и токсичности

31

Пять классов ИИ в одном проекте

Каждый выбран по критерию «дешевле и надёжнее для своей задачи», а не «потому что LLM модно»

КлассЧто делает в проектеПочему именно онКласс моделей
Детерминированные алгоритмыНормализация обфускации (гомоглифы, leetspeak, растягивание); стоп-слова; балльный классификатор «вопрос vs история»; детекторы «2–3 автора заняли >50% чата», «всплеск ≥10 событий за 30 мин»Бесплатно, мгновенно, предсказуемо. Одна функция Skeleton() к тексту и к блок-листу — стоп-слово ловит все написанияМалые локальные (2)
Локальная ASRОтдельный контейнер GigaAM-v3 в ONNX + Silero VAD: голосовые и «кружки» → текст. На CPU в 30 раз быстрее реального времениРусская речь, данные не покидают периметр, дешевле и приватнее, чем слать аудио в облачную LLMРечь (4)
Мультимодальная модельДва узких «агента» на одной VLM: OCR-агент вытаскивает текст с мемов и скам-скринов; vision-агент отдаёт JSON {nsfw_visual, violence_visual}Дальше нужен не «смысл картинки», а число для порога. Промпт запрещает выполнять инструкции с картинкиЗрение (5)
LLM в пяти роляхКлассификатор со structured output (moderator, analyst) · движок диалога с конечным автоматом (story-бот) · конвейер writer → reviewer → editor → corrector · заземлённый ассистент админки · генератор тестовых данныхОдна модель (GLM-5.2 через один сайдкар), 11 агентов = 11 системных промптов. Ключ живёт только в сайдкареLLM (1)
LLM как инструмент разработкиКод пишут агенты Claude Code; роли: планирование — сильная модель, бойлерплейт — дешёвая. В сессии уходят только код и синтетика — не данные чатов и не ключиГраница данных — часть архитектуры, а не пожелание

Пять классов, выстроенные по цене: регулярки → локальная ASR → мультимодальный классификатор → LLM-классификатор → LLM-агенты

32

Тест-агенты вместо людей

Как обкатать модерацию без живых людей — синтетический чат с персонажами разного характера

Что сделали

Dev-агент storyteller роль-плеит пользователя: simulate-story --persona shy --turns 8 --abandon — «неохотный рассказчик», который бросает диалог на середине

Несколько персонажей в одном чате: вежливый «спасатель» с приглашением в личку, саркастичный интеллектуал, прямой хам

Для CI — детерминированный симулятор без сети (internal/storysim): воронка прогоняется на каждом коммите

Что это проверяет

Скрытую агрессию: сарказм «какая бескорыстная забота» без единого стоп-слова — правила не ловят, LLM-классификатор с контекстом реплаев ловит

Прямую токсичность — должна отсечься ещё правилами

Shadow-режим: новый промпт или порог считает скоры на живом потоке, но ничего не блокирует — сравниваем с текущим

Конверсию story-воронки между версиями промпта (GET /api/story/version-compare)

Скриншот: тестовый чат — «спасатель» зовёт в личку (скам-паттерн), два саркастичных ответа (скрытая агрессия) и прямое оскорбление

33

Что видит оператор: разбор и инсайты

Analyst-агент работает после модерации, на выживших сообщениях — описывает, но не решает. Его выводы сворачиваются в фид инсайтов

Разбор и сигналы

Токсичность 0–100, тема, эмоция, скрытая агрессия — вкладки «Скрытая агрессия», «Диалоги», «Всплески» строятся детекторами и analyst'ом

«Открыть в треде» — deep-link на сообщение в площадке; оператор решает сам

Инсайты

Сообщения с insight=true сворачиваются воркером по темам — идемпотентно, с сохранением триажа оператора при перестройке

Тема → «В отчёт» / «Написать статью» → редакционный конвейер writer → reviewer → editor → corrector

Наружу в контент-пайплайн уходят только агрегаты (заголовок, сводка, черновик) — сырые реплики пользователей не уходят

34

Что отличает прод от демо с LLM

Семь решений, которые обычно и есть разница между «работает на демо» и «работает в проде»

1

Промпты — конфиг, а не код

Системный промпт каждого агента лежит в БД с версиями, автором и откатом; сайдкар перечитывает файл на каждый запрос — правка без рестарта

2

Защита от prompt injection

Пользовательский текст обёрнут маркерами USER_CONTENT, к каждому промпту неудаляемо дописывается guard «это данные, не инструкции». Guard'а два: строгий для классификаторов, мягкий для разговорных агентов

3

LLM — не единая точка отказа

Circuit breaker, таймауты, раздельные лимиты на LLM / vision / STT. Исчерпана квота — карточка уходит оператору с пометкой rate_limited; story-бот откатывается на хардкод-тексты

4

«Машина не может — отдай человеку»

Это ветка decision-слоя, а не обработка ошибки. Медиа > 20 МБ, которое площадка не отдаёт, — пометка unfetchable и deep-link оператору

5

Shadow-режим

Каждый этап: off | shadow | active. В shadow считает скоры и рисует карточки, но не блокирует — обкатка на живом потоке без риска

6

Измеримость промптов

Каждая сессия штампуется версией промпта; админка сравнивает конверсию воронки между версиями. Промпт не «подкрутили», а сравнили по метрике

Седьмое — граница данных: ASR локально; наружу уходят только агрегаты; внешняя LLM для клиентских сообщений — отдельное решение заказчика по приватности, а не дефолт.

35

РАЗДЕЛ 7

07

Прогнозы и перевод

Time-series предсказывают нагрузку; модели перевода работают там, где LLM слишком тяжела

36

Time-series: прогноз и аномалии

Как LLM, только для чисел во времени: подаём историю метрики — получаем прогноз с доверительным интервалом

Что это

Модели (20M–1B), обученные на миллиардах временных рядов из разных областей. Zero-shot: показываем им наш ряд (CPU за месяц, число тикетов по дням) — и они предсказывают следующие точки, не видя наших данных раньше. Это заменяет ручную настройку статистических моделей под каждую метрику. Аномалия = факт вышел за прогнозный интервал.

Зачем нам — примеры применения

Алертинг без ручных порогов: «CPU выше, чем модель ожидала для вторника 15:00» вместо «CPU > 80%»

Прогноз нагрузки и capacity planning: когда упрёмся в диск / память / лимит API

Поток обращений по сменам → планирование дежурств поддержки

Прогноз расхода токенов и счёта за API

Бизнес-метрики: продажи, регистрации, отток — с интервалами неопределённости

МодельЗаметки
Chronos-2 (Amazon)Apache 2.0; универсальная, с учётом внешних признаков (день недели, релиз)
TimesFM 2.5 (Google)Открытая; сильная на длинных горизонтах
Moirai 2 (Salesforce) / TiRexОткрытые; TiRex — лидер на коротких горизонтах
Классика: Prophet, ARIMAБесплатно, объяснимо, но настраивать под каждый ряд
API: облачные сервисы (Amazon Forecast и т.п.)Для тех, кто не хочет держать модель; для нас смысла мало

Локально или API? Ограничения

Всегда локально: модели маленькие, CPU достаточно; данные — метрики, их и отправлять никуда не нужно

Встраивается рядом с Prometheus / Grafana: раз в час пересчитать прогноз по ключевым метрикам и выставить динамические пороги

Ограничения: редкие события (падение из-за релиза) не предсказать; короткая история (< 2 недель) даёт слабый прогноз; проверяем на истории, прежде чем доверять алертам

Недооценённый класс для DevOps: замена сотен ручных порогов в алертинге одной моделью

37

Машинный перевод

Отдельные модели перевода: в 10–100 раз меньше LLM, работают на телефоне, но хуже понимают контекст

Что это

Модели «текст на языке A → текст на языке B». Классические (NLLB-200, Opus-MT) — маленькие (300M–1.3B), быстрые, покрывают до 200 языков, но переводят по одному предложению без контекста. LLM переводят лучше — с учётом стиля, терминов и всей переписки — но дороже и медленнее. Speech-to-speech модели (SeamlessM4T, GPT-Realtime-Translate) переводят речь напрямую.

Зачем нам — примеры применения

База знаний на одном языке → ответы клиентам на их языке (RU / EN)

Локализация интерфейса и документации — черновик, который правит человек

Переводчик на телефоне без интернета (кейс из раздела 4)

Перевод входящих обращений для операторов, не знающих языка

Субтитры к записям созвонов на другом языке

МодельЗаметки
NLLB-200 (Meta), distilled 600M / 1.3B200 языков, включая русский; CC-BY-NC
Opus-MT (Helsinki-NLP)Попарные модели ~300 MB; свободная лицензия; en↔ru отличные
Tower / GemmaX / Qwen3.8-27B как переводчикLLM-подход: контекст, термины, стиль; лучше для документов
SeamlessM4T v2 (Meta)Речь ↔ речь и текст, 100 языков; CC-BY-NC
API: DeepL, Google Translate, GPT-Realtime-TranslateDeepL — эталон для европейских языков; $20–25 за 1M символов

Локально или API? Ограничения

Локально: Opus-MT / NLLB для массового и офлайн; малая LLM (9–27B) для качественного перевода документов с глоссарием

API: DeepL, когда объём небольшой и нужно максимальное качество без возни

Ограничения: термины и названия продуктов — нужен глоссарий; NLLB теряет контекст между предложениями

38

Итоги

Модель — не только чат: семь классов моделей, у каждого своя задача, размер и цена

Открытые модели догнали закрытые — выбор «API или своё» теперь про данные, объём и операционку

Локальный запуск упирается в память: карта 16 GB закрывает весь поисковый стек, STT, vision и роутинг; 128 GB — модели 70–120B

Главная экономия — не в замене большой модели, а в том, чтобы 70–90% рутины до неё не доходило: guardrails, роутер, поиск, сжатие, локальная vision

Считаем честно: железо + электричество + люди + цена ошибок; точка безубыточности есть, и она не всегда на нашей стороне

Качество RAG на 80% — данные, чанкинг, гибридный поиск, реранкер; LLM меняем последней

Вопросы?

39