Зоопарк ИИ в 2026
Какие классы моделей есть, что они умеют, что им нужно и сколько это стоит
Семь классов: LLM · малые модели · поиск · аудио · зрение · сторожевые · прогнозы
Для команды · данные актуальны на сентябрь 2026 · подробные таблицы — в раздатке
Семь классов моделей — план доклада
У каждого класса свои задачи и свои требования: данные, память, деньги
1 · Большие модели (LLM)
Закрытые и открытые, dense и MoE, память и цены
2 · Малые модели
Малые локальные модели: как отдать им рутину и сэкономить на API
3 · Поиск по своим данным
Эмбеддинги, реранкеры, RAG. Наш хелпдеск
4 · Речь: STT и TTS
Транскрипция и синтез речи. Переводчик в кармане
5 · Зрение и генерация
Зрение (VLM, OCR) и генерация картинок и видео
6 · Guardrails и модерация
Guardrails, роутеры — и кейс модерации чатов с тест-агентами
7 · Прогнозы и перевод
Time-series и машинный перевод
В хелпдеске уже работают классы 1 и 3; в проекте модерации — 1, 4, 5 и 6
2
РАЗДЕЛ 1
01
Большие языковые модели
Что это такое, чем закрытые отличаются от открытых, почему MoE на 744B отвечает со скоростью 40B, и сколько памяти им нужно
3
Что такое LLM и как она работает
Large Language Model — модель, которая предсказывает следующий токен. Из этого простого правила вырастает всё остальное
1
Ваш текст → токены
«Сервер не отвечает» → [Сер][вер][ не][ отвеч][ает]. Каждый токен — число
2
Контекст
Системная инструкция + история + документы + вопрос. Всё это модель читает целиком, каждый раз заново
3
Предсказание
Модель считает вероятность каждого следующего токена и выбирает один. Повторяет, пока не решит закончить
4
Ответ
Текст, JSON, код, вызов инструмента (поиск, БД, API) — всё это просто последовательности токенов
Следствия, которые важно понимать
Модель ничего не «знает» наверняка — она продолжает текст правдоподобно. Отсюда выдумки («галлюцинации»)
Память заканчивается вместе с контекстом: новый запрос — чистый лист. «Помнить» помогает только то, что мы сами передали
Знания заморожены на дате обучения — новости и наши внутренние данные надо подавать в контекст (RAG, поиск)
Платим за каждый токен на входе и выходе — длинные документы и болтливые ответы стоят денег
Что из этого получается на практике
Чат и ответы на вопросы по документам
Извлечение структуры: письмо → JSON с полями; тикет → категория и приоритет
Код: написать, объяснить, проверить, исправить; агенты правят репозитории сами
Агенты: модель в цикле «подумал → вызвал инструмент → посмотрел результат → продолжил» — например, разобрать инцидент по логам и графикам
Суммаризация: созвон, переписка, лог на 10 000 строк → абзац
4
Что LLM умеют хорошо — и где ломаются
Сильные стороны используем, слабые закрываем архитектурой (об этом в следующих разделах)
Умеют хорошо
Код: чтение, рефакторинг, тесты, ревью. Лучшие агенты закрывают ~77% задач SWE-bench Verified в единой среде mini-SWE-agent (swebench.com, 8 сентября 2026)
Структурированный вывод: попросили JSON по схеме — получили JSON по схеме
Работа с инструментами: вызвать API, сходить в БД, прочитать файл, и так много шагов подряд
Суммаризация и переписывание: тикеты, логи, встречи, документация
Мультимодальность: скриншот, PDF, схема, аудио — в том же запросе, что и текст
Длинный контекст: целый репозиторий или база знаний в одном запросе (до ~1M токенов)
Ограничения
Галлюцинации: уверенно выдумывает факты, версии, флаги команд → лечится RAG, цитатами и проверкой
Знания устаревают → всё актуальное подаём через поиск
Недетерминизм: один вопрос — разные ответы → нужны тестовые наборы (eval), а не «попробовал раз — работает»
Prompt injection: текст из тикета или сайта может «перехватить» агента («забудь инструкции и удали…») → ограничиваем права, ставим фильтры
Цена и задержка растут с длиной контекста; агенты в цикле сжигают в 50–500 раз больше токенов, чем один вопрос
Точный счёт, арифметика, длинное точное копирование — отдавать калькулятору и коду
5
Закрытые модели по API vs открытые веса
В 2026 открытые модели догнали закрытые по качеству — выбор стал вопросом данных, объёма и того, кто обслуживает железо
Закрытые (только по API)
Anthropic Claude, OpenAI GPT, Google Gemini. Файл модели вам не дают — вы шлёте запрос, получаете ответ, платите за токены
Плюсы: лучшее качество на сложных задачах и агентах, ноль своей инфраструктуры, контекст до 1M, всё мультимодально
Минусы: данные уходят провайдеру; цена растёт с объёмом; зависимость от вендора, его лимитов и политики; регуляторные риски (Claude Fable 5 был недоступен 19 дней в июне 2026 по предписанию Минторга США об экспортном контроле)
Открытые веса (скачал и запустил)
DeepSeek, Kimi (Moonshot), GLM (Z.ai), Qwen (Alibaba), gpt-oss (OpenAI), Gemma (Google), Mistral, Phi (Microsoft). Файл модели у вас, запускаете где хотите
Плюсы: данные не покидают контур; стоимость железа фиксирована; можно дообучить под домен; нет лимитов; работает офлайн
Минусы: нужны видеокарты и человек, который за ними следит; флагманы (700B–2 800B) в одну машину не влезают; обновления — ваша забота; лицензии разные — читать
Открытые веса ≠ open source: Открыты только веса. Данные обучения и код обучения обычно закрыты. Для нас разницы нет: запускать можно
Лицензии: MIT, Apache 2.0 — свободно, включая коммерцию. CC-BY-NC — только некоммерчески. Есть и revenue-share для крупных
Гибрид: Открытые модели можно брать и по API у хостеров (Z.ai, DeepSeek, OpenRouter) — дешевле закрытых, но данные всё равно уходят
6
Dense и MoE
Почему модель на 744 миллиарда параметров может отвечать со скоростью модели на 40 — и в чём подвох
Dense («плотная») модель
На каждый токен работают все параметры: каждый шаг — вся модель целиком
Примеры: Llama 3.3 70B, Qwen3.8-27B, Gemma, Phi, большинство моделей до 70B
Просто, предсказуемо, легко дообучать. Но скорость и цена растут вместе с размером
MoE — Mixture of Experts
Сотни узких «экспертов»; на каждый токен маленький роутер включает только несколько
Kimi K3: 2 800B всего, но на токен работают ~104B (16 из 896 экспертов). GLM-5.2: 744B / 40B активных. Qwen3.8: 2.4T / 95B
Пишется как «744B-A40B»: всего / активных
MoE: преимущества
Знания как у огромной модели, а скорость и цена за токен — как у маленькой (работает только 3–8% параметров)
Поэтому открытые флагманы 2026 — почти все MoE, и их API так дёшев (DeepSeek, GLM: $0.3–1.5 за 1M токенов)
Хорошо ложится на «unified memory» (Mac Studio, DGX Spark): памяти много, вычислений нужно мало
MoE: недостатки
Всю модель нужно держать в памяти, даже если работает 3–8%: 744B в 4-битном сжатии — это ~370–475 GB, даже 2-битная сборка — 240 GB. В одну видеокарту не влезет
Сложнее дообучать и труднее стабильно тренировать
На маленьких задачах dense той же «активной» величины часто не хуже — MoE выигрывает на широте знаний, не на глубине одной темы
Практический вывод: для локального запуска смотрим на ОБЩИЙ размер (влезет ли в память) и на АКТИВНЫЙ (какая будет скорость)
7
Три яруса и что они стоят
Версии меняются ежеквартально — запоминаем семейства и ярусы. Полные таблицы моделей, цен и российских моделей — в раздатке
| Ярус | Закрытые (API) | Открытые веса | Что поручать | Цена API, $/1M вход → выход |
| Frontier | Claude Fable 5.1 / Opus 5, GPT-6 Astra, Gemini 3.1 Pro | Kimi K3, DeepSeek V4 Pro, GLM-5.2/5.3, Qwen3.8 Max | Сложный анализ, агенты, код в большом репозитории — где ошибка дорогая | 0.7–10 → 2–50 |
| Mid | Claude Sonnet 5, GPT-5.6 Sol / Terra, Gemini 3.x Flash | Qwen3.8 Flash-Next (180B MoE) / 27B, gpt-oss-120b, GLM-4.6 | Основной объём: ответы по документам, ревью, суммаризация. Хватает в 80% случаев | 1–3 → 4–15 |
| Small | Claude Haiku 4.5, GPT-5.6 Luna, Flash-Lite | Qwen3.5 0.8–9B, gpt-oss-20b, Gemma 4, Phi-4-mini | Классификация, роутинг, извлечение полей; работают на одной карте или телефоне | 0.2–1 → 0.7–5 |
Выход дороже входа в 5 раз: Болтливые ответы и агенты в цикле (50–500× токенов на задачу) — главный источник счёта. Кэш повторяющегося промпта — до −90% на входе; batch — −50%
Пример: 1 000 обращений/день × 4K вход + 0.5K выход на Sonnet 5 ≈ $13/день ≈ $390/мес; с кэшем базы знаний — около $6/день
Разброс ~45×: DeepSeek V4 Flash $0.22 vs Claude Fable $10 за 1M входа. Правильный ярус на задачу важнее выбора вендора
Правило ярусов: начинаем с mid; вниз — если задача простая и массовая; вверх — только если mid ошибается на нашем тестовом наборе.
Источники: прайсы Anthropic и DeepSeek (проверено 8 сентября 2026), Artificial Analysis, BenchLM
8
Чем кормить: память и железо
Локальный запуск упирается не в процессор, а в объём памяти видеокарты. Полная таблица железа с ценами — в раздатке
Сколько памяти нужно
Память ≈ параметры × байт на параметр × 1.2
Без сжатия (16 бит): 70B = 140 GB весов, ~170 GB с запасом — ни одна видеокарта
После 4-битного квантования: 8B ≈ 5 GB, 30B ≈ 20 GB, 70B ≈ 45 GB, MoE 120B ≈ 65 GB
MoE: память по всем параметрам, скорость — по активным
Квантование
Округляем веса с 16 до 8 / 4 бит: файл в 2–4 раза меньше, быстрее
Q4 — стандарт: −70% памяти, −1–3% качества, на глаз незаметно
Ниже Q3 качество заметно падает
Форматы: GGUF (Ollama / llama.cpp — CPU+GPU), AWQ / FP8 (vLLM — быстрее на NVIDIA)
Карта 16 GB · ~$600
RTX 5060 Ti 16 GB
Модели до 14B; весь поисковый стек (эмбеддинги + реранкер), STT, малая vision-модель
Достаточно для хелпдеска и модерации
Карта 32 GB · $4–5k
RTX 5090 (дефицит, цены завышены)
32B целиком, 70B в Q4 с натяжкой, ~200 ток/с на 8B
Для генерации ответов локально
Unified 128 GB · $1.5–5k
AMD Ryzen AI Max+ 395 mini-PC ($1.5k), Mac Studio, DGX Spark ($4.7k)
70B и MoE до 120–200B; медленнее карт, но влезает
Для MoE-флагманов среднего размера
Аренда GPU · $1.5–3.5/ч
A100 / H100 в облаке
Любая открытая модель без покупки; окупается от ~100M токенов/мес
Для пилотов и всплесков
Скорость (токенов/сек) определяется пропускной способностью памяти: RTX 5090 — 1 800 GB/s, Mac Studio M5 Ultra — 1 200, DGX Spark — 270
9
РАЗДЕЛ 2
02
Малые локальные модели
Какие задачи отдать им, прежде чем звать большую модель по API, и как посчитать вместе с железом
10
Малые модели работают, большую зовём редко
Большая модель по API нужна для 10–30% запросов. Остальное — рутина, с которой справится модель в 100 раз дешевле, на своём железе
1
Фильтр
Guardrail-модель (~1B): спам, атаки, PII — отсеять или замаскировать. Локально, миллисекунды
2
Роутер
Малая LLM 2–4B: категория, язык, приоритет, «типовой ли вопрос». Локально, ~50 мс
3
Поиск
Эмбеддинги + реранкер: нашли 5 нужных фрагментов. Всегда локально
4
Сжатие
Локальная 8–30B: убрать лишнее из тикета / лога. Меньше токенов уйдёт в API
5
Локальный ответ
Типовые вопросы — локальная 30B. Низкая уверенность → эскалация
6
Большая по API
Только сложное: 10–30% запросов, с полным контекстом и кэшем
Что это даёт
Счёт за API падает в 3–10 раз: большая модель видит меньше запросов и меньше токенов в каждом
Чувствительные данные (PII, внутренние логи) вообще не покидают контур
Латентность на типовых запросах ниже: локальная малая модель отвечает за доли секунды
Чем платим
Железо (одна видеокарта 16–32 GB) и человек, который её обслуживает
Больше движущихся частей: каждый этап нужно измерять на тестовом наборе, иначе не видно, где теряется качество
Малая модель ошибается чаще — поэтому она фильтрует и готовит, а не принимает финальных решений
11
Что можно отдать локальным малым моделям
По убыванию очевидности выгоды. Первые четыре строки — почти всегда локально; последние две — считать
| Задача | Локальная модель (размер) | Что экономим по сравнению с API | Железо |
| Эмбеддинги и реранкинг для поиска | Qwen3-Embedding 0.6B, bge-m3, bge-reranker (0.6B) | 100%: API-эмбеддинги стоят копейки, но при переиндексации миллионов чанков и каждом запросе — складывается; плюс данные не уходят | CPU или любая GPU |
| Фильтр атак, поиск PII, модерация | Llama Guard 4 (1B), Prompt Guard (86M), GLiNER, Presidio | Отдельный вызов большой модели «проверь, безопасно ли» — не нужен; PII не уходит провайдеру | CPU |
| Классификация и роутинг тикетов | Qwen3.5-2B/4B, Phi-4-mini | Типовые вопросы (30–60% потока) вообще не доходят до API | GPU 8 GB |
| Речь: транскрипция и озвучка | GigaAM-v3 (русский), Whisper-turbo, Parakeet; Kokoro, Piper | API STT $0.006–0.01/мин: 100 ч созвонов в мес ≈ $60; локально — бесплатно, GigaAM-v3 хватает и CPU | CPU или GPU 8–16 GB |
| Скриншоты и сканы (vision, OCR) | Qwen3-VL 4–8B, DeepSeek-OCR, Gemma 4 | Картинка = 1.3–2K токенов входа + описание на выходе. При тысячах картинок в день — сотни $/мес (расчёт далее) | GPU 16 GB |
| Сжатие контекста перед API | Qwen3.8-27B, Qwen3.5-9B | Тикет с перепиской на 20K токенов → выжимка на 2K: −80% входных токенов на дорогой модели | GPU 16–24 GB |
| Черновой ответ на типовой вопрос | Qwen3.8-27B, gpt-oss-20b | Половину ответов пишет локальная модель; на API уходит только то, где она не уверена | GPU 24–32 GB |
Правило: локальная модель готовит, фильтрует и отвечает на простое; большая по API — решает сложное. Каждый этап измеряем отдельно
12
Расчёт: скриншоты — API или локально?
Пример расчёта: описываем скриншоты ошибок из тикетов для поиска и роутинга. Сравниваем API и свою видеокарту с учётом железа, электричества и поддержки
Стоимость через API (Sonnet-ярус)
Картинка 1 500×1 000 px ≈ 1.94K токенов входа (патчи 28×28 px, ярус high-res — картинка не сжимается) + инструкция 0.3K + ответ 0.3K
≈ $0.0045 вход + $0.003 выход ≈ $0.0075 за скриншот
200 скриншотов/день → $45/мес. 2 000/день → $450/мес. 10 000/день → $2 250/мес
Локально: Qwen3-VL-8B на RTX 5060 Ti 16 GB
Железо $585, амортизация 24 мес → $24/мес; электричество ~150 Вт → ~$25/мес; поддержка ~2 ч/мес → ~$100/мес
Итого ≈ $150/мес независимо от объёма — вплоть до ~30 000 картинок/день (1–2 с на картинку)
Качество описания скриншота у 8B-модели для роутинга и поиска — достаточное; для тонкого анализа UI — хуже, чем frontier
Точка безубыточности ≈ 670 скриншотов/день. Ниже — API проще и дешевле; выше — локальная модель окупает карту за первый месяц
Допущения: токены на картинку по правилу Anthropic (патчи 28×28 px; ярус high-resolution для Claude 4.7+, кэп 4 784 токена); цены Sonnet 5 $2/$10 по прайсу Anthropic на 8 сентября 2026; ставка инженера $50/ч. Своя карта заодно обслуживает эмбеддинги и STT
13
РАЗДЕЛ 3
03
Поиск по нашим данным
Эмбеддинги находят по смыслу, реранкеры выбирают точно. Как заставить модель отвечать по нашим данным — и хелпдеск как живой пример
14
Что такое эмбеддинг
Обычный поиск ищет слова. Эмбеддинги ищут смысл: «сервер не отвечает» найдёт «хост недоступен по SSH»
1
Текст
«Не могу подключиться к базе после обновления»
2
Embedding-модель
Маленькая нейросеть (0.3–8B) читает текст и выдаёт вектор — список из 256–4 096 чисел
3
Вектор
[0.12, −0.83, 0.44, …]. Смысл закодирован в числах: близкие по смыслу тексты → близкие векторы
4
Поиск
Вопрос тоже превращаем в вектор и ищем ближайшие среди миллионов — за миллисекунды
Где применяется
RAG: найти нужные фрагменты базы знаний и подать их LLM
Поиск похожих тикетов: «такое уже решали?» — по смыслу, а не по словам
Кластеризация и дедупликация: сгруппировать 10 000 обращений по темам без ручной разметки
Классификация без обучения: сравнить вектор тикета с векторами описаний категорий
Не только текст: есть модели для картинок, аудио, кода — и мультимодальные (текст и картинка в одном пространстве)
Что важно знать
Векторы разных моделей несовместимы: сменили модель — переиндексируем всё
Дёшево: модель на 0.6B на карте 16 GB делает ~1 000 фрагментов в секунду; миллион документов — минуты
Ищет смысл, но плохо — точные строки: коды ошибок, ID, имена функций. Поэтому нужен гибрид с обычным поиском (дальше)
У части моделей вектор можно укоротить без переиндексации: 1024 → 256 чисел, −75% места, −2% качества
15
Реранкер и гибридный поиск
Векторный поиск быстрый, но грубый. Два дешёвых приёма поднимают точность на 10–25% без смены модели
1
Запрос
Вопрос пользователя, при необходимости переформулирован малой LLM
2
Смысловой поиск
Эмбеддинг → векторная база. Ловит синонимы и перефразировки. Берём топ-50
3
Словарный поиск (BM25)
Классический поиск по словам: точные коды ошибок, ID, имена. Берём топ-50
4
Слияние (RRF)
Объединяем два списка простой формулой по позициям — без настройки весов
5
Реранкер
Модель читает пару «вопрос + фрагмент» целиком и ставит точную оценку. Топ-5 идут в LLM
Почему гибрид: Для embedding-модели «ERR_4012» — просто набор символов, смысла нет. Словарный поиск найдёт его точно. Вместе — покрывают слабости друг друга
Что такое реранкер: Embedding-модель кодирует вопрос и документ по отдельности (быстро, но приблизительно). Реранкер смотрит на них вместе (медленно, но точно) — поэтому применяем только к топ-50
| Реранкер | Тип | Замечания |
| bge-reranker-v2-m3 (568M) | открытый, Apache 2.0 | Стандарт де-факто; многоязычный; работает на CPU |
| Qwen3-Reranker 0.6B / 4B / 8B | открытый, Apache 2.0 | Пара к Qwen3-Embedding; настраивается инструкцией; лучше на коде |
| Cohere Rerank 3.5 / Voyage rerank-2.5 | API | $2 за 1 000 запросов; без инфраструктуры |
Векторные базы (Qdrant, pgvector, Milvus…) и таблица embedding-моделей — в раздатке. Практика: Postgres — источник правды, Qdrant — только векторы
16
Кейс: RAG-хелпдеск (pumba) — как это работает
База быстрых ответов, очищенные тикеты, внутренняя и клиентская wiki, код backend → один поисковый индекс → модель отвечает по найденному
1
Очистка
4 источника → чистый текст
2
Чанкинг
Текст → фрагменты + метаданные
3
Postgres
Источник правды
4
Qdrant
Векторы, быстрый поиск
5
Reranker
Топ-50 → топ-5
6
LLM
Ответ с цитатами
| Шаг | Что происходит | Зачем | Что даёт |
| 1. Очистка | Четыре источника: база быстрых ответов; тикеты клиентов, очищенные от персональных данных, подписей и цитат; внутренняя и клиентская wiki без устаревших версий и дублей; исходный код backend — README, конфиги, комментарии | Модель отвечает по тому, что нашла. Мусор в индексе = уверенный ответ по устаревшей статье | Ответы по актуальному; PII не попадает ни в индекс, ни в API |
| 2. Чанкинг | Режем документы на фрагменты 300–800 токенов с перекрытием; код — по функциям. К каждому прикрепляем заголовок, путь, дату, продукт | Модель не может прочитать всю базу за раз — нужны кусочки размером с ответ на один вопрос. Метаданные нужны для фильтров и ссылок | Точные попадания вместо «где-то в этом документе»; ссылка на конкретное место |
| 3. Postgres | Храним все фрагменты с версиями и правами доступа; при обновлении статьи меняем только её фрагменты | Единственное место, где данные «настоящие». Отсюда можно переиндексировать что угодно; из векторной базы обратно — нельзя | Можно менять чанкинг, embedding-модель или векторную БД без потери данных |
| 4. Qdrant + bge-m3 | Каждый фрагмент прогоняем через bge-m3 → два вектора (смысловой и «словарный»). Вопрос кодируем так же и ищем ближайшие 50 с фильтром по продукту / дате | Обычный поиск ищет слова, смысловой — синонимы и перефразировки; словарный вектор нужен для кодов ошибок и ID | Кандидаты за миллисекунды из миллионов фрагментов; «сервер не отвечает» находит «хост недоступен» |
| 5. Reranker | bge-reranker читает пары «вопрос + фрагмент» целиком и ставит точную оценку; оставляем 5 лучших | Векторный поиск быстрый, но приблизительный; реранкер точный, но медленный — поэтому только на топ-50 | +10–25% точности; в модель уходит меньше токенов → дешевле и меньше шума |
| 6. LLM | 5 фрагментов + вопрос + инструкция «отвечай только по контексту, ставь ссылки» → ответ | Модель ничего «не знает» о наших продуктах — знает только то, что ей подали. Цитаты = проверяемость | Ответ за десятки секунд со ссылкой; оператор проверяет источник, а не верит на слово |
Шаги 1–5 работают локально на одной карте 16 GB (или CPU) — $0 за запрос. Только шаг 6 стоит денег, если LLM берём по API
17
Кейс pumba: что даёт и когда это имеет смысл
RAG — не универсальное решение. Он окупается на определённом типе вопросов и требует ухода за данными
Что даёт
Ответ на типовой вопрос за десятки секунд вместо минут поиска по вики и старым тикетам
Черновик ответа оператору: он проверяет и отправляет, а не пишет с нуля
Автоответ на самые частые вопросы — без человека
Единый поиск по трём источникам сразу: тикеты, вики, код
Знание не уходит с уволившимся сотрудником — оно в индексе
Каждый ответ с ссылкой на источник → можно проверить и исправить статью
Когда имеет смысл
Много повторяющихся вопросов, ответы на которые уже где-то записаны
База знаний большая и живая: людям трудно найти, но ответ есть
Данные внутренние или чувствительные — модель по API их не знает и не должна получить целиком
Ответы должны быть проверяемы (ссылка на источник), а не «модель так думает»
Нужна актуальность: обновили статью — ответы изменились сразу, без переобучения
Когда не имеет смысла
Ответов нет в документах — RAG не сочинит решение, он только находит записанное
Вопросы уникальные, каждый раз новые — поиск не поможет, нужен человек или агент с доступом к системам
База знаний маленькая (< 50 страниц) — проще положить всё в контекст модели целиком
Никто не ухаживает за данными — через полгода индекс полон устаревшего и доверие к ответам падает
Не заменяет права доступа: фрагменты нужно фильтровать по тому, кому можно их видеть
Стоимость: очистка, эмбеддинги, реранкер — локально, $0/запрос; LLM по API (Sonnet-ярус) ≈ $0.01–0.02 за ответ, или локальная 30B для приватных данных
18
Кейс pumba: как это выглядит
Слева — AI-помощник отвечает по базе знаний и ссылается на тикет; справа — подсказка оператору внутри обращения, «Вставить в ответ»
AI-помощник
Вопрос с приложенным скриншотом ошибки → причина, шаги исправления и ссылка на похожий тикет
Два режима: «Простая» модель для типовых вопросов и «Думающая» для сложных
Подсказка оператору
Внутри обращения: ответ по документации с номерами источников, «Уточнить» и «Вставить в ответ»
Оператор проверяет источник и отправляет, а не пишет с нуля
Снимки — интерфейс хелпдеска pumba, сентябрь 2026
19
РАЗДЕЛ 4
04
Речь: STT и TTS
Транскрипция созвонов, голосовые боты — и переводчик в кармане без интернета
20
STT: речь → текст
Speech-to-Text (ASR). Нет одного победителя — есть лучший под задачу: точность, языки, задержка, размер
Что это
Модель слушает аудио и выдаёт текст, часто с пунктуацией и временными метками. Качество меряют WER (доля ошибочных слов): на русском колл-центре GigaAM-v3 даёт ~10%, Whisper-large-v3 — ~24% (карточка GigaAM-v3 на Hugging Face). Рядом всегда работают помощники: VAD (детектор речи — режет тишину) и диаризация («кто говорил»).
Зачем нам — примеры применения
Транскрипция созвонов → LLM делает саммари и задачи в тикет
Голосовые сообщения клиентов → текст → обычный пайплайн хелпдеска
Субтитры и поиск по записям встреч и обучающих видео
Голосовой ввод для операторов и в мобильных приложениях
Первый шаг любого голосового бота и переводчика
| Модель | Заметки |
| Whisper large-v3 / v3-turbo | OpenAI, открытый. 99 языков, универсал; turbo в 6 раз быстрее. 1.5B / 0.8B |
| NVIDIA Parakeet TDT v3 | Потоковый, очень быстрый (>2 000× реального времени), 25 языков. 0.6–1.1B |
| NVIDIA Canary-Qwen 2.5B | Лидер по точности на английском; хорошая пунктуация |
| Sherpa-ONNX Zipformer | Потоковые модели 26–188 MB на язык; SDK для Android / iOS |
| GigaAM-v3 (Сбер) | MIT, 220M. Лучшая открытая для русского: колл-центры, шум; пунктуация; ONNX → CPU и телефон |
| API: OpenAI, Deepgram, AssemblyAI | $0.006–0.01/мин; потоковый режим, диаризация, форматирование |
Локально или API? Ограничения
Локально: русский — GigaAM-v3, остальные языки — Whisper-turbo / Parakeet; карта 8–16 GB или CPU. 100 ч созвонов/мес по API ≈ $60, локально $0
API — если нужен потоковый режим «из коробки» и нет железа
Ограничения: акценты, термины, наложение голосов; доменные слова — словарь-подсказка или правка через LLM
Источники: Hugging Face Open ASR Leaderboard, Northflank / AssemblyAI обзоры, август 2026. DeepSpeech и Coqui STT — мертвы, не используем
21
TTS: текст → речь
Text-to-Speech. От 82-миллионных моделей на процессоре до клонирования голоса по трёхсекундному образцу
Что это
Модель превращает текст в звук. Современные TTS звучат почти как человек, умеют эмоции и паузы, а многие — клонировать голос по короткой записи (нужно согласие человека!). Натуральность меряют слепыми сравнениями (TTS Arena, рейтинг Elo). Для диалога важна потоковая выдача: первый звук через 200–400 мс, а не после всего текста.
Зачем нам — примеры применения
Голосовой бот или IVR на базе хелпдеска
Озвучка инструкций и обучающих материалов
Уведомления, доступность (чтение интерфейса)
Последний шаг переводчика и любого голосового ассистента
| Модель | Заметки |
| Kokoro-82M | Apache 2.0. 54 голоса, 8 языков; работает в реальном времени на CPU; без клонирования |
| Chatterbox / Turbo | MIT. Клон с 5 сек, 25 языков, теги [laugh], [sigh]; Turbo — 75 мс задержки |
| Qwen3-TTS 1.7B | Apache 2.0. Клон за 3 сек, «дизайн голоса» по текстовому описанию, эмоции |
| Fish Audio S2 Pro | Открытые веса; очень натуральный |
| Piper | MIT. Крошечный, Raspberry Pi; есть русские голоса |
| Silero TTS | Лучший лёгкий русский; CC-BY-NC — только некоммерчески |
| API: ElevenLabs, OpenAI, Cartesia | Эталон качества; $15–30 за 1M символов |
Локально или API? Ограничения
Локально: Kokoro или Piper на CPU — для уведомлений и ботов более чем достаточно; Chatterbox / Qwen3-TTS на GPU — для клонирования и эмоций
API: когда нужен голос «как в рекламе» и объём небольшой
Ограничения: русский у открытых моделей заметно хуже английского; клонирование — только с согласия
Источники: TTS Arena V2, Pinggy / BentoML / Modal обзоры, август 2026
22
Кейс: офлайн-переводчик на телефоне
Каскад из трёх маленьких моделей на Snapdragon 8 Elite — против одной облачной модели «речь → речь»
1
Микрофон + VAD
Silero VAD (~2 MB) режет тишину; push-to-talk как запасной вариант
2
STT на устройстве
Sherpa-ONNX Zipformer, 26–188 MB на язык; Whisper-small как альтернатива
3
Перевод
NLLB-200-distilled-600M или Opus-MT en↔ru (~300 MB). Вариант «умнее»: малая LLM Qwen3-1.7B/4B в Q4
4
TTS
Android TTS / Piper / Kokoro. Наушники или «mute mic during TTS», иначе переводит сам себя
Локальный каскад
Задержка 1–3 с на фразу; всё на устройстве, $0, работает в роуминге и метро
Точность перевода средняя (NLLB) — контекст фразы теряется; вариант с малой LLM лучше, но тяжелее
Готовый пример: InstantVoiceTranslate (open source, Android) — ровно этот стек
Облачная альтернатива: GPT-Realtime-Translate
Речь → речь напрямую, задержка ~0.3–0.5 с, сохраняет интонацию, перевод точнее
$0.034/мин — тишина тоже тарифицируется, поэтому VAD обязателен; ≈ $2 за час разговора
Нужен интернет; ключ прячем за своим backend
Тот же каскад STT → (LLM) → TTS — основа любого голосового бота; переводчик — частный случай
23
РАЗДЕЛ 5
05
Зрение и генерация
Модели, которые видят, читают документы и рисуют. И почему зрение — одна из самых выгодных задач для локальных моделей
24
VLM: модели, которые видят
Vision-Language Model — LLM с «глазами»: на вход картинка (или кадры видео) + текст, на выход текст
Что это
К языковой модели пристроен визуальный кодировщик: картинка превращается в ~1–1.6K токенов и читается вместе с текстом. Модель может описать скриншот, прочитать график, ответить на вопрос по фото, найти объект по описанию. Все frontier-модели (Claude, GPT, Gemini) мультимодальны; открытые VLM есть от 2B до 235B.
Зачем нам — примеры применения
Скриншот ошибки в тикете → что на нём, какая ошибка, к какой категории отнести
Проверка интерфейса после деплоя: «на этом экране есть кнопка сохранения?»
Разбор графиков мониторинга и дашбордов словами
Сравнение макета и реализации; описание картинок для поиска и доступности
Видео: понять, что происходит в записи экрана (пока в основном по API)
| Модель | Заметки |
| Qwen3-VL 2B–235B | Apache 2.0. Лучшая открытая линейка; 4–8B — рабочий вариант для карты 16 GB |
| Gemma 4 (vision) | Google, открытая; малые размеры для устройств |
| Llama 4 Maverick / Scout | Meta, MoE, длинный контекст с картинками |
| Kimi K2.6 / K3 | Открытые; понимают видео (K2.6 — пока по API) |
| API: Claude, GPT-5.6, Gemini 3.1 | Самое точное понимание сложных экранов и схем |
Локально или API? Ограничения
Локально выгодно: картинка по API стоит как ~1.9K токенов текста + ответ ≈ $0.0075; при сотнях–тысячах картинок в день своя карта окупается за месяц (расчёт в разделе 2). Qwen3-VL-8B на 16 GB: 1–2 с на картинку
API нужен для тонкого анализа: мелкий текст, сложные схемы, видео
Ограничения: мелкие детали и точные координаты даются хуже; на очень больших изображениях режем на части
Прежде чем звать VLM по API — локальная 8B-модель описывает картинку, и дальше работаем с текстом, который в 10 раз дешевле
25
OCR и документы
Сканы, PDF, счета, таблицы, формулы → структурированный текст. Отдельный класс: точность и цена другие, чем у общей VLM
Что это
Классический OCR (Tesseract) распознаёт буквы построчно. Современные модели документов (DeepSeek-OCR, PaddleOCR-VL) понимают структуру страницы: колонки, таблицы, подписи, формулы — и отдают Markdown или JSON. DeepSeek-OCR ещё и сжимает страницу в ~10 раз меньше токенов, чем её текст, при точности 97% (статья DeepSeek, октябрь 2025) — дешёвый способ загрузить в LLM много документов.
Зачем нам — примеры применения
Сканы инструкций и старые PDF → база знаний хелпдеска (RAG)
Счета, договоры, акты → JSON с полями → бухгалтерия и CRM
Каталоги и спецификации с таблицами → поиск по параметрам
Скриншоты логов и консолей в тикетах → текст, который можно искать
Формы и анкеты от клиентов → автоматический ввод
| Модель | Заметки |
| DeepSeek-OCR | Открытая. Таблицы, формулы, схемы, ~100 языков; лучшая по цене за страницу |
| PaddleOCR-VL / MinerU | Открытые конвейеры «PDF → Markdown» с разметкой структуры |
| Tesseract | Классика, CPU, бесплатно; для чистых сканов печатного текста |
| Qwen3-VL (в режиме OCR) | Универсальная VLM справляется с большинством документов |
| API: Mistral OCR, Azure Document Intelligence, Google Document AI | $1–3 за 1 000 страниц; готовые схемы для счетов и форм |
Локально или API? Ограничения
Локально: DeepSeek-OCR или Qwen3-VL-8B на 16 GB — секунда-две на страницу; 10 000 страниц в день — не проблема. Архив на 1M страниц по API ≈ $1–3k, локально — электричество
API: рукописный текст, редкие языки, готовые шаблоны (счёт, паспорт)
Ограничения: рукопись и плохие сканы; после OCR всегда прогоняем через валидацию (суммы сходятся? даты в диапазоне?)
Связка с разделом 3: OCR — это первый шаг очистки для документов, которые попадают в базу знаний
26
Генерация картинок, видео и музыки
Диффузионные модели: из шума «проявляют» картинку под управлением текста. Полезно для маркетинга, документации, игр — и важно знать границы
Картинки
Открытые: FLUX.2, Stable Diffusion 3.5, Qwen-Image, Kandinsky 5.0 (русский промпт, кириллица на картинке). Весят 6–30 GB, 5–20 с на картинку на карте 16–24 GB
API: gpt-image-2, Imagen 4, Midjourney — $0.02–0.20 за картинку, лучшее понимание сложных промптов
Новое поколение хорошо пишет текст на картинке и правит существующую по инструкции («убери фон, добавь логотип»)
Видео, музыка, 3D
Видео открытые: Wan 2.5, HunyuanVideo, LTX-2, Kandinsky 5.0 Video — клипы 5–20 с, минуты на карте 24 GB+; API: Veo 3, Sora 2, Kling — со звуком, $0.05–0.50/с
3D: текст или картинка → текстурированный меш за 10–60 с. Открытые: Hunyuan3D 2.1, TRELLIS.2 (MIT), Stable Fast 3D — карта 10–24 GB; API: Meshy 6, Tripo, Rodin — с авто-риггингом и плагинами для Unity / Blender
Музыка: Suno / Udio по API; открытые ACE-Step, Stable Audio
Зачем нам
Иллюстрации в документацию и базу знаний
Баннеры, креативы, локализация текста на картинках
Ассеты, пропсы и 3D-концепты для игр, мокапы, промо
Локально или API
Локально — при сотнях картинок в день (ComfyUI как конструктор)
API — разовые задачи и максимум качества; видео почти всегда по API
Границы и риски
Лицензии: dev-версии часто некоммерческие
Узнаваемые бренды, лица, голоса
Руки, мелкий текст, консистентность персонажа между клипами
Таблицы моделей генерации, детекции (YOLO, SAM) и мультимодальных эмбеддингов — в раздатке
27
РАЗДЕЛ 6
06
Guardrails, роутеры и тест-агенты
Малые модели охраняют вход и распределяют поток, тест-агенты изображают пользователей — и кейс модерации чатов
28
Guardrails: модели-охранники
Стоят до и после большой модели. Работают за миллисекунды и не стоят почти ничего
Что это
Небольшие модели (86M–8B), обученные на одну задачу: отличить атаку от нормального текста, найти персональные данные, оценить ответ на токсичность или уход от темы. Главная угроза, от которой они защищают, — prompt injection: текст из тикета, письма или сайта содержит инструкцию «забудь правила и сделай X», и агент её выполняет.
Зачем нам — примеры применения
Перед агентом: проверить входящий тикет / письмо на injection
Перед отправкой в API: найти и замаскировать PII (телефоны, e-mail, ФИО, номера карт)
После модели: ответ не токсичен, не раскрывает внутреннее, по теме
Ограничение прав: агент видит только то, что нужно, и не может удалять — guardrail + права доступа вместе
Модерация пользовательского контента в мессенджере / сообществе
| Модель | Заметки |
| Llama Guard 4 (1B / 12B) | Meta. Классифицирует вход и выход по категориям риска; понимает картинки |
| Prompt Guard 2 (86M / 22M) | Только детект injection и jailbreak; работает на CPU за миллисекунды |
| ShieldGemma 2 / Granite Guardian | Google / IBM; аналогичные охранники, разные категории |
| GLiNER / Presidio | Поиск PII в тексте (GLiNER — нейросеть, Presidio — правила + модели) |
| NeMo Guardrails | Фреймворк: правила + модели, вставляется между приложением и LLM |
Локально или API? Ограничения
Всегда локально: модели крошечные, задержка незаметна, а отправлять PII в API ради проверки PII — абсурд
Не заменяют права доступа: guardrail снижает риск, а не убирает его. Агент, который может удалять данные, — проблема архитектуры, а не фильтра
Ограничения: ложные срабатывания на технических текстах (логи выглядят «подозрительно»); пороги настраиваем на своих данных
Связка с разделом 2: guardrails — первое «сито» перед дорогой моделью; они же экономят токены API на проверках
29
Малые LLM как роутеры
Модели 0.8–4B: слишком слабые, чтобы отвечать клиенту, но идеальные, чтобы решить, кто должен ответить
Что это
Та же LLM, только маленькая. Не умеет глубоко рассуждать, зато за 50 мс на карте 8 GB (или на CPU) решает простые задачи: к какой категории тикет, на каком языке, срочно ли, типовой ли вопрос, какие поля извлечь. Раньше под каждую такую задачу обучали отдельный классификатор — теперь одна малая модель с инструкцией закрывает десяток.
Зачем нам — примеры применения
Роутинг: тикет → очередь, приоритет, продукт — до попадания к человеку или большой модели
«Типовой или нет?» — типовые отвечает локальная модель, остальное идёт в API
Извлечение полей из письма: номер заказа, версия, ОС → JSON
Определение языка и тональности; выявление дублей обращений
Сжатие: длинный тред → выжимка на 200 слов перед дорогой моделью
| Модель | Заметки |
| Qwen3.5 0.8B / 2B / 4B | Apache 2.0; лучшие малые для многоязычных задач |
| Phi-4-mini (3.8B) | Microsoft; 128K контекст; работает без GPU |
| Gemma 4 small | Google; для устройств и телефонов |
| gpt-oss-20b (MoE, 3.6B актив.) | OpenAI; помещается в 16 GB; сильнее на рассуждении |
| Обученные классификаторы (BERT-класса) | Если задача одна и данных много — ещё быстрее и точнее, но нужно обучать |
Локально или API? Ограничения
Всегда локально: в этом весь смысл. Карта 8–16 GB обслуживает тысячи запросов в минуту
Оценка качества обязательна: 200 размеченных примеров → точность роутера. Если < 90% — добавляем примеры в инструкцию или дообучаем
Ограничения: сложные многоступенчатые правила, редкие категории, длинные документы — там ошибается; передаём выше по ярусу
30
Кейс: модерация чатов сообщества — каскад
Go-ядро + React-админка, первая площадка Telegram (ядро о мессенджере не знает). Ни одно сообщение не идёт сразу в LLM: этапы по возрастанию цены, первый сработавший «держит»
1
0 · Медиа → текст
Голос → транскрипт (GigaAM-v3 локально), картинка → текст + визуальные скоры. Только для новых авторов; результат кэшируется по ID файла — один спам-стикер шлют массово
2
1 · Правила, без ИИ
Блок-листы, regex, антифлуд, эвристики новичков; нормализация обфускации («kриптa», «заааайм», zero-width). Отсекает основную массу спама бесплатно
3
2 · Moderation API
Специализированный классификатор (OpenAI Moderation / Perspective) за интерфейсом; сейчас заглушка — можно включить без переписывания
4
3 · LLM
Только серая зона: завуалированный скам («пиши в личку»), сарказм, социнженерия, кастомные правила чата. Вход — сообщение + контекст беседы, выход — строгий JSON
Не «да/нет», а вектор скоров и два порога
Каждый этап отдаёт скоры по категориям: spam, scam, toxicity, hate, harassment, nsfw, off_topic, nsfw_visual, violence_visual
На категорию два порога: выше auto_block — автоблок; между review и auto_block — очередь оператору; ниже — пропуск
Один слайдер с двумя ручками покрывает всё от полного автомата до полностью ручного режима
Что это даёт
Самая дешёвая и предсказуемая часть системы — не ИИ. LLM включается только там, где правила принципиально не справляются
Голосовые и «кружки» — частый спам-паттерн новых аккаунтов: транскрипт вливается в текстовый пайплайн и скорится как обычный текст
Тот же каскад «дёшево → дорого», что и в регионе 2, — только для модерации
Заказчик — сообщество поддержки: истории в личку боту, вопросы к аудитории, предупреждения; групповые чаты чистим от спама, скама и токсичности
31
Пять классов ИИ в одном проекте
Каждый выбран по критерию «дешевле и надёжнее для своей задачи», а не «потому что LLM модно»
| Класс | Что делает в проекте | Почему именно он | Класс моделей |
| Детерминированные алгоритмы | Нормализация обфускации (гомоглифы, leetspeak, растягивание); стоп-слова; балльный классификатор «вопрос vs история»; детекторы «2–3 автора заняли >50% чата», «всплеск ≥10 событий за 30 мин» | Бесплатно, мгновенно, предсказуемо. Одна функция Skeleton() к тексту и к блок-листу — стоп-слово ловит все написания | Малые локальные (2) |
| Локальная ASR | Отдельный контейнер GigaAM-v3 в ONNX + Silero VAD: голосовые и «кружки» → текст. На CPU в 30 раз быстрее реального времени | Русская речь, данные не покидают периметр, дешевле и приватнее, чем слать аудио в облачную LLM | Речь (4) |
| Мультимодальная модель | Два узких «агента» на одной VLM: OCR-агент вытаскивает текст с мемов и скам-скринов; vision-агент отдаёт JSON {nsfw_visual, violence_visual} | Дальше нужен не «смысл картинки», а число для порога. Промпт запрещает выполнять инструкции с картинки | Зрение (5) |
| LLM в пяти ролях | Классификатор со structured output (moderator, analyst) · движок диалога с конечным автоматом (story-бот) · конвейер writer → reviewer → editor → corrector · заземлённый ассистент админки · генератор тестовых данных | Одна модель (GLM-5.2 через один сайдкар), 11 агентов = 11 системных промптов. Ключ живёт только в сайдкаре | LLM (1) |
| LLM как инструмент разработки | Код пишут агенты Claude Code; роли: планирование — сильная модель, бойлерплейт — дешёвая. В сессии уходят только код и синтетика — не данные чатов и не ключи | Граница данных — часть архитектуры, а не пожелание | — |
Пять классов, выстроенные по цене: регулярки → локальная ASR → мультимодальный классификатор → LLM-классификатор → LLM-агенты
32
Тест-агенты вместо людей
Как обкатать модерацию без живых людей — синтетический чат с персонажами разного характера
Что сделали
Dev-агент storyteller роль-плеит пользователя: simulate-story --persona shy --turns 8 --abandon — «неохотный рассказчик», который бросает диалог на середине
Несколько персонажей в одном чате: вежливый «спасатель» с приглашением в личку, саркастичный интеллектуал, прямой хам
Для CI — детерминированный симулятор без сети (internal/storysim): воронка прогоняется на каждом коммите
Что это проверяет
Скрытую агрессию: сарказм «какая бескорыстная забота» без единого стоп-слова — правила не ловят, LLM-классификатор с контекстом реплаев ловит
Прямую токсичность — должна отсечься ещё правилами
Shadow-режим: новый промпт или порог считает скоры на живом потоке, но ничего не блокирует — сравниваем с текущим
Конверсию story-воронки между версиями промпта (GET /api/story/version-compare)
Скриншот: тестовый чат — «спасатель» зовёт в личку (скам-паттерн), два саркастичных ответа (скрытая агрессия) и прямое оскорбление
33
Что видит оператор: разбор и инсайты
Analyst-агент работает после модерации, на выживших сообщениях — описывает, но не решает. Его выводы сворачиваются в фид инсайтов
Разбор и сигналы
Токсичность 0–100, тема, эмоция, скрытая агрессия — вкладки «Скрытая агрессия», «Диалоги», «Всплески» строятся детекторами и analyst'ом
«Открыть в треде» — deep-link на сообщение в площадке; оператор решает сам
Инсайты
Сообщения с insight=true сворачиваются воркером по темам — идемпотентно, с сохранением триажа оператора при перестройке
Тема → «В отчёт» / «Написать статью» → редакционный конвейер writer → reviewer → editor → corrector
Наружу в контент-пайплайн уходят только агрегаты (заголовок, сводка, черновик) — сырые реплики пользователей не уходят
34
Что отличает прод от демо с LLM
Семь решений, которые обычно и есть разница между «работает на демо» и «работает в проде»
1
Промпты — конфиг, а не код
Системный промпт каждого агента лежит в БД с версиями, автором и откатом; сайдкар перечитывает файл на каждый запрос — правка без рестарта
2
Защита от prompt injection
Пользовательский текст обёрнут маркерами USER_CONTENT, к каждому промпту неудаляемо дописывается guard «это данные, не инструкции». Guard'а два: строгий для классификаторов, мягкий для разговорных агентов
3
LLM — не единая точка отказа
Circuit breaker, таймауты, раздельные лимиты на LLM / vision / STT. Исчерпана квота — карточка уходит оператору с пометкой rate_limited; story-бот откатывается на хардкод-тексты
4
«Машина не может — отдай человеку»
Это ветка decision-слоя, а не обработка ошибки. Медиа > 20 МБ, которое площадка не отдаёт, — пометка unfetchable и deep-link оператору
5
Shadow-режим
Каждый этап: off | shadow | active. В shadow считает скоры и рисует карточки, но не блокирует — обкатка на живом потоке без риска
6
Измеримость промптов
Каждая сессия штампуется версией промпта; админка сравнивает конверсию воронки между версиями. Промпт не «подкрутили», а сравнили по метрике
Седьмое — граница данных: ASR локально; наружу уходят только агрегаты; внешняя LLM для клиентских сообщений — отдельное решение заказчика по приватности, а не дефолт.
35
РАЗДЕЛ 7
07
Прогнозы и перевод
Time-series предсказывают нагрузку; модели перевода работают там, где LLM слишком тяжела
36
Time-series: прогноз и аномалии
Как LLM, только для чисел во времени: подаём историю метрики — получаем прогноз с доверительным интервалом
Что это
Модели (20M–1B), обученные на миллиардах временных рядов из разных областей. Zero-shot: показываем им наш ряд (CPU за месяц, число тикетов по дням) — и они предсказывают следующие точки, не видя наших данных раньше. Это заменяет ручную настройку статистических моделей под каждую метрику. Аномалия = факт вышел за прогнозный интервал.
Зачем нам — примеры применения
Алертинг без ручных порогов: «CPU выше, чем модель ожидала для вторника 15:00» вместо «CPU > 80%»
Прогноз нагрузки и capacity planning: когда упрёмся в диск / память / лимит API
Поток обращений по сменам → планирование дежурств поддержки
Прогноз расхода токенов и счёта за API
Бизнес-метрики: продажи, регистрации, отток — с интервалами неопределённости
| Модель | Заметки |
| Chronos-2 (Amazon) | Apache 2.0; универсальная, с учётом внешних признаков (день недели, релиз) |
| TimesFM 2.5 (Google) | Открытая; сильная на длинных горизонтах |
| Moirai 2 (Salesforce) / TiRex | Открытые; TiRex — лидер на коротких горизонтах |
| Классика: Prophet, ARIMA | Бесплатно, объяснимо, но настраивать под каждый ряд |
| API: облачные сервисы (Amazon Forecast и т.п.) | Для тех, кто не хочет держать модель; для нас смысла мало |
Локально или API? Ограничения
Всегда локально: модели маленькие, CPU достаточно; данные — метрики, их и отправлять никуда не нужно
Встраивается рядом с Prometheus / Grafana: раз в час пересчитать прогноз по ключевым метрикам и выставить динамические пороги
Ограничения: редкие события (падение из-за релиза) не предсказать; короткая история (< 2 недель) даёт слабый прогноз; проверяем на истории, прежде чем доверять алертам
Недооценённый класс для DevOps: замена сотен ручных порогов в алертинге одной моделью
37
Машинный перевод
Отдельные модели перевода: в 10–100 раз меньше LLM, работают на телефоне, но хуже понимают контекст
Что это
Модели «текст на языке A → текст на языке B». Классические (NLLB-200, Opus-MT) — маленькие (300M–1.3B), быстрые, покрывают до 200 языков, но переводят по одному предложению без контекста. LLM переводят лучше — с учётом стиля, терминов и всей переписки — но дороже и медленнее. Speech-to-speech модели (SeamlessM4T, GPT-Realtime-Translate) переводят речь напрямую.
Зачем нам — примеры применения
База знаний на одном языке → ответы клиентам на их языке (RU / EN)
Локализация интерфейса и документации — черновик, который правит человек
Переводчик на телефоне без интернета (кейс из раздела 4)
Перевод входящих обращений для операторов, не знающих языка
Субтитры к записям созвонов на другом языке
| Модель | Заметки |
| NLLB-200 (Meta), distilled 600M / 1.3B | 200 языков, включая русский; CC-BY-NC |
| Opus-MT (Helsinki-NLP) | Попарные модели ~300 MB; свободная лицензия; en↔ru отличные |
| Tower / GemmaX / Qwen3.8-27B как переводчик | LLM-подход: контекст, термины, стиль; лучше для документов |
| SeamlessM4T v2 (Meta) | Речь ↔ речь и текст, 100 языков; CC-BY-NC |
| API: DeepL, Google Translate, GPT-Realtime-Translate | DeepL — эталон для европейских языков; $20–25 за 1M символов |
Локально или API? Ограничения
Локально: Opus-MT / NLLB для массового и офлайн; малая LLM (9–27B) для качественного перевода документов с глоссарием
API: DeepL, когда объём небольшой и нужно максимальное качество без возни
Ограничения: термины и названия продуктов — нужен глоссарий; NLLB теряет контекст между предложениями
38
Итоги
Модель — не только чат: семь классов моделей, у каждого своя задача, размер и цена
Открытые модели догнали закрытые — выбор «API или своё» теперь про данные, объём и операционку
Локальный запуск упирается в память: карта 16 GB закрывает весь поисковый стек, STT, vision и роутинг; 128 GB — модели 70–120B
Главная экономия — не в замене большой модели, а в том, чтобы 70–90% рутины до неё не доходило: guardrails, роутер, поиск, сжатие, локальная vision
Считаем честно: железо + электричество + люди + цена ошибок; точка безубыточности есть, и она не всегда на нашей стороне
Качество RAG на 80% — данные, чанкинг, гибридный поиск, реранкер; LLM меняем последней
Вопросы?
39