Зоопарк ИИ в 2026

Раздатка к докладу для команды · справочные таблицы моделей, цен, железа и практических правил · данные на сентябрь 2026 · v1.3

Данные актуальны на 1–8 сентября 2026; цены Anthropic и DeepSeek, параметры Kimi K3 и память GLM-5.2 перепроверены 8 сентября 2026 (см. «Источники»). Названия версий и цены меняются ежеквартально — перед принятием решений проверяйте на сайтах вендоров.

Содержание: 1. Словарь · 2. LLM: ярусы, цены, российские модели, память и железо · 3. Экономия: делегирование малым моделям и расчёт стоимости · 4. Поиск: эмбеддинги, реранкеры, векторные базы, уроки RAG · 5. Аудио: STT, TTS, утилиты · 6. Зрение и генерация · 7. Guardrails и малые LLM · 8. Time-series и перевод · 9. Ollama: установка и API · 10. Источники

1. Словарь

ТерминЧто это
МодельПрограмма + огромная таблица чисел («веса»), обученная на данных. Не база знаний и не поисковик — она «угадывает» ответ по закономерностям
Параметры (B)Размер этой таблицы. 8B = 8 миллиардов чисел. Больше — умнее, но нужно больше памяти и денег. Диапазон сегодня: от 0.1B до 2 800B
ТокенЕдиница текста, ~¾ слова (для русского — ближе к ½ слова). Модели читают и считают деньги в токенах: страница A4 ≈ 700 токенов
Контекстное окноСколько токенов модель «видит» за раз: запрос, документы и её ответ. Сегодня 128K–1M токенов — сотни страниц. Реально полезно ~200K
Inference (инференс)Запуск обученной модели, чтобы получить ответ. Всё, что мы делаем, — это инференс; обучать модели мы не будем
Веса / open-weightФайл модели, который можно скачать и запустить у себя. Открытые веса ≠ open source: данные и код обучения обычно закрыты
APIДоступ к чужой модели по сети, оплата за токены. Быстрый старт, нет железа, но данные уходят провайдеру
КвантованиеСжатие весов (16 бит → 4 бита на число): модель занимает в 3–4 раза меньше памяти, теряя 1–3% качества
Dense / MoEDense — на каждый токен работают все параметры. MoE (Mixture of Experts) — сотни узких «экспертов», на токен активны 3–8%: скорость малой модели, память большой. Запись «744B-A40B» = всего / активных
ЭмбеддингПеревод текста (или картинки) в вектор чисел так, что близкие по смыслу тексты дают близкие векторы. Основа умного поиска
РеранкерМодель, которая читает пару «вопрос + документ» целиком и ставит точную оценку релевантности. Применяется к топ-50 кандидатов от векторного поиска
RAGRetrieval-Augmented Generation: сначала найти нужные документы поиском, потом дать их модели и попросить ответить по ним. Лекарство от выдумывания
GuardrailМаленькая модель-фильтр до или после LLM: детект prompt injection, поиск PII, модерация
Prompt injectionТекст из тикета, письма или сайта содержит инструкцию «забудь правила и сделай X», и модель её выполняет. Главная угроза для агентов
Shadow-режимНовая модель или промпт считает результат на живом потоке, но ничего не делает. Сравниваем с текущим без риска
Eval / тестовый набор50–200 примеров «вход → ожидаемый результат». Без него любое изменение промпта или модели — вслепую

2. LLM: ярусы, цены, российские модели, память и железо

2.1 Три яруса моделей (сентябрь 2026)

ЯрусЗакрытые (API)Открытые весаЧто им поручать
Frontier — самые сильныеClaude Fable 5.1, Claude Opus 5, GPT-6 Astra, Gemini 3.1 ProKimi K3 (2.8T-A104B), DeepSeek V4 Pro (1.6T-A49B), GLM-5.2 / 5.3 (744B-A40B), Qwen3.8 Max, MiniMax M3Сложный анализ, архитектура, многошаговые агенты, код в большом репозитории. Дорого — только там, где ошибка стоит дороже
Mid — рабочие лошадкиClaude Sonnet 5, GPT-5.6 Sol / Terra, Gemini 3.x FlashQwen3.8-Flash-Next (180B MoE), Qwen3.8-27B, gpt-oss-120b, GLM-4.6 (355B-A32B), Mistral Small 4, Kimi K2.6Основной объём: ответы по документам (RAG), ревью, суммаризация, чат поддержки. Достаточны в 80% случаев
Small — малые и локальныеClaude Haiku 4.5, GPT-5.6 Luna, Gemini Flash-LiteQwen3.5 0.8B / 2B / 4B / 9B (малых в линейке 3.8 пока нет), gpt-oss-20b (MoE, 3.6B актив.), Gemma 4, Phi-4-mini (3.8B)Классификация, роутинг, извлечение полей, сжатие текста, автодополнение. Работают на одной видеокарте или телефоне

Правило ярусов: начинаем с mid; вниз — если задача простая и массовая; вверх — только если mid ошибается на нашем тестовом наборе. Где смотреть: Artificial Analysis, LMArena, SWE-bench Verified (код), MERA (русский).

2.2 Цены API за 1M токенов (список, 1–2 сентября 2026)

МодельВход $/1MВыход $/1MКомментарий
Claude Fable 5.110.0050.00Премиум-ярус Anthropic
Claude Opus 55.0025.00Frontier
GPT-6 Astra10.0050.00Frontier OpenAI (прайс OpenAI, 8 сентября 2026)
GPT-5.6 Sol4.0020.00Промо-цена до 21 ноября 2026 (прайс OpenAI, 8 сентября 2026)
GPT-5.6 Terra2.0012.00Mid OpenAI
Claude Sonnet 52.0010.00Mid; вводная цена $2 / $10 стала стандартной, повышение до $3 / $15 с 1 сентября 2026 отменено (прайс Anthropic, 8 сентября 2026)
Gemini 3.1 Pro2.0012.00×2 за контекст свыше 200K
Kimi K3 (API)3.0015.00Открытые веса, frontier-класс; по цене — как mid
GLM-5.3 (Z.ai)1.404.40Открытые веса по API; есть Coding Plan с подпиской
Claude Haiku 4.51.005.00Small
DeepSeek V4 Flash0.22–0.440.66–1.32Самый дешёвый; cache hit $0.007–0.014; пиковые часы ×2 (прайс DeepSeek, 8 сентября 2026)
GPT-5.6 Luna0.201.20Small OpenAI
MiniMax M30.301.20Дешёвый выход; заявления вендора о бенчмарках здесь не приводятся — не перепроверены
Эмбеддинги: OpenAI text-embedding-3-large0.13Для сравнения: эмбеддинги на два порядка дешевле
Реранкер: Cohere Rerank 3.5$2 / 1 000 запросов
STT: OpenAI / Deepgram / AssemblyAI$0.006–0.01 / мин
TTS: ElevenLabs / OpenAI / Cartesia$15–30 / 1M символов
Vision: любая мультимодальная LLMкак текст: ~1.3–2K токенов на картинкуПравило Anthropic: патчи 28×28 px; кэп 1 568 токенов у яруса standard, 4 784 — у high-resolution (Claude 4.7 и новее, Sonnet 5 в нём); документация Vision, 8 сентября 2026
  1. Выход дороже входа в 5 раз — болтливые ответы и агенты в цикле (50–500× токенов на задачу) главный источник счёта.
  2. Кэш промпта: повторяющееся начало запроса (инструкция, база знаний) — вход дешевле до 10 раз. Batch (асинхронно) — минус 50%.
  3. Пример: 1 000 обращений/день × 4 000 токенов входа + 500 выхода на Sonnet 5 = $8 + $5 ≈ $13/день ≈ $390/мес; с кэшем базы знаний ≈ $6/день.
  4. Промежуточный вариант: открытые модели по API у хостеров (DeepSeek, Z.ai, OpenRouter) — в 5–20 раз дешевле закрытых, без своего железа, но данные уходят.

2.3 Российские открытые модели

МодельТипЛицензияЗачем и когда брать
GigaAM-v3 (Сбер)STT, 220–240MMITЛучшее открытое распознавание русской речи: обучена на колл-центрах, шумной речи, фоновой музыке; пунктуация и нормализация «из коробки». Есть ONNX / sherpa-onnx сборки → CPU и телефон. Веса: huggingface.co/ai-sage/GigaAM-v3
GigaChat Ultra Preview / Lightning (Сбер)LLM, MoEMITUltra — флагман, лидер русскоязычного бенчмарка MERA; Lightning — компактная, для ноутбуков и прототипов. Обучены с нуля на русском
YandexGPT 5 Lite (open)LLM, 8Bлицензия ЯндексаМалая модель с сильным русским; для роутинга, извлечения, суммаризации на русском
T-pro / T-lite (Т-Банк)LLM, 7–32BApache 2.0Дообученные Qwen под русский; хороший баланс качества и размера для локального запуска
Vikhr / SaigaLLM, 7–12BApache 2.0Сообщество; русскоязычные дообучения Gemma / Mistral / Qwen
Kandinsky 5.0 Image / Video (Сбер)генерацияMITОткрытые; русский промпт и кириллический текст на картинке
Silero (VAD, TTS, STT)аудио-утилитыMIT / CC-BY-NCVAD — стандарт де-факто; TTS — лучший лёгкий русский голос (некоммерчески)

Почему важно: бенчмарки иностранных моделей меряют английский. На русском разница между «умеет 100 языков» и «обучена на русском» заметна — особенно у малых моделей и в речи.

2.4 Память: сколько нужно

  1. Память ≈ параметры × байт на параметр × 1.2 (запас на контекст). FP16 — 2 байта; Q8 — 1 байт; Q4 — ~0.55 байта.
  2. MoE: память считаем по всем параметрам, скорость — по активным.
  3. Q4_K_M (GGUF) — стандартный компромисс: −70% памяти, потеря качества 1–3%. Ниже Q3 качество заметно падает.
  4. Форматы: GGUF (llama.cpp / Ollama — CPU + GPU, универсально); AWQ / GPTQ / FP8 / FP4 (vLLM, TensorRT-LLM — быстрее на NVIDIA).
  5. Длинный контекст добавляет KV-кэш: десятки GB на 1M токенов.
МодельFP16Q8Q4Минимальное железо для Q4
8B16 GB9 GB5 GBЛюбая карта 8 GB; ноутбук; телефон (в Q4)
14B28 GB15 GB9 GBКарта 12–16 GB
32B64 GB34 GB20 GBКарта 24 GB (RTX 3090/4090/5090)
70B dense140 GB75 GB44 GB2× 24 GB или unified 64–128 GB
gpt-oss-120B (MoE)240 GB125 GB65 GBUnified 128 GB (Mac Studio, Ryzen AI Max, DGX Spark), RTX PRO 6000 96 GB
GLM-5.2 744B (MoE)1.5 TB780 GB~370–475 GB (Q2 ≈ 240 GB)Серверная стойка или Mac Studio 512 GB — не наш случай

2.5 Железо для локального запуска (street prices, июнь–сентябрь 2026)

ЯрусЖелезоПамять / ПСПЧто тянетЦена
Ноутбук / телефон16 GB RAM любой ноут; Snapdragon 8 Elite (12 GB)Модели 1.7–8B в Q4: Phi-4-mini, Qwen3.5-4B/9B; 3–15 токенов/с. STT / TTS / эмбеддинги — легко$0
ВходRTX 5060 Ti 16 GB16 GB / ~450 GB/s7–14B быстро (~60 ток/с); весь поисковый стек (эмбеддинги + реранкер) + STT + малая vision-модель~$585
Sweet spotRTX 5080 / RTX 509016 / 32 GB GDDR7, 1 792 GB/s5090: 32B целиком, 70B в Q4 с натяжкой, ~200 ток/с на 8B$1.4k / $4.3–5k (дефицит)
Unified 128 GBAMD Ryzen AI Max+ 395 mini-PC128 GB / ~256 GB/s70B при 12–15 ток/с, MoE до 120B. Самый дешёвый способ запустить 70B~$1.5k
Unified AppleMac Studio M5 Max / M5 Ultra36–512 GB / 614 GB/s (Max), 1.2 TB/s (Ultra) — страница Apple, 8 сентября 202670B при 20–30 ток/с; 120B FP16 на 192 GB; тихо, без драйверов; для одного пользователя$2.5–6k
CUDA-applianceNVIDIA DGX Spark (GB10)128 GB / 273 GB/sMoE 120–200B (35–80 ток/с с NIM), dense-70B медленно; полный стек NVIDIA$4,699
WorkstationRTX PRO 6000 Blackwell 96 GB96 GB / ~1.8 TB/s120B в Q4 или 70B в Q8; самый быстрый single-box; QLoRA-дообучение 70B$10k+
Аренда GPUA100 80 GB / H100 в облаке80 GBЛюбая открытая модель; без покупки; окупается от ~100M токенов/мес$1.5–3.5/час

Скорость (токенов/сек) определяется пропускной способностью памяти, а не вычислениями. RTX 40-серия снята с производства; цены NVIDIA завышены дефицитом памяти. Источники: Pinggy, Julien Simon, promptquorum, digitalapplied.

3. Экономия: что отдать малым локальным моделям и как считать

3.1 Что делегировать локальным моделям (по убыванию очевидности выгоды)

ЗадачаЛокальная модель (размер)Что экономим по сравнению с APIЖелезо
Эмбеддинги и реранкинг для поискаQwen3-Embedding 0.6B, bge-m3, bge-reranker (0.6B)100%: при переиндексации миллионов чанков и каждом запросе складывается; данные не уходятCPU или любая GPU
Фильтр атак, поиск PII, модерацияLlama Guard 4 (1B), Prompt Guard (86M), GLiNER, PresidioОтдельный вызов большой модели «проверь, безопасно ли» не нужен; PII не уходит провайдеруCPU
Классификация и роутинг тикетовQwen3.5-2B/4B, Phi-4-miniТиповые вопросы (30–60% потока) вообще не доходят до APIGPU 8 GB
Речь: транскрипция и озвучкаGigaAM-v3 (RU), Whisper large-v3-turbo, Parakeet; Kokoro, PiperAPI STT $0.006–0.01/мин: 100 ч созвонов в мес ≈ $60; локально — бесплатно на той же картеGPU 8–16 GB
Скриншоты и сканы (vision, OCR)Qwen3-VL 4–8B, DeepSeek-OCR, Gemma 4Картинка = 1.3–2K токенов входа + описание на выходе ≈ $0.0075 (Sonnet 5). Точка безубыточности ≈ 670 картинок/деньGPU 16 GB
Сжатие контекста перед APIQwen3.8-27B, Qwen3.5-9BТикет с перепиской на 20K токенов → выжимка 2K: −80% входных токенов дорогой моделиGPU 16–24 GB
Черновой ответ на типовой вопросQwen3.8-27B, gpt-oss-20bПоловину ответов пишет локальная модель; на API уходит только неуверенноеGPU 24–32 GB

3.2 Полная стоимость локального запуска — формула

СтатьяКак считатьОриентир
ЖелезоЦена карты / сервера ÷ срок амортизации (24–36 мес)RTX 5060 Ti $585 → $16–24/мес; RTX 5090 $4.5k → $125–190/мес
ЭлектричествоМощность × часы × тарифКарта 150–500 Вт при 24/7: $20–70/мес; в простое в 5 раз меньше
ЛюдиОбновление моделей, драйверы, мониторинг, инциденты2–8 ч/мес → $100–400/мес; часто самая большая статья
Цена ошибокЛокальная модель слабее frontier: если ошибается чаще — считаем стоимость повторного тикета / ручной проверкиИначе экономия мнимая
ЗагрузкаЖелезо окупается, только если загруженоОдна карта на 5 задач — выгодна; карта ради одной задачи на 100 запросов в день — нет
СравнениеLocal $/мес vs API $/мес при том же объёмеAPI выигрывает до ~100M токенов/мес или ~670 картинок/день; выше — локальное

3.3 Пример: скриншоты из тикетов

  1. API (Sonnet 5): картинка 1 500×1 000 px ≈ 1.94K токенов входа (патчи 28×28 px; ярус high-resolution для Claude 4.7+, картинка не сжимается: 54 × 36 патчей) + инструкция 0.3K + ответ 0.3K ≈ $0.0045 + $0.003 ≈ $0.0075 за скриншот при $2 / $10. 200/день → $45/мес; 2 000/день → $450/мес; 10 000/день → $2 250/мес.
  2. Локально (Qwen3-VL-8B на RTX 5060 Ti 16 GB): амортизация $24/мес + электричество ~$25/мес + поддержка ~2 ч/мес ≈ $100/мес → ≈ $150/мес независимо от объёма до ~30 000 картинок/день (1–2 с на картинку).
  3. Точка безубыточности ≈ 670 скриншотов/день ($150 / ($0.0075 × 30)). Та же карта заодно обслуживает эмбеддинги, STT и роутинг — реальная точка ниже.

4. Поиск: эмбеддинги, реранкеры, векторные базы, RAG

4.1 Embedding-модели

МодельРазмерЯзыкиЛицензияОсобенности
Qwen3-Embedding 0.6B / 4B / 8B0.6–8B100+Apache 2.0#1 в многоязычном MTEB; настраивается инструкциями; размерность 32–1024 (Matryoshka); парный реранкер
bge-m3 (BAAI)568M100+MITОдна модель даёт смысловой + словарный (sparse) + ColBERT вектор → гибридный поиск без второго движка; 8K контекст. У нас в pumba
jina-embeddings-v5 small / nano0.2–0.7B93CC-BY-NCЛучшая до 1B; режимы под поиск / классификацию; 32K контекст. Только некоммерчески
EmbeddingGemma-300M300M100+GemmaOn-device: телефон, ноутбук; в сжатом виде < 200 MB
OpenAI text-embedding-3-largeAPIмульти$0.13 за 1M токенов; самый простой старт
Gemini Embedding 2API100+Текст + картинка + видео + аудио + PDF в одном пространстве
Voyage 3.5 / Cohere Embed v4APIмультиСильны на коде и корпоративном поиске; Cohere — лидер среди API по языкам
Мультимодальные: Qwen3-VL-Embedding, SigLIP 2, Jina CLIP v20.4–2BмультиоткрытыеПоиск картинок текстом; дедупликация изображений

Векторы разных моделей несовместимы: сменили модель — переиндексируем всё. 0.6B-модель на карте 16 GB: ~1 000 фрагментов/сек. Проверять на 50 парах «вопрос → правильный фрагмент» из своих данных, а не по лидерборду.

4.2 Реранкеры

РеранкерТипЗамечания
bge-reranker-v2-m3 (568M) / v2-gemmaоткрытый, Apache 2.0Стандарт де-факто; многоязычный; работает на CPU
Qwen3-Reranker 0.6B / 4B / 8Bоткрытый, Apache 2.0Пара к Qwen3-Embedding; настраивается инструкцией; лучше на коде
Cohere Rerank 3.5 / Voyage rerank-2.5API$2 за 1 000 запросов; без инфраструктуры
LLM как реранкерлюбойДорого, но гибко: «оцени релевантность 0–10»; для малых объёмов

Гибридный поиск: смысловой (эмбеддинг) + словарный (BM25) → слияние RRF → реранкер на топ-50 → топ-5 в LLM. Прирост +10–25% точности при +50–200 мс.

4.3 Векторные базы данных

БазаТипСильные стороныОграниченияКогда брать
pgvector (Postgres)расширениеВсё в одной БД: транзакции, JOIN, права; HNSW; pgvectorscaleМедленнее на 10M+ векторов; нет нативного гибридаУже есть Postgres, < 5–10M векторов
Qdrantотдельный сервис, RustБыстрый; фильтры по payload; dense + sparse + multivector; квантование; снапшотыЕщё один сервис; нет SQLОсновной выбор для RAG — у нас
MilvusраспределённаяМасштаб до миллиардов, GPU-индексыТяжёлая установка (etcd, MinIO, Pulsar)Сотни миллионов векторов
Weaviateотдельный сервис, GoВстроенная векторизация, гибрид, GraphQLМеньше контроля над индексомБыстрый старт с модулями
Elasticsearch / OpenSearchпоисковый движокBM25 + kNN в одном месте, зрелая операционкаДорог по памяти; kNN менее гибкийУже есть ES; нужен полнотекст
Chroma / LanceDB / sqlite-vecвстраиваемаяНоль инфраструктуры, файл на дискеОдин процесс, без HAПрототипы, десктоп, CLI-агенты

Практика: Postgres — источник правды (текст фрагментов, метаданные, версии, права доступа); Qdrant хранит только векторы + ID + поля для фильтров. Из Postgres можно переиндексировать куда угодно за час; наоборот — нет.

4.4 Уроки RAG — что решает качество (по убыванию влияния)

#ЧтоПочему
1ДанныеГрязный вход → уверенно неправильный ответ. Дубли и устаревшие версии статей — главный источник ошибок
2ЧанкингСлишком мелко — теряется контекст; слишком крупно — шум. 300–800 токенов с перекрытием; в каждый фрагмент — заголовок и путь к документу
3Гибридный поискСмысловой + словарный + реранкер. Особенно важно для кодов ошибок, ID, имён
4Тестовый набор50–200 пар «вопрос → ожидаемый источник». Метрики: recall@5 > 85%, доля корректных цитат > 90%
5Промпт и цитаты«Отвечай только по контексту, иначе скажи, что не знаешь». Цитаты = проверяемость
6Выбор LLMПоследнее, что стоит менять. Mid-ярус почти всегда достаточен, если поиск хороший

Когда RAG не имеет смысла: ответов нет в документах; вопросы каждый раз уникальные; база < 50 страниц (проще в контекст целиком); никто не ухаживает за данными.

5. Аудио: STT, TTS, утилиты

5.1 STT — речь → текст

МодельРазмерЯзыкиСильная сторонаГде запускать
GigaAM-v3 (Сбер)220–240MRUЛучшая открытая для русского: колл-центры, шум, музыка; пунктуация и нормализация; MITCPU (RTF ≈ 0.03), GPU, ONNX / sherpa-onnx → телефон
Whisper large-v3 / v3-turbo1.5B / 0.8B99Универсальный all-rounder; turbo в 6× быстрееGPU 8–16 GB; faster-whisper на CPU
NVIDIA Parakeet TDT 0.6B / 1.1B v30.6–1.1B25Потоковый, RTFx > 2 000 — самый быстрый батчGPU; NeMo / sherpa-onnx
NVIDIA Canary-Qwen 2.5B2.5BENЛидер по точности (Open ASR Leaderboard); пунктуацияGPU
Moonshine27–60MEN + мультиEdge: микроконтроллеры, телефон, браузерCPU, ONNX, WASM
Sherpa-ONNX Zipformer26–188 MB / языкпо моделиПотоковый on-device; SDK Android / iOSТелефон, Raspberry Pi
Vosk50 MB–1.8 GB20+Офлайн, простой API, неплохой русскийCPU
API: OpenAI gpt-realtime-whisper, Deepgram, AssemblyAI, GoogleмультиПотоковый + диаризация + форматирование$0.006–0.01/мин

Метрика — WER (доля ошибочных слов); на русском колл-центре GigaAM-v3 даёт 9.5–10.3%, Whisper-large-v3 — 23.9% (карточка GigaAM-v3). Mozilla DeepSpeech и Coqui STT — мертвы. Обвязка: VAD (Silero) режет тишину, диаризация (pyannote) — кто говорил, LLM — пунктуация и саммари.

Бот транскрипции для Compass — исходники приложены: compass-stt-bot.zip (159 KB). Бот на user API Compass: мониторит чаты и треды, по призыву @бот на голосовом или видео присылает расшифровку в тред (файлом или текстом), по запросу — краткое саммари. Распознавание — локальная GigaAM v3 (ONNX Runtime, русский, пунктуация из коробки) или любой OpenAI-совместимый ASR; саммари — локальная Qwen3.5 (GGUF) или внешний LLM-эндпоинт. Работает с несколькими пространствами одним процессом, SaaS и on-prem; очередь, кэш транскриптов, SQLite для идемпотентности. Внутри: README.md, DEPLOY.md, Dockerfile и Dockerfile.cuda, docker-compose.yml, .env.example. Источник — CEO, 8 сентября 2026.

5.2 TTS — текст → речь

МодельРазмерЛицензияОсобенностиЛатентность / железо
Kokoro-82M82MApache 2.054 голоса, 8 языков; самая популярная лёгкая; нет клонированияРеальное время на CPU
Chatterbox / Chatterbox Turbo0.5B / 350MMITКлон с 5 с; 25 языков; теги [laugh], [sigh]; Turbo — 75 мсGPU, 6× реального времени
Qwen3-TTS 12Hz 1.7B1.9BApache 2.0Клон за 3 с, «дизайн голоса» по описанию, эмоции; 10 языковGPU, потоковый
Fish Audio S2 Proоткрытые весаОчень натуральный; 10M+ часов обученияGPU
Piper10–30MMITОфлайн, Raspberry Pi, есть RU-голосаCPU, мгновенно
Silero TTS~50MCC-BY-NCЛучший лёгкий русский; CPUCPU
API: ElevenLabs, OpenAI tts, Cartesia, GoogleЭталон качества, эмоции, клон$15–30 за 1M символов

Оценка натуральности — TTS Arena (Elo по слепым сравнениям). Потоковая выдача по предложениям: первый звук через 200–400 мс. Speech-to-speech модели (GPT-Realtime, Gemini Live) — отдельный класс без промежуточного текста, задержка ~300 мс, только API.

5.3 Аудио-утилиты

МодельЗадачаЗамечания
Silero VADДетекция речи (VAD)~2 MB, MIT; стандарт де-факто; телефон, браузер. Экономит деньги на API (тишина не отправляется)
pyannote 3.xДиаризация («кто говорил когда»)Открытая (нужна регистрация); лидер по точности; путается при наложении голосов и 5+ участниках
NVIDIA NeMo diarizationДиаризация + STTВ одном конвейере
Demucs / DeepFilterNet / MetricGAN+Разделение источников, шумоподавлениеCPU / GPU; чистка звонков перед распознаванием
CLAP / Whisper-embeddingsАудио-эмбеддингиПоиск по архиву записей текстом
SeamlessM4T v2 (Meta)Речь ↔ речь и текст, 100 языковCC-BY-NC

Кейс «офлайн-переводчик на телефоне»: Silero VAD → Sherpa-ONNX Zipformer (STT, 26–188 MB на язык) → NLLB-200-distilled-600M или Opus-MT (~300 MB) → Android TTS / Piper / Kokoro. Задержка 1–3 с, $0, офлайн. Облачная альтернатива: GPT-Realtime-Translate, ~0.3–0.5 с, $0.034/мин (тишина тарифицируется → VAD обязателен). Готовый open-source пример: InstantVoiceTranslate (Android).

6. Зрение и генерация

6.1 VLM, OCR, детекция

ТипАктуальные моделиПримеры примененияЛокально или API
VLM (vision-language)Qwen3-VL 2–235B (Apache 2.0), Gemma 4, Llama 4 Maverick / Scout, Kimi K2.6 / K3; API: Claude, GPT-5.6, Gemini 3.1Скриншот ошибки → диагноз и категория; проверка UI после деплоя; разбор графиков; описание картинок для поиска и доступностиЛокально Qwen3-VL-8B на 16 GB (1–2 с на картинку) при сотнях картинок в день; API — мелкий текст, сложные схемы, видео
OCR / document AIDeepSeek-OCR (таблицы, формулы, ~100 языков), PaddleOCR-VL, MinerU, Tesseract; API: Mistral OCR, Azure Document Intelligence, Google Document AI ($1–3 / 1 000 стр.)Сканы и PDF → база знаний; счета и договоры → JSON; скриншоты логов → текст; формыЛокально DeepSeek-OCR / Qwen3-VL-8B — 1–2 с на страницу; API — рукопись, редкие языки, готовые шаблоны. После OCR — валидация (суммы, даты)
Детекция / сегментацияYOLO v12 / RT-DETR, SAM 3, Grounding DINO, Florence-2Видеонаблюдение, контроль качества, разметка данных, AR, вырезание фонаПочти всегда локально: модели 10M–1B, реальное время. Связка: детектор нашёл → VLM объяснил
Мультимодальные эмбеддингиQwen3-VL-Embedding, SigLIP 2, Jina CLIP v2; API: Gemini Embedding 2, Voyage Multimodal 3.5Поиск скриншотов текстом; дедупликация картинок; поиск похожих тикетов со скринамиЛокально

6.2 Генерация картинок, видео, музыки

ТипОткрытыеAPIЗамечания
КартинкиFLUX.2 (dev — некоммерчески, schnell — Apache), Stable Diffusion 3.5 (LoRA, ControlNet), Qwen-Image, HiDream, Kandinsky 5.0 Image Lite (MIT, кириллица)gpt-image-2, Imagen 4, Midjourney, Ideogram — $0.02–0.20 за картинкуЛокально при сотнях картинок в день (карта 16–24 GB, ComfyUI); API — разовые задачи. Риски: лицензии dev-версий, бренды и лица, руки и мелкий текст
ВидеоWan 2.5 (Alibaba), HunyuanVideo, LTX-2 (быстрая), Kandinsky 5.0 Video Lite / ProVeo 3, Sora 2, Kling, Runway — со звуком, $0.05–0.50 за секундуЛокально только при постоянном объёме и карте 24 GB+; консистентность персонажа между клипами — нерешённая проблема
3D-моделиHunyuan3D 2.1 (Tencent; лицензия исключает EU/UK/KR), TRELLIS.2 (Microsoft, MIT, PBR-текстуры, Gaussian splats), Stable Fast 3D / SPAR3D (Stability, секунды на меш), InstantMesh, SAM 3D (Meta — реконструкция из фото)Meshy 6 (PBR, авто-риггинг, плагины Unity/Unreal/Blender), Tripo (8 с на меш, quad-ретопология, риггинг; от $12/мес), Hyper3D Rodin Gen-2.5 (самая детальная геометрия), Kaedim (с ручной QA)Текст или картинка → текстурированный меш GLB/OBJ за 10–60 с. Локально: карта 10–24 GB. Для игр: пропсы и концепты; персонажи требуют ретопологии и правки. Бесплатные тарифы — CC BY или некоммерчески; для 3D-печати нужна починка (manifold, база, масштаб)
МузыкаACE-Step, Stable Audio (инструментал)Suno, Udio — треки с вокалом по описаниюФоновые треки, джинглы; правовые вопросы те же плюс голоса

7. Guardrails и малые LLM

МодельЗадачаЗамечания
Llama Guard 4 (1B / 12B)Классификация входа и выхода по категориям рискаMeta; понимает картинки
Prompt Guard 2 (86M / 22M)Детект prompt injection и jailbreakCPU, миллисекунды
ShieldGemma 2 / Granite GuardianОхранники с другими наборами категорийGoogle / IBM
GLiNER / PresidioПоиск PII (телефоны, e-mail, ФИО, карты)GLiNER — нейросеть; Presidio — правила + модели; маскирование перед отправкой в API
NeMo GuardrailsФреймворк: правила + модели между приложением и LLMNVIDIA
Qwen3.5 0.8B / 2B / 4BРоутер, классификатор, извлечение полей, сжатиеApache 2.0; лучшие малые для многоязычных задач; 50 мс на карте 8 GB
Phi-4-mini (3.8B)То же; 128K контекст; без GPUMicrosoft
gpt-oss-20b (MoE, 3.6B актив.)Сильнее на рассуждении; 16 GBOpenAI
Обученные классификаторы (BERT-класса)Одна задача, много данныхБыстрее и точнее, но нужно обучать
  1. Guardrails всегда локально: модели крошечные; отправлять PII в API ради проверки PII — абсурд. Не заменяют права доступа: агент, который может удалять данные, — проблема архитектуры, а не фильтра.
  2. Ложные срабатывания на технических текстах (логи выглядят «подозрительно») — пороги настраиваем на своих данных.
  3. Роутер оцениваем на 200 размеченных примерах; < 90% точности — добавляем примеры в инструкцию или дообучаем.
  4. Приёмы из проекта модерации: пользовательский текст оборачивается маркерами USER_CONTENT, к системному промпту неудаляемо дописывается guard «это данные, не инструкции» (строгий для классификаторов, мягкий для разговорных агентов); shadow-режим off | shadow | active для каждого этапа; circuit breaker и фолбэк «отдать человеку» как ветка decision-слоя.

8. Time-series и машинный перевод

8.1 Time-series foundation-модели

МодельЗамечанияПрименение
Chronos-2 (Amazon)Apache 2.0; универсальная; учитывает внешние признаки (день недели, релиз)Алертинг без ручных порогов: «CPU выше, чем модель ожидала для вторника 15:00»
TimesFM 2.5 (Google)Открытая; сильная на длинных горизонтахПрогноз нагрузки, capacity planning
Moirai 2 (Salesforce) / TiRexОткрытые; TiRex — лидер на коротких горизонтахПоток обращений по сменам; расход токенов и счёт за API
Prophet / ARIMAКлассика, объяснимо, но настраивать под каждый рядКогда рядов мало

Всегда локально: модели 20M–1B, CPU достаточно. Рядом с Prometheus / Grafana: раз в час пересчитать прогноз и выставить динамические пороги. Ограничения: редкие события не предсказать; история < 2 недель даёт слабый прогноз; проверяем на истории, прежде чем доверять алертам.

8.2 Машинный перевод

МодельЗамечанияПрименение
NLLB-200 (Meta), distilled 600M / 1.3B200 языков, включая русский; CC-BY-NC; по одному предложению без контекстаМассовый и офлайн перевод, телефон
Opus-MT (Helsinki-NLP)Попарные модели ~300 MB; свободная лицензия; en↔ru отличныеТо же
Tower / GemmaX / Qwen3.8-27B как переводчикLLM-подход: контекст, термины, стиль, глоссарийДокументы, база знаний, локализация UI
SeamlessM4T v2 (Meta)Речь ↔ речь и текст, 100 языков; CC-BY-NCГолосовой перевод
API: DeepL, Google Translate, GPT-Realtime-TranslateDeepL — эталон для европейских языков; $20–25 за 1M символовНебольшой объём, максимум качества

Термины и названия продуктов — нужен глоссарий.

9. Как поставить модель локально через Ollama и обращаться к ней

Ollama — самый простой способ запустить открытую модель на своей машине: одна команда скачивает и запускает, дальше доступен HTTP API (в том числе совместимый с OpenAI SDK). Работает на macOS (Apple Silicon и Intel), Linux и Windows; на Mac использует GPU через Metal, на Linux/Windows — NVIDIA (CUDA) или AMD (ROCm), без GPU — CPU.

10.1 Установка

ПлатформаКоманда / действиеПроверка
macOSbrew install ollama (или скачать .dmg с ollama.com) → brew services start ollamaollama --version и curl http://localhost:11434 → должно ответить «Ollama is running»
Linuxcurl -fsSL https://ollama.com/install.sh | sh (ставит systemd-сервис)systemctl status ollama и nvidia-smi (видеокарта видна?)
WindowsУстановщик с ollama.com; запускается как сервис в трееollama --version в PowerShell
Docker (сервер)docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollamadocker logs ollama и curl http://localhost:11434

10.2 Скачать и запустить модель

КомандаЧто делает
ollama pull qwen3.5:9bСкачивает модель (Q4-квантование по умолчанию, ~6 GB). Список моделей и размеров: ollama.com/library
ollama run qwen3.5:9bИнтерактивный чат в терминале. Выход — /bye
ollama pull qwen3.5:27b-q8_0Тег после двоеточия задаёт размер и квантование; q8 точнее, но в 2 раза больше памяти
ollama listЧто скачано и сколько занимает
ollama psЧто сейчас загружено в память и на GPU ли (колонка PROCESSOR: 100% GPU — хорошо; CPU — модель не влезла в видеопамять)
ollama rm <model>Удалить модель
ollama pull bge-m3 / ollama pull qwen3-embedding:0.6bEmbedding-модели ставятся так же; вызываются через /api/embed

Ориентиры для выбора размера: карта 8 GB → модели до 9B; 16 GB → до 14B (или 27B в Q4 с частичной выгрузкой на CPU — медленно); 24–32 GB → 27–32B; Mac с 64 GB unified → 70B в Q4. Если ollama ps показывает CPU — берите модель меньше.

10.3 Обращение по API

Ollama слушает http://localhost:11434. Два интерфейса: собственный (/api/chat, /api/generate, /api/embed) и OpenAI-совместимый (/v1/chat/completions, /v1/embeddings) — второй позволяет переключить любой код с OpenAI на локальную модель, поменяв только base_url.

СпособПример
curl, чатcurl http://localhost:11434/api/chat -d '{"model":"qwen3.5:9b","messages":[{"role":"user","content":"Классифицируй тикет: не могу войти в кабинет"}],"stream":false}'
curl, эмбеддингcurl http://localhost:11434/api/embed -d '{"model":"bge-m3","input":"сервер не отвечает"}'
Python (OpenAI SDK)from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
r = client.chat.completions.create(model="qwen3.5:9b", messages=[{"role":"user","content":"Привет"}])
print(r.choices[0].message.content)
Python (ollama SDK)pip install ollama
import ollama
r = ollama.chat(model="qwen3.5:9b", messages=[{"role":"user","content":"Привет"}], format="json")
print(r["message"]["content"])
Gogo get github.com/ollama/ollama/api — официальный клиент; либо любая OpenAI-библиотека с base URL http://localhost:11434/v1
Структурированный выводВ /api/chat передать "format": {JSON-схема} — модель вернёт строго валидный JSON по схеме. Для классификаторов и извлечения полей — обязательно
LangChain / LlamaIndexВо всех есть нода/коннектор Ollama: указать URL сервера и имя модели

10.4 Полезные настройки и грабли

  1. Доступ с других машин: по умолчанию слушает только localhost. Для сервера — переменная окружения OLLAMA_HOST=0.0.0.0 (в systemd: systemctl edit ollama → [Service] Environment="OLLAMA_HOST=0.0.0.0") и закрыть порт 11434 файрволом от внешнего мира — аутентификации у Ollama нет.
  2. Несколько запросов параллельно: OLLAMA_NUM_PARALLEL=4; несколько моделей в памяти одновременно: OLLAMA_MAX_LOADED_MODELS=2. Проверка: ollama ps.
  3. Контекст по умолчанию небольшой (4–8K токенов). Для RAG передавайте "options": {"num_ctx": 32768} — помните, что длинный контекст ест видеопамять.
  4. Модель выгружается из памяти через 5 минут простоя (первый запрос после паузы медленный). Держать постоянно: "keep_alive": -1 в запросе или OLLAMA_KEEP_ALIVE=-1.
  5. Где лежат модели: ~/.ollama/models (macOS/Linux). Менять: OLLAMA_MODELS=/path.
  6. Свой GGUF или свой системный промпт: файл Modelfile (FROM ./model.gguf, SYSTEM "...", PARAMETER temperature 0.2) → ollama create myname -f Modelfile.
  7. Когда Ollama мало: для продакшена с высокой нагрузкой (десятки параллельных запросов, батчинг) — vLLM (Linux + NVIDIA, в 3–10 раз выше пропускная способность); для GUI на ноутбуке — LM Studio; для телефона — MLC-LLM / llama.cpp напрямую.
  8. Быстрая проверка, что GPU реально используется: во время запроса на Linux — nvidia-smi (загрузка и память), на Mac — sudo powermetrics --samplers gpu_power -i 1000 -n 3, либо просто ollama ps → колонка PROCESSOR.

10. Источники

Ссылка стоит у источника, который автор открыл и сверил 8 сентября 2026. Источник без ссылки назван автором исходной раздатки; страница не сохранена — цифры из него требуют перепроверки перед решением.

  1. Anthropic — Pricing (Claude Platform Docs): цены Fable 5.1, Opus 5, Sonnet 5, Haiku 4.5; отмена повышения Sonnet 5 до $3/$15. Открыто 8 сентября 2026.
  2. Anthropic — Vision (Claude Platform Docs): правило токенов на картинку (патчи 28×28 px, кэп 1 568 визуальных токенов, длинная сторона 1 568 px). Открыто 8 сентября 2026.
  3. DeepSeek — Models & Pricing: V4 Flash / V4 Pro, off-peak и peak. Открыто 8 сентября 2026.
  4. Hugging Face — moonshotai/Kimi-K3: 2.8T параметров, 104B активных, 16 из 896 экспертов. Открыто 8 сентября 2026.
  5. Unsloth — GLM-5.2: How to Run Locally: 744B / 40B активных; память сборок от 1 до 8 бит. Открыто 8 сентября 2026.
  6. Hugging Face — ai-sage/GigaAM-v3: 220–240M параметров, MIT, таблица WER по доменам. Открыто 8 сентября 2026.
  7. DeepSeek-OCR: Contexts Optical Compression (arXiv 2510.18234), октябрь 2025: сжатие 10× при точности 97%, 20× — около 60%. Открыто 8 сентября 2026.
  8. SWE-bench Leaderboards, вкладка Verified: лидер 76.8% в среде mini-SWE-agent. Открыто 8 сентября 2026.
  9. CNBC — Anthropic says Trump admin has lifted export controls on Claude Fable 5 and Mythos 5, 30 июня 2026: 19 дней недоступности. Найдено 8 сентября 2026.
  10. GitHub — deepseek-ai/DeepSeek-OCR: режимы разрешения и число визуальных токенов на страницу. Открыто 8 сентября 2026.
  11. Без ссылки — цены API: официальные прайсы OpenAI, Google, Moonshot, Z.ai; сводки morphllm, BenchLM, NavyaAI (1–2 сентября 2026).
  12. Без ссылки — рейтинги LLM: Artificial Analysis, LMArena, Vellum / BenchLM open-weight leaderboards, MERA (русский).
  13. Без ссылки — железо: Pinggy, Julien Simon (апрель 2026), promptquorum, digitalapplied — street prices июнь–сентябрь 2026.
  14. Без ссылки — эмбеддинги и реранкеры: MTEB leaderboard (Hugging Face), BentoML, Modal, checkthat.ai.
  15. Без ссылки — речь: Hugging Face Open ASR Leaderboard, TTS Arena V2, Northflank, AssemblyAI, Pinggy; Хабр SberDevices.
  16. Без ссылки — российские модели: анонс Сбера (ноябрь 2025), Хабр SberDevices / Yandex; веса на Hugging Face (ai-sage, yandex, t-tech).
  17. Без ссылки — 3D: обзоры Cinevva, RapidDirect, Ideas With Wings, Indie Hackers (апрель–сентябрь 2026); Hunyuan3D-2.1 на GitHub Tencent-Hunyuan; TRELLIS.2 (Microsoft Research).
  18. Без ссылки — Ollama: ollama.com/docs, github.com/ollama/ollama.