Зоопарк ИИ в 2026
Раздатка к докладу для команды · справочные таблицы моделей, цен, железа и практических правил · данные на сентябрь 2026 · v1.3
Данные актуальны на 1–8 сентября 2026; цены Anthropic и DeepSeek, параметры Kimi K3 и память GLM-5.2 перепроверены 8 сентября 2026 (см. «Источники»). Названия версий и цены меняются ежеквартально — перед принятием решений проверяйте на сайтах вендоров.
Содержание: 1. Словарь · 2. LLM: ярусы, цены, российские модели, память и железо · 3. Экономия: делегирование малым моделям и расчёт стоимости · 4. Поиск: эмбеддинги, реранкеры, векторные базы, уроки RAG · 5. Аудио: STT, TTS, утилиты · 6. Зрение и генерация · 7. Guardrails и малые LLM · 8. Time-series и перевод · 9. Ollama: установка и API · 10. Источники
1. Словарь
| Термин | Что это |
| Модель | Программа + огромная таблица чисел («веса»), обученная на данных. Не база знаний и не поисковик — она «угадывает» ответ по закономерностям |
| Параметры (B) | Размер этой таблицы. 8B = 8 миллиардов чисел. Больше — умнее, но нужно больше памяти и денег. Диапазон сегодня: от 0.1B до 2 800B |
| Токен | Единица текста, ~¾ слова (для русского — ближе к ½ слова). Модели читают и считают деньги в токенах: страница A4 ≈ 700 токенов |
| Контекстное окно | Сколько токенов модель «видит» за раз: запрос, документы и её ответ. Сегодня 128K–1M токенов — сотни страниц. Реально полезно ~200K |
| Inference (инференс) | Запуск обученной модели, чтобы получить ответ. Всё, что мы делаем, — это инференс; обучать модели мы не будем |
| Веса / open-weight | Файл модели, который можно скачать и запустить у себя. Открытые веса ≠ open source: данные и код обучения обычно закрыты |
| API | Доступ к чужой модели по сети, оплата за токены. Быстрый старт, нет железа, но данные уходят провайдеру |
| Квантование | Сжатие весов (16 бит → 4 бита на число): модель занимает в 3–4 раза меньше памяти, теряя 1–3% качества |
| Dense / MoE | Dense — на каждый токен работают все параметры. MoE (Mixture of Experts) — сотни узких «экспертов», на токен активны 3–8%: скорость малой модели, память большой. Запись «744B-A40B» = всего / активных |
| Эмбеддинг | Перевод текста (или картинки) в вектор чисел так, что близкие по смыслу тексты дают близкие векторы. Основа умного поиска |
| Реранкер | Модель, которая читает пару «вопрос + документ» целиком и ставит точную оценку релевантности. Применяется к топ-50 кандидатов от векторного поиска |
| RAG | Retrieval-Augmented Generation: сначала найти нужные документы поиском, потом дать их модели и попросить ответить по ним. Лекарство от выдумывания |
| Guardrail | Маленькая модель-фильтр до или после LLM: детект prompt injection, поиск PII, модерация |
| Prompt injection | Текст из тикета, письма или сайта содержит инструкцию «забудь правила и сделай X», и модель её выполняет. Главная угроза для агентов |
| Shadow-режим | Новая модель или промпт считает результат на живом потоке, но ничего не делает. Сравниваем с текущим без риска |
| Eval / тестовый набор | 50–200 примеров «вход → ожидаемый результат». Без него любое изменение промпта или модели — вслепую |
2. LLM: ярусы, цены, российские модели, память и железо
2.1 Три яруса моделей (сентябрь 2026)
| Ярус | Закрытые (API) | Открытые веса | Что им поручать |
| Frontier — самые сильные | Claude Fable 5.1, Claude Opus 5, GPT-6 Astra, Gemini 3.1 Pro | Kimi K3 (2.8T-A104B), DeepSeek V4 Pro (1.6T-A49B), GLM-5.2 / 5.3 (744B-A40B), Qwen3.8 Max, MiniMax M3 | Сложный анализ, архитектура, многошаговые агенты, код в большом репозитории. Дорого — только там, где ошибка стоит дороже |
| Mid — рабочие лошадки | Claude Sonnet 5, GPT-5.6 Sol / Terra, Gemini 3.x Flash | Qwen3.8-Flash-Next (180B MoE), Qwen3.8-27B, gpt-oss-120b, GLM-4.6 (355B-A32B), Mistral Small 4, Kimi K2.6 | Основной объём: ответы по документам (RAG), ревью, суммаризация, чат поддержки. Достаточны в 80% случаев |
| Small — малые и локальные | Claude Haiku 4.5, GPT-5.6 Luna, Gemini Flash-Lite | Qwen3.5 0.8B / 2B / 4B / 9B (малых в линейке 3.8 пока нет), gpt-oss-20b (MoE, 3.6B актив.), Gemma 4, Phi-4-mini (3.8B) | Классификация, роутинг, извлечение полей, сжатие текста, автодополнение. Работают на одной видеокарте или телефоне |
Правило ярусов: начинаем с mid; вниз — если задача простая и массовая; вверх — только если mid ошибается на нашем тестовом наборе. Где смотреть: Artificial Analysis, LMArena, SWE-bench Verified (код), MERA (русский).
2.2 Цены API за 1M токенов (список, 1–2 сентября 2026)
| Модель | Вход $/1M | Выход $/1M | Комментарий |
| Claude Fable 5.1 | 10.00 | 50.00 | Премиум-ярус Anthropic |
| Claude Opus 5 | 5.00 | 25.00 | Frontier |
| GPT-6 Astra | 10.00 | 50.00 | Frontier OpenAI (прайс OpenAI, 8 сентября 2026) |
| GPT-5.6 Sol | 4.00 | 20.00 | Промо-цена до 21 ноября 2026 (прайс OpenAI, 8 сентября 2026) |
| GPT-5.6 Terra | 2.00 | 12.00 | Mid OpenAI |
| Claude Sonnet 5 | 2.00 | 10.00 | Mid; вводная цена $2 / $10 стала стандартной, повышение до $3 / $15 с 1 сентября 2026 отменено (прайс Anthropic, 8 сентября 2026) |
| Gemini 3.1 Pro | 2.00 | 12.00 | ×2 за контекст свыше 200K |
| Kimi K3 (API) | 3.00 | 15.00 | Открытые веса, frontier-класс; по цене — как mid |
| GLM-5.3 (Z.ai) | 1.40 | 4.40 | Открытые веса по API; есть Coding Plan с подпиской |
| Claude Haiku 4.5 | 1.00 | 5.00 | Small |
| DeepSeek V4 Flash | 0.22–0.44 | 0.66–1.32 | Самый дешёвый; cache hit $0.007–0.014; пиковые часы ×2 (прайс DeepSeek, 8 сентября 2026) |
| GPT-5.6 Luna | 0.20 | 1.20 | Small OpenAI |
| MiniMax M3 | 0.30 | 1.20 | Дешёвый выход; заявления вендора о бенчмарках здесь не приводятся — не перепроверены |
| Эмбеддинги: OpenAI text-embedding-3-large | 0.13 | — | Для сравнения: эмбеддинги на два порядка дешевле |
| Реранкер: Cohere Rerank 3.5 | $2 / 1 000 запросов | — | |
| STT: OpenAI / Deepgram / AssemblyAI | $0.006–0.01 / мин | — | |
| TTS: ElevenLabs / OpenAI / Cartesia | $15–30 / 1M символов | — | |
| Vision: любая мультимодальная LLM | как текст: ~1.3–2K токенов на картинку | — | Правило Anthropic: патчи 28×28 px; кэп 1 568 токенов у яруса standard, 4 784 — у high-resolution (Claude 4.7 и новее, Sonnet 5 в нём); документация Vision, 8 сентября 2026 |
- Выход дороже входа в 5 раз — болтливые ответы и агенты в цикле (50–500× токенов на задачу) главный источник счёта.
- Кэш промпта: повторяющееся начало запроса (инструкция, база знаний) — вход дешевле до 10 раз. Batch (асинхронно) — минус 50%.
- Пример: 1 000 обращений/день × 4 000 токенов входа + 500 выхода на Sonnet 5 = $8 + $5 ≈ $13/день ≈ $390/мес; с кэшем базы знаний ≈ $6/день.
- Промежуточный вариант: открытые модели по API у хостеров (DeepSeek, Z.ai, OpenRouter) — в 5–20 раз дешевле закрытых, без своего железа, но данные уходят.
2.3 Российские открытые модели
| Модель | Тип | Лицензия | Зачем и когда брать |
| GigaAM-v3 (Сбер) | STT, 220–240M | MIT | Лучшее открытое распознавание русской речи: обучена на колл-центрах, шумной речи, фоновой музыке; пунктуация и нормализация «из коробки». Есть ONNX / sherpa-onnx сборки → CPU и телефон. Веса: huggingface.co/ai-sage/GigaAM-v3 |
| GigaChat Ultra Preview / Lightning (Сбер) | LLM, MoE | MIT | Ultra — флагман, лидер русскоязычного бенчмарка MERA; Lightning — компактная, для ноутбуков и прототипов. Обучены с нуля на русском |
| YandexGPT 5 Lite (open) | LLM, 8B | лицензия Яндекса | Малая модель с сильным русским; для роутинга, извлечения, суммаризации на русском |
| T-pro / T-lite (Т-Банк) | LLM, 7–32B | Apache 2.0 | Дообученные Qwen под русский; хороший баланс качества и размера для локального запуска |
| Vikhr / Saiga | LLM, 7–12B | Apache 2.0 | Сообщество; русскоязычные дообучения Gemma / Mistral / Qwen |
| Kandinsky 5.0 Image / Video (Сбер) | генерация | MIT | Открытые; русский промпт и кириллический текст на картинке |
| Silero (VAD, TTS, STT) | аудио-утилиты | MIT / CC-BY-NC | VAD — стандарт де-факто; TTS — лучший лёгкий русский голос (некоммерчески) |
Почему важно: бенчмарки иностранных моделей меряют английский. На русском разница между «умеет 100 языков» и «обучена на русском» заметна — особенно у малых моделей и в речи.
2.4 Память: сколько нужно
- Память ≈ параметры × байт на параметр × 1.2 (запас на контекст). FP16 — 2 байта; Q8 — 1 байт; Q4 — ~0.55 байта.
- MoE: память считаем по всем параметрам, скорость — по активным.
- Q4_K_M (GGUF) — стандартный компромисс: −70% памяти, потеря качества 1–3%. Ниже Q3 качество заметно падает.
- Форматы: GGUF (llama.cpp / Ollama — CPU + GPU, универсально); AWQ / GPTQ / FP8 / FP4 (vLLM, TensorRT-LLM — быстрее на NVIDIA).
- Длинный контекст добавляет KV-кэш: десятки GB на 1M токенов.
| Модель | FP16 | Q8 | Q4 | Минимальное железо для Q4 |
| 8B | 16 GB | 9 GB | 5 GB | Любая карта 8 GB; ноутбук; телефон (в Q4) |
| 14B | 28 GB | 15 GB | 9 GB | Карта 12–16 GB |
| 32B | 64 GB | 34 GB | 20 GB | Карта 24 GB (RTX 3090/4090/5090) |
| 70B dense | 140 GB | 75 GB | 44 GB | 2× 24 GB или unified 64–128 GB |
| gpt-oss-120B (MoE) | 240 GB | 125 GB | 65 GB | Unified 128 GB (Mac Studio, Ryzen AI Max, DGX Spark), RTX PRO 6000 96 GB |
| GLM-5.2 744B (MoE) | 1.5 TB | 780 GB | ~370–475 GB (Q2 ≈ 240 GB) | Серверная стойка или Mac Studio 512 GB — не наш случай |
2.5 Железо для локального запуска (street prices, июнь–сентябрь 2026)
| Ярус | Железо | Память / ПСП | Что тянет | Цена |
| Ноутбук / телефон | 16 GB RAM любой ноут; Snapdragon 8 Elite (12 GB) | — | Модели 1.7–8B в Q4: Phi-4-mini, Qwen3.5-4B/9B; 3–15 токенов/с. STT / TTS / эмбеддинги — легко | $0 |
| Вход | RTX 5060 Ti 16 GB | 16 GB / ~450 GB/s | 7–14B быстро (~60 ток/с); весь поисковый стек (эмбеддинги + реранкер) + STT + малая vision-модель | ~$585 |
| Sweet spot | RTX 5080 / RTX 5090 | 16 / 32 GB GDDR7, 1 792 GB/s | 5090: 32B целиком, 70B в Q4 с натяжкой, ~200 ток/с на 8B | $1.4k / $4.3–5k (дефицит) |
| Unified 128 GB | AMD Ryzen AI Max+ 395 mini-PC | 128 GB / ~256 GB/s | 70B при 12–15 ток/с, MoE до 120B. Самый дешёвый способ запустить 70B | ~$1.5k |
| Unified Apple | Mac Studio M5 Max / M5 Ultra | 36–512 GB / 614 GB/s (Max), 1.2 TB/s (Ultra) — страница Apple, 8 сентября 2026 | 70B при 20–30 ток/с; 120B FP16 на 192 GB; тихо, без драйверов; для одного пользователя | $2.5–6k |
| CUDA-appliance | NVIDIA DGX Spark (GB10) | 128 GB / 273 GB/s | MoE 120–200B (35–80 ток/с с NIM), dense-70B медленно; полный стек NVIDIA | $4,699 |
| Workstation | RTX PRO 6000 Blackwell 96 GB | 96 GB / ~1.8 TB/s | 120B в Q4 или 70B в Q8; самый быстрый single-box; QLoRA-дообучение 70B | $10k+ |
| Аренда GPU | A100 80 GB / H100 в облаке | 80 GB | Любая открытая модель; без покупки; окупается от ~100M токенов/мес | $1.5–3.5/час |
Скорость (токенов/сек) определяется пропускной способностью памяти, а не вычислениями. RTX 40-серия снята с производства; цены NVIDIA завышены дефицитом памяти. Источники: Pinggy, Julien Simon, promptquorum, digitalapplied.
3. Экономия: что отдать малым локальным моделям и как считать
3.1 Что делегировать локальным моделям (по убыванию очевидности выгоды)
| Задача | Локальная модель (размер) | Что экономим по сравнению с API | Железо |
| Эмбеддинги и реранкинг для поиска | Qwen3-Embedding 0.6B, bge-m3, bge-reranker (0.6B) | 100%: при переиндексации миллионов чанков и каждом запросе складывается; данные не уходят | CPU или любая GPU |
| Фильтр атак, поиск PII, модерация | Llama Guard 4 (1B), Prompt Guard (86M), GLiNER, Presidio | Отдельный вызов большой модели «проверь, безопасно ли» не нужен; PII не уходит провайдеру | CPU |
| Классификация и роутинг тикетов | Qwen3.5-2B/4B, Phi-4-mini | Типовые вопросы (30–60% потока) вообще не доходят до API | GPU 8 GB |
| Речь: транскрипция и озвучка | GigaAM-v3 (RU), Whisper large-v3-turbo, Parakeet; Kokoro, Piper | API STT $0.006–0.01/мин: 100 ч созвонов в мес ≈ $60; локально — бесплатно на той же карте | GPU 8–16 GB |
| Скриншоты и сканы (vision, OCR) | Qwen3-VL 4–8B, DeepSeek-OCR, Gemma 4 | Картинка = 1.3–2K токенов входа + описание на выходе ≈ $0.0075 (Sonnet 5). Точка безубыточности ≈ 670 картинок/день | GPU 16 GB |
| Сжатие контекста перед API | Qwen3.8-27B, Qwen3.5-9B | Тикет с перепиской на 20K токенов → выжимка 2K: −80% входных токенов дорогой модели | GPU 16–24 GB |
| Черновой ответ на типовой вопрос | Qwen3.8-27B, gpt-oss-20b | Половину ответов пишет локальная модель; на API уходит только неуверенное | GPU 24–32 GB |
3.2 Полная стоимость локального запуска — формула
| Статья | Как считать | Ориентир |
| Железо | Цена карты / сервера ÷ срок амортизации (24–36 мес) | RTX 5060 Ti $585 → $16–24/мес; RTX 5090 $4.5k → $125–190/мес |
| Электричество | Мощность × часы × тариф | Карта 150–500 Вт при 24/7: $20–70/мес; в простое в 5 раз меньше |
| Люди | Обновление моделей, драйверы, мониторинг, инциденты | 2–8 ч/мес → $100–400/мес; часто самая большая статья |
| Цена ошибок | Локальная модель слабее frontier: если ошибается чаще — считаем стоимость повторного тикета / ручной проверки | Иначе экономия мнимая |
| Загрузка | Железо окупается, только если загружено | Одна карта на 5 задач — выгодна; карта ради одной задачи на 100 запросов в день — нет |
| Сравнение | Local $/мес vs API $/мес при том же объёме | API выигрывает до ~100M токенов/мес или ~670 картинок/день; выше — локальное |
3.3 Пример: скриншоты из тикетов
- API (Sonnet 5): картинка 1 500×1 000 px ≈ 1.94K токенов входа (патчи 28×28 px; ярус high-resolution для Claude 4.7+, картинка не сжимается: 54 × 36 патчей) + инструкция 0.3K + ответ 0.3K ≈ $0.0045 + $0.003 ≈ $0.0075 за скриншот при $2 / $10. 200/день → $45/мес; 2 000/день → $450/мес; 10 000/день → $2 250/мес.
- Локально (Qwen3-VL-8B на RTX 5060 Ti 16 GB): амортизация $24/мес + электричество ~$25/мес + поддержка ~2 ч/мес ≈ $100/мес → ≈ $150/мес независимо от объёма до ~30 000 картинок/день (1–2 с на картинку).
- Точка безубыточности ≈ 670 скриншотов/день ($150 / ($0.0075 × 30)). Та же карта заодно обслуживает эмбеддинги, STT и роутинг — реальная точка ниже.
4. Поиск: эмбеддинги, реранкеры, векторные базы, RAG
4.1 Embedding-модели
| Модель | Размер | Языки | Лицензия | Особенности |
| Qwen3-Embedding 0.6B / 4B / 8B | 0.6–8B | 100+ | Apache 2.0 | #1 в многоязычном MTEB; настраивается инструкциями; размерность 32–1024 (Matryoshka); парный реранкер |
| bge-m3 (BAAI) | 568M | 100+ | MIT | Одна модель даёт смысловой + словарный (sparse) + ColBERT вектор → гибридный поиск без второго движка; 8K контекст. У нас в pumba |
| jina-embeddings-v5 small / nano | 0.2–0.7B | 93 | CC-BY-NC | Лучшая до 1B; режимы под поиск / классификацию; 32K контекст. Только некоммерчески |
| EmbeddingGemma-300M | 300M | 100+ | Gemma | On-device: телефон, ноутбук; в сжатом виде < 200 MB |
| OpenAI text-embedding-3-large | API | мульти | — | $0.13 за 1M токенов; самый простой старт |
| Gemini Embedding 2 | API | 100+ | — | Текст + картинка + видео + аудио + PDF в одном пространстве |
| Voyage 3.5 / Cohere Embed v4 | API | мульти | — | Сильны на коде и корпоративном поиске; Cohere — лидер среди API по языкам |
| Мультимодальные: Qwen3-VL-Embedding, SigLIP 2, Jina CLIP v2 | 0.4–2B | мульти | открытые | Поиск картинок текстом; дедупликация изображений |
Векторы разных моделей несовместимы: сменили модель — переиндексируем всё. 0.6B-модель на карте 16 GB: ~1 000 фрагментов/сек. Проверять на 50 парах «вопрос → правильный фрагмент» из своих данных, а не по лидерборду.
4.2 Реранкеры
| Реранкер | Тип | Замечания |
| bge-reranker-v2-m3 (568M) / v2-gemma | открытый, Apache 2.0 | Стандарт де-факто; многоязычный; работает на CPU |
| Qwen3-Reranker 0.6B / 4B / 8B | открытый, Apache 2.0 | Пара к Qwen3-Embedding; настраивается инструкцией; лучше на коде |
| Cohere Rerank 3.5 / Voyage rerank-2.5 | API | $2 за 1 000 запросов; без инфраструктуры |
| LLM как реранкер | любой | Дорого, но гибко: «оцени релевантность 0–10»; для малых объёмов |
Гибридный поиск: смысловой (эмбеддинг) + словарный (BM25) → слияние RRF → реранкер на топ-50 → топ-5 в LLM. Прирост +10–25% точности при +50–200 мс.
4.3 Векторные базы данных
| База | Тип | Сильные стороны | Ограничения | Когда брать |
| pgvector (Postgres) | расширение | Всё в одной БД: транзакции, JOIN, права; HNSW; pgvectorscale | Медленнее на 10M+ векторов; нет нативного гибрида | Уже есть Postgres, < 5–10M векторов |
| Qdrant | отдельный сервис, Rust | Быстрый; фильтры по payload; dense + sparse + multivector; квантование; снапшоты | Ещё один сервис; нет SQL | Основной выбор для RAG — у нас |
| Milvus | распределённая | Масштаб до миллиардов, GPU-индексы | Тяжёлая установка (etcd, MinIO, Pulsar) | Сотни миллионов векторов |
| Weaviate | отдельный сервис, Go | Встроенная векторизация, гибрид, GraphQL | Меньше контроля над индексом | Быстрый старт с модулями |
| Elasticsearch / OpenSearch | поисковый движок | BM25 + kNN в одном месте, зрелая операционка | Дорог по памяти; kNN менее гибкий | Уже есть ES; нужен полнотекст |
| Chroma / LanceDB / sqlite-vec | встраиваемая | Ноль инфраструктуры, файл на диске | Один процесс, без HA | Прототипы, десктоп, CLI-агенты |
Практика: Postgres — источник правды (текст фрагментов, метаданные, версии, права доступа); Qdrant хранит только векторы + ID + поля для фильтров. Из Postgres можно переиндексировать куда угодно за час; наоборот — нет.
4.4 Уроки RAG — что решает качество (по убыванию влияния)
| # | Что | Почему |
| 1 | Данные | Грязный вход → уверенно неправильный ответ. Дубли и устаревшие версии статей — главный источник ошибок |
| 2 | Чанкинг | Слишком мелко — теряется контекст; слишком крупно — шум. 300–800 токенов с перекрытием; в каждый фрагмент — заголовок и путь к документу |
| 3 | Гибридный поиск | Смысловой + словарный + реранкер. Особенно важно для кодов ошибок, ID, имён |
| 4 | Тестовый набор | 50–200 пар «вопрос → ожидаемый источник». Метрики: recall@5 > 85%, доля корректных цитат > 90% |
| 5 | Промпт и цитаты | «Отвечай только по контексту, иначе скажи, что не знаешь». Цитаты = проверяемость |
| 6 | Выбор LLM | Последнее, что стоит менять. Mid-ярус почти всегда достаточен, если поиск хороший |
Когда RAG не имеет смысла: ответов нет в документах; вопросы каждый раз уникальные; база < 50 страниц (проще в контекст целиком); никто не ухаживает за данными.
5. Аудио: STT, TTS, утилиты
5.1 STT — речь → текст
| Модель | Размер | Языки | Сильная сторона | Где запускать |
| GigaAM-v3 (Сбер) | 220–240M | RU | Лучшая открытая для русского: колл-центры, шум, музыка; пунктуация и нормализация; MIT | CPU (RTF ≈ 0.03), GPU, ONNX / sherpa-onnx → телефон |
| Whisper large-v3 / v3-turbo | 1.5B / 0.8B | 99 | Универсальный all-rounder; turbo в 6× быстрее | GPU 8–16 GB; faster-whisper на CPU |
| NVIDIA Parakeet TDT 0.6B / 1.1B v3 | 0.6–1.1B | 25 | Потоковый, RTFx > 2 000 — самый быстрый батч | GPU; NeMo / sherpa-onnx |
| NVIDIA Canary-Qwen 2.5B | 2.5B | EN | Лидер по точности (Open ASR Leaderboard); пунктуация | GPU |
| Moonshine | 27–60M | EN + мульти | Edge: микроконтроллеры, телефон, браузер | CPU, ONNX, WASM |
| Sherpa-ONNX Zipformer | 26–188 MB / язык | по модели | Потоковый on-device; SDK Android / iOS | Телефон, Raspberry Pi |
| Vosk | 50 MB–1.8 GB | 20+ | Офлайн, простой API, неплохой русский | CPU |
| API: OpenAI gpt-realtime-whisper, Deepgram, AssemblyAI, Google | — | мульти | Потоковый + диаризация + форматирование | $0.006–0.01/мин |
Метрика — WER (доля ошибочных слов); на русском колл-центре GigaAM-v3 даёт 9.5–10.3%, Whisper-large-v3 — 23.9% (карточка GigaAM-v3). Mozilla DeepSpeech и Coqui STT — мертвы. Обвязка: VAD (Silero) режет тишину, диаризация (pyannote) — кто говорил, LLM — пунктуация и саммари.
Бот транскрипции для Compass — исходники приложены:
compass-stt-bot.zip (159 KB). Бот на user API Compass: мониторит чаты и треды, по призыву @бот на голосовом или видео присылает расшифровку в тред (файлом или текстом), по запросу — краткое саммари. Распознавание — локальная GigaAM v3 (ONNX Runtime, русский, пунктуация из коробки) или любой OpenAI-совместимый ASR; саммари — локальная Qwen3.5 (GGUF) или внешний LLM-эндпоинт. Работает с несколькими пространствами одним процессом, SaaS и on-prem; очередь, кэш транскриптов, SQLite для идемпотентности. Внутри: README.md, DEPLOY.md, Dockerfile и Dockerfile.cuda, docker-compose.yml, .env.example. Источник — CEO, 8 сентября 2026.
5.2 TTS — текст → речь
| Модель | Размер | Лицензия | Особенности | Латентность / железо |
| Kokoro-82M | 82M | Apache 2.0 | 54 голоса, 8 языков; самая популярная лёгкая; нет клонирования | Реальное время на CPU |
| Chatterbox / Chatterbox Turbo | 0.5B / 350M | MIT | Клон с 5 с; 25 языков; теги [laugh], [sigh]; Turbo — 75 мс | GPU, 6× реального времени |
| Qwen3-TTS 12Hz 1.7B | 1.9B | Apache 2.0 | Клон за 3 с, «дизайн голоса» по описанию, эмоции; 10 языков | GPU, потоковый |
| Fish Audio S2 Pro | — | открытые веса | Очень натуральный; 10M+ часов обучения | GPU |
| Piper | 10–30M | MIT | Офлайн, Raspberry Pi, есть RU-голоса | CPU, мгновенно |
| Silero TTS | ~50M | CC-BY-NC | Лучший лёгкий русский; CPU | CPU |
| API: ElevenLabs, OpenAI tts, Cartesia, Google | — | — | Эталон качества, эмоции, клон | $15–30 за 1M символов |
Оценка натуральности — TTS Arena (Elo по слепым сравнениям). Потоковая выдача по предложениям: первый звук через 200–400 мс. Speech-to-speech модели (GPT-Realtime, Gemini Live) — отдельный класс без промежуточного текста, задержка ~300 мс, только API.
5.3 Аудио-утилиты
| Модель | Задача | Замечания |
| Silero VAD | Детекция речи (VAD) | ~2 MB, MIT; стандарт де-факто; телефон, браузер. Экономит деньги на API (тишина не отправляется) |
| pyannote 3.x | Диаризация («кто говорил когда») | Открытая (нужна регистрация); лидер по точности; путается при наложении голосов и 5+ участниках |
| NVIDIA NeMo diarization | Диаризация + STT | В одном конвейере |
| Demucs / DeepFilterNet / MetricGAN+ | Разделение источников, шумоподавление | CPU / GPU; чистка звонков перед распознаванием |
| CLAP / Whisper-embeddings | Аудио-эмбеддинги | Поиск по архиву записей текстом |
| SeamlessM4T v2 (Meta) | Речь ↔ речь и текст, 100 языков | CC-BY-NC |
Кейс «офлайн-переводчик на телефоне»: Silero VAD → Sherpa-ONNX Zipformer (STT, 26–188 MB на язык) → NLLB-200-distilled-600M или Opus-MT (~300 MB) → Android TTS / Piper / Kokoro. Задержка 1–3 с, $0, офлайн. Облачная альтернатива: GPT-Realtime-Translate, ~0.3–0.5 с, $0.034/мин (тишина тарифицируется → VAD обязателен). Готовый open-source пример: InstantVoiceTranslate (Android).
6. Зрение и генерация
6.1 VLM, OCR, детекция
| Тип | Актуальные модели | Примеры применения | Локально или API |
| VLM (vision-language) | Qwen3-VL 2–235B (Apache 2.0), Gemma 4, Llama 4 Maverick / Scout, Kimi K2.6 / K3; API: Claude, GPT-5.6, Gemini 3.1 | Скриншот ошибки → диагноз и категория; проверка UI после деплоя; разбор графиков; описание картинок для поиска и доступности | Локально Qwen3-VL-8B на 16 GB (1–2 с на картинку) при сотнях картинок в день; API — мелкий текст, сложные схемы, видео |
| OCR / document AI | DeepSeek-OCR (таблицы, формулы, ~100 языков), PaddleOCR-VL, MinerU, Tesseract; API: Mistral OCR, Azure Document Intelligence, Google Document AI ($1–3 / 1 000 стр.) | Сканы и PDF → база знаний; счета и договоры → JSON; скриншоты логов → текст; формы | Локально DeepSeek-OCR / Qwen3-VL-8B — 1–2 с на страницу; API — рукопись, редкие языки, готовые шаблоны. После OCR — валидация (суммы, даты) |
| Детекция / сегментация | YOLO v12 / RT-DETR, SAM 3, Grounding DINO, Florence-2 | Видеонаблюдение, контроль качества, разметка данных, AR, вырезание фона | Почти всегда локально: модели 10M–1B, реальное время. Связка: детектор нашёл → VLM объяснил |
| Мультимодальные эмбеддинги | Qwen3-VL-Embedding, SigLIP 2, Jina CLIP v2; API: Gemini Embedding 2, Voyage Multimodal 3.5 | Поиск скриншотов текстом; дедупликация картинок; поиск похожих тикетов со скринами | Локально |
6.2 Генерация картинок, видео, музыки
| Тип | Открытые | API | Замечания |
| Картинки | FLUX.2 (dev — некоммерчески, schnell — Apache), Stable Diffusion 3.5 (LoRA, ControlNet), Qwen-Image, HiDream, Kandinsky 5.0 Image Lite (MIT, кириллица) | gpt-image-2, Imagen 4, Midjourney, Ideogram — $0.02–0.20 за картинку | Локально при сотнях картинок в день (карта 16–24 GB, ComfyUI); API — разовые задачи. Риски: лицензии dev-версий, бренды и лица, руки и мелкий текст |
| Видео | Wan 2.5 (Alibaba), HunyuanVideo, LTX-2 (быстрая), Kandinsky 5.0 Video Lite / Pro | Veo 3, Sora 2, Kling, Runway — со звуком, $0.05–0.50 за секунду | Локально только при постоянном объёме и карте 24 GB+; консистентность персонажа между клипами — нерешённая проблема |
| 3D-модели | Hunyuan3D 2.1 (Tencent; лицензия исключает EU/UK/KR), TRELLIS.2 (Microsoft, MIT, PBR-текстуры, Gaussian splats), Stable Fast 3D / SPAR3D (Stability, секунды на меш), InstantMesh, SAM 3D (Meta — реконструкция из фото) | Meshy 6 (PBR, авто-риггинг, плагины Unity/Unreal/Blender), Tripo (8 с на меш, quad-ретопология, риггинг; от $12/мес), Hyper3D Rodin Gen-2.5 (самая детальная геометрия), Kaedim (с ручной QA) | Текст или картинка → текстурированный меш GLB/OBJ за 10–60 с. Локально: карта 10–24 GB. Для игр: пропсы и концепты; персонажи требуют ретопологии и правки. Бесплатные тарифы — CC BY или некоммерчески; для 3D-печати нужна починка (manifold, база, масштаб) |
| Музыка | ACE-Step, Stable Audio (инструментал) | Suno, Udio — треки с вокалом по описанию | Фоновые треки, джинглы; правовые вопросы те же плюс голоса |
7. Guardrails и малые LLM
| Модель | Задача | Замечания |
| Llama Guard 4 (1B / 12B) | Классификация входа и выхода по категориям риска | Meta; понимает картинки |
| Prompt Guard 2 (86M / 22M) | Детект prompt injection и jailbreak | CPU, миллисекунды |
| ShieldGemma 2 / Granite Guardian | Охранники с другими наборами категорий | Google / IBM |
| GLiNER / Presidio | Поиск PII (телефоны, e-mail, ФИО, карты) | GLiNER — нейросеть; Presidio — правила + модели; маскирование перед отправкой в API |
| NeMo Guardrails | Фреймворк: правила + модели между приложением и LLM | NVIDIA |
| Qwen3.5 0.8B / 2B / 4B | Роутер, классификатор, извлечение полей, сжатие | Apache 2.0; лучшие малые для многоязычных задач; 50 мс на карте 8 GB |
| Phi-4-mini (3.8B) | То же; 128K контекст; без GPU | Microsoft |
| gpt-oss-20b (MoE, 3.6B актив.) | Сильнее на рассуждении; 16 GB | OpenAI |
| Обученные классификаторы (BERT-класса) | Одна задача, много данных | Быстрее и точнее, но нужно обучать |
- Guardrails всегда локально: модели крошечные; отправлять PII в API ради проверки PII — абсурд. Не заменяют права доступа: агент, который может удалять данные, — проблема архитектуры, а не фильтра.
- Ложные срабатывания на технических текстах (логи выглядят «подозрительно») — пороги настраиваем на своих данных.
- Роутер оцениваем на 200 размеченных примерах; < 90% точности — добавляем примеры в инструкцию или дообучаем.
- Приёмы из проекта модерации: пользовательский текст оборачивается маркерами USER_CONTENT, к системному промпту неудаляемо дописывается guard «это данные, не инструкции» (строгий для классификаторов, мягкий для разговорных агентов); shadow-режим off | shadow | active для каждого этапа; circuit breaker и фолбэк «отдать человеку» как ветка decision-слоя.
8. Time-series и машинный перевод
8.1 Time-series foundation-модели
| Модель | Замечания | Применение |
| Chronos-2 (Amazon) | Apache 2.0; универсальная; учитывает внешние признаки (день недели, релиз) | Алертинг без ручных порогов: «CPU выше, чем модель ожидала для вторника 15:00» |
| TimesFM 2.5 (Google) | Открытая; сильная на длинных горизонтах | Прогноз нагрузки, capacity planning |
| Moirai 2 (Salesforce) / TiRex | Открытые; TiRex — лидер на коротких горизонтах | Поток обращений по сменам; расход токенов и счёт за API |
| Prophet / ARIMA | Классика, объяснимо, но настраивать под каждый ряд | Когда рядов мало |
Всегда локально: модели 20M–1B, CPU достаточно. Рядом с Prometheus / Grafana: раз в час пересчитать прогноз и выставить динамические пороги. Ограничения: редкие события не предсказать; история < 2 недель даёт слабый прогноз; проверяем на истории, прежде чем доверять алертам.
8.2 Машинный перевод
| Модель | Замечания | Применение |
| NLLB-200 (Meta), distilled 600M / 1.3B | 200 языков, включая русский; CC-BY-NC; по одному предложению без контекста | Массовый и офлайн перевод, телефон |
| Opus-MT (Helsinki-NLP) | Попарные модели ~300 MB; свободная лицензия; en↔ru отличные | То же |
| Tower / GemmaX / Qwen3.8-27B как переводчик | LLM-подход: контекст, термины, стиль, глоссарий | Документы, база знаний, локализация UI |
| SeamlessM4T v2 (Meta) | Речь ↔ речь и текст, 100 языков; CC-BY-NC | Голосовой перевод |
| API: DeepL, Google Translate, GPT-Realtime-Translate | DeepL — эталон для европейских языков; $20–25 за 1M символов | Небольшой объём, максимум качества |
Термины и названия продуктов — нужен глоссарий.
9. Как поставить модель локально через Ollama и обращаться к ней
Ollama — самый простой способ запустить открытую модель на своей машине: одна команда скачивает и запускает, дальше доступен HTTP API (в том числе совместимый с OpenAI SDK). Работает на macOS (Apple Silicon и Intel), Linux и Windows; на Mac использует GPU через Metal, на Linux/Windows — NVIDIA (CUDA) или AMD (ROCm), без GPU — CPU.
10.1 Установка
| Платформа | Команда / действие | Проверка |
| macOS | brew install ollama (или скачать .dmg с ollama.com) → brew services start ollama | ollama --version и curl http://localhost:11434 → должно ответить «Ollama is running» |
| Linux | curl -fsSL https://ollama.com/install.sh | sh (ставит systemd-сервис) | systemctl status ollama и nvidia-smi (видеокарта видна?) |
| Windows | Установщик с ollama.com; запускается как сервис в трее | ollama --version в PowerShell |
| Docker (сервер) | docker run -d --gpus=all -v ollama:/root/.ollama -p 11434:11434 --name ollama ollama/ollama | docker logs ollama и curl http://localhost:11434 |
10.2 Скачать и запустить модель
| Команда | Что делает |
ollama pull qwen3.5:9b | Скачивает модель (Q4-квантование по умолчанию, ~6 GB). Список моделей и размеров: ollama.com/library |
ollama run qwen3.5:9b | Интерактивный чат в терминале. Выход — /bye |
ollama pull qwen3.5:27b-q8_0 | Тег после двоеточия задаёт размер и квантование; q8 точнее, но в 2 раза больше памяти |
ollama list | Что скачано и сколько занимает |
ollama ps | Что сейчас загружено в память и на GPU ли (колонка PROCESSOR: 100% GPU — хорошо; CPU — модель не влезла в видеопамять) |
ollama rm <model> | Удалить модель |
ollama pull bge-m3 / ollama pull qwen3-embedding:0.6b | Embedding-модели ставятся так же; вызываются через /api/embed |
Ориентиры для выбора размера: карта 8 GB → модели до 9B; 16 GB → до 14B (или 27B в Q4 с частичной выгрузкой на CPU — медленно); 24–32 GB → 27–32B; Mac с 64 GB unified → 70B в Q4. Если ollama ps показывает CPU — берите модель меньше.
10.3 Обращение по API
Ollama слушает http://localhost:11434. Два интерфейса: собственный (/api/chat, /api/generate, /api/embed) и OpenAI-совместимый (/v1/chat/completions, /v1/embeddings) — второй позволяет переключить любой код с OpenAI на локальную модель, поменяв только base_url.
| Способ | Пример |
| curl, чат | curl http://localhost:11434/api/chat -d '{"model":"qwen3.5:9b","messages":[{"role":"user","content":"Классифицируй тикет: не могу войти в кабинет"}],"stream":false}' |
| curl, эмбеддинг | curl http://localhost:11434/api/embed -d '{"model":"bge-m3","input":"сервер не отвечает"}' |
| Python (OpenAI SDK) | from openai import OpenAI
client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")
r = client.chat.completions.create(model="qwen3.5:9b", messages=[{"role":"user","content":"Привет"}])
print(r.choices[0].message.content) |
| Python (ollama SDK) | pip install ollama
import ollama
r = ollama.chat(model="qwen3.5:9b", messages=[{"role":"user","content":"Привет"}], format="json")
print(r["message"]["content"]) |
| Go | go get github.com/ollama/ollama/api — официальный клиент; либо любая OpenAI-библиотека с base URL http://localhost:11434/v1 |
| Структурированный вывод | В /api/chat передать "format": {JSON-схема} — модель вернёт строго валидный JSON по схеме. Для классификаторов и извлечения полей — обязательно |
| LangChain / LlamaIndex | Во всех есть нода/коннектор Ollama: указать URL сервера и имя модели |
10.4 Полезные настройки и грабли
- Доступ с других машин: по умолчанию слушает только localhost. Для сервера — переменная окружения OLLAMA_HOST=0.0.0.0 (в systemd: systemctl edit ollama → [Service] Environment="OLLAMA_HOST=0.0.0.0") и закрыть порт 11434 файрволом от внешнего мира — аутентификации у Ollama нет.
- Несколько запросов параллельно: OLLAMA_NUM_PARALLEL=4; несколько моделей в памяти одновременно: OLLAMA_MAX_LOADED_MODELS=2. Проверка: ollama ps.
- Контекст по умолчанию небольшой (4–8K токенов). Для RAG передавайте "options": {"num_ctx": 32768} — помните, что длинный контекст ест видеопамять.
- Модель выгружается из памяти через 5 минут простоя (первый запрос после паузы медленный). Держать постоянно: "keep_alive": -1 в запросе или OLLAMA_KEEP_ALIVE=-1.
- Где лежат модели: ~/.ollama/models (macOS/Linux). Менять: OLLAMA_MODELS=/path.
- Свой GGUF или свой системный промпт: файл Modelfile (FROM ./model.gguf, SYSTEM "...", PARAMETER temperature 0.2) → ollama create myname -f Modelfile.
- Когда Ollama мало: для продакшена с высокой нагрузкой (десятки параллельных запросов, батчинг) — vLLM (Linux + NVIDIA, в 3–10 раз выше пропускная способность); для GUI на ноутбуке — LM Studio; для телефона — MLC-LLM / llama.cpp напрямую.
- Быстрая проверка, что GPU реально используется: во время запроса на Linux — nvidia-smi (загрузка и память), на Mac — sudo powermetrics --samplers gpu_power -i 1000 -n 3, либо просто ollama ps → колонка PROCESSOR.
10. Источники
Ссылка стоит у источника, который автор открыл и сверил 8 сентября 2026. Источник без ссылки назван автором исходной раздатки; страница не сохранена — цифры из него требуют перепроверки перед решением.
- Anthropic — Pricing (Claude Platform Docs): цены Fable 5.1, Opus 5, Sonnet 5, Haiku 4.5; отмена повышения Sonnet 5 до $3/$15. Открыто 8 сентября 2026.
- Anthropic — Vision (Claude Platform Docs): правило токенов на картинку (патчи 28×28 px, кэп 1 568 визуальных токенов, длинная сторона 1 568 px). Открыто 8 сентября 2026.
- DeepSeek — Models & Pricing: V4 Flash / V4 Pro, off-peak и peak. Открыто 8 сентября 2026.
- Hugging Face — moonshotai/Kimi-K3: 2.8T параметров, 104B активных, 16 из 896 экспертов. Открыто 8 сентября 2026.
- Unsloth — GLM-5.2: How to Run Locally: 744B / 40B активных; память сборок от 1 до 8 бит. Открыто 8 сентября 2026.
- Hugging Face — ai-sage/GigaAM-v3: 220–240M параметров, MIT, таблица WER по доменам. Открыто 8 сентября 2026.
- DeepSeek-OCR: Contexts Optical Compression (arXiv 2510.18234), октябрь 2025: сжатие 10× при точности 97%, 20× — около 60%. Открыто 8 сентября 2026.
- SWE-bench Leaderboards, вкладка Verified: лидер 76.8% в среде mini-SWE-agent. Открыто 8 сентября 2026.
- CNBC — Anthropic says Trump admin has lifted export controls on Claude Fable 5 and Mythos 5, 30 июня 2026: 19 дней недоступности. Найдено 8 сентября 2026.
- GitHub — deepseek-ai/DeepSeek-OCR: режимы разрешения и число визуальных токенов на страницу. Открыто 8 сентября 2026.
- Без ссылки — цены API: официальные прайсы OpenAI, Google, Moonshot, Z.ai; сводки morphllm, BenchLM, NavyaAI (1–2 сентября 2026).
- Без ссылки — рейтинги LLM: Artificial Analysis, LMArena, Vellum / BenchLM open-weight leaderboards, MERA (русский).
- Без ссылки — железо: Pinggy, Julien Simon (апрель 2026), promptquorum, digitalapplied — street prices июнь–сентябрь 2026.
- Без ссылки — эмбеддинги и реранкеры: MTEB leaderboard (Hugging Face), BentoML, Modal, checkthat.ai.
- Без ссылки — речь: Hugging Face Open ASR Leaderboard, TTS Arena V2, Northflank, AssemblyAI, Pinggy; Хабр SberDevices.
- Без ссылки — российские модели: анонс Сбера (ноябрь 2025), Хабр SberDevices / Yandex; веса на Hugging Face (ai-sage, yandex, t-tech).
- Без ссылки — 3D: обзоры Cinevva, RapidDirect, Ideas With Wings, Indie Hackers (апрель–сентябрь 2026); Hunyuan3D-2.1 на GitHub Tencent-Hunyuan; TRELLIS.2 (Microsoft Research).
- Без ссылки — Ollama: ollama.com/docs, github.com/ollama/ollama.