🧬 Виды моделей ИИ

Классификация моделей: языковые, мультимодальные, генеративные, рассуждающие, эмбеддинги и когда что брать.

Теория · ИИ · #ai #models #llm #ml

По типу задачи

Тип Что делает Примеры
Языковые (LLM) понимают и генерируют текст и код GPT, Claude, Gemini, Llama, Qwen, Mistral, DeepSeek, GigaChat, YandexGPT
Рассуждающие (reasoning) думают пошагово перед ответом, сильны в математике и коде o-серия OpenAI, Claude с расширенным мышлением, DeepSeek-R1, Gemini Thinking, Qwen QwQ
Мультимодальные текст + изображения, звук, видео GPT-4o, Claude, Gemini, Llama Vision, Qwen-VL
Генерация изображений картинки по описанию Stable Diffusion, Flux, Midjourney, DALL·E, Imagen
Генерация видео клипы по тексту или картинке Sora, Veo, Runway, Kling, Wan
Речь в текст (ASR) распознавание речи Whisper, GigaAM
Текст в речь (TTS) синтез голоса ElevenLabs, XTTS, Silero
Эмбеддинги вектор смысла текста text-embedding, bge, e5, nomic-embed, Cohere Embed
Реранкеры переупорядочивают найденное по релевантности bge-reranker, Cohere Rerank
Зрение классификация, детекция, сегментация ResNet, YOLO, SAM, ViT, CLIP
Код автодополнение, правки, агенты модели общего назначения, Qwen-Coder, Codestral, DeepSeek-Coder
Табличные прогноз по таблицам градиентный бустинг, TabPFN

По доступности

Вид Плюсы Минусы
Закрытые (API) максимальное качество, нет инфраструктуры данные уходят провайдеру, плата за токены, зависимость
Открытые веса (Llama, Qwen, Mistral, Gemma, DeepSeek) можно запускать у себя, дообучать, приватность нужно железо и сопровождение
Открытый код и данные полная прозрачность встречаются реже

По размеру

Малые (1–8 млрд параметров) работают на ноутбуке и телефоне, средние (14–70 млрд) требуют сервер с GPU, большие (сотни млрд) в облаке. Параметры влияют на знания и качество, но не гарантируют его: свежие небольшие модели часто превосходят старые большие.

Ключевые параметры LLM

Параметр Смысл
Контекстное окно сколько токенов видит модель за раз (8 тыс. – 1 млн и более)
Токен кусочек слова (примерно 3–4 символа для английского, меньше для русского)
Temperature случайность: 0 почти детерминированно, 1 творчески
Top-p, top-k ограничение выбора вероятных токенов
Max tokens предел длины ответа
System prompt инструкции роли и правил
Tools / function calling вызов внешних функций
Structured output гарантированный JSON по схеме

Как выбирать модель

Задача Подход
Чат-ассистент, документы сильная LLM + RAG
Классификация, извлечение данных малая модель, структурированный вывод, дообучение при больших объёмах
Код и агенты модель с хорошим кодом, вызовом инструментов, длинным контекстом
Поиск по документам эмбеддинги + реранкер + LLM
Приватные данные открытая модель у себя или облако с договорными гарантиями
Дёшево и быстро малая модель, кэш промптов, пакетная обработка
Распознавание документов OCR + мультимодальная модель

Как сравнивать

Бенчмарки (MMLU, GPQA, HumanEval, SWE-bench, LMArena) дают ориентир, но проверяйте на своих данных: соберите 50–200 типичных запросов и сравните качество, задержку и стоимость.

Риски

Галлюцинации (проверка фактов, RAG, цитаты), утечка данных, смещения, зависимость от версии модели (фиксируйте версию), нестабильность ответов, юридические ограничения на данные и контент.