🧬 Виды моделей ИИ
Классификация моделей: языковые, мультимодальные, генеративные, рассуждающие, эмбеддинги и когда что брать.
Теория · ИИ · #ai #models #llm #ml
По типу задачи
| Тип | Что делает | Примеры |
|---|---|---|
| Языковые (LLM) | понимают и генерируют текст и код | GPT, Claude, Gemini, Llama, Qwen, Mistral, DeepSeek, GigaChat, YandexGPT |
| Рассуждающие (reasoning) | думают пошагово перед ответом, сильны в математике и коде | o-серия OpenAI, Claude с расширенным мышлением, DeepSeek-R1, Gemini Thinking, Qwen QwQ |
| Мультимодальные | текст + изображения, звук, видео | GPT-4o, Claude, Gemini, Llama Vision, Qwen-VL |
| Генерация изображений | картинки по описанию | Stable Diffusion, Flux, Midjourney, DALL·E, Imagen |
| Генерация видео | клипы по тексту или картинке | Sora, Veo, Runway, Kling, Wan |
| Речь в текст (ASR) | распознавание речи | Whisper, GigaAM |
| Текст в речь (TTS) | синтез голоса | ElevenLabs, XTTS, Silero |
| Эмбеддинги | вектор смысла текста | text-embedding, bge, e5, nomic-embed, Cohere Embed |
| Реранкеры | переупорядочивают найденное по релевантности | bge-reranker, Cohere Rerank |
| Зрение | классификация, детекция, сегментация | ResNet, YOLO, SAM, ViT, CLIP |
| Код | автодополнение, правки, агенты | модели общего назначения, Qwen-Coder, Codestral, DeepSeek-Coder |
| Табличные | прогноз по таблицам | градиентный бустинг, TabPFN |
По доступности
| Вид | Плюсы | Минусы |
|---|---|---|
| Закрытые (API) | максимальное качество, нет инфраструктуры | данные уходят провайдеру, плата за токены, зависимость |
| Открытые веса (Llama, Qwen, Mistral, Gemma, DeepSeek) | можно запускать у себя, дообучать, приватность | нужно железо и сопровождение |
| Открытый код и данные | полная прозрачность | встречаются реже |
По размеру
Малые (1–8 млрд параметров) работают на ноутбуке и телефоне, средние (14–70 млрд) требуют сервер с GPU, большие (сотни млрд) в облаке. Параметры влияют на знания и качество, но не гарантируют его: свежие небольшие модели часто превосходят старые большие.
Ключевые параметры LLM
| Параметр | Смысл |
|---|---|
| Контекстное окно | сколько токенов видит модель за раз (8 тыс. – 1 млн и более) |
| Токен | кусочек слова (примерно 3–4 символа для английского, меньше для русского) |
| Temperature | случайность: 0 почти детерминированно, 1 творчески |
| Top-p, top-k | ограничение выбора вероятных токенов |
| Max tokens | предел длины ответа |
| System prompt | инструкции роли и правил |
| Tools / function calling | вызов внешних функций |
| Structured output | гарантированный JSON по схеме |
Как выбирать модель
| Задача | Подход |
|---|---|
| Чат-ассистент, документы | сильная LLM + RAG |
| Классификация, извлечение данных | малая модель, структурированный вывод, дообучение при больших объёмах |
| Код и агенты | модель с хорошим кодом, вызовом инструментов, длинным контекстом |
| Поиск по документам | эмбеддинги + реранкер + LLM |
| Приватные данные | открытая модель у себя или облако с договорными гарантиями |
| Дёшево и быстро | малая модель, кэш промптов, пакетная обработка |
| Распознавание документов | OCR + мультимодальная модель |
Как сравнивать
Бенчмарки (MMLU, GPQA, HumanEval, SWE-bench, LMArena) дают ориентир, но проверяйте на своих данных: соберите 50–200 типичных запросов и сравните качество, задержку и стоимость.
Риски
Галлюцинации (проверка фактов, RAG, цитаты), утечка данных, смещения, зависимость от версии модели (фиксируйте версию), нестабильность ответов, юридические ограничения на данные и контент.