Что такое Qwen 3.5 и чем она отличается от предшественников
Qwen 3.5 — это не одна модель, а целое семейство из восьми открытых нейросетей, выпущенных Alibaba Cloud в конце февраля — начале марта 2026 года. В отличие от предыдущих версий, все модели Qwen 3.5 изначально мультимодальны: они работают с текстом, изображениями и видео без необходимости загружать отдельную версию VL. Архитектура гибридная: в моделях сочетаются линейное внимание (DeltaNet) и классические трансформеры, что даёт значительный прирост скорости при обработке длинных контекстов — до 19 раз быстрее на 256 тысячах токенов. Все модели выпущены под лицензией Apache 2.0, что разрешает коммерческое использование и доработку.
По сравнению с Qwen 3, новое поколение получило улучшенные способности к рассуждению, более широкий контекст и встроенную поддержку агентных сценариев. Младшие модели, например 9B, показывают результаты, сопоставимые с моделями в 13 раз большего размера, что делает Qwen 3.5 привлекательным выбором для разработчиков и компаний, которым нужна высокая производительность без огромных затрат на инфраструктуру.
Все модели семейства Qwen 3.5: от 0.8B до 397B параметров
Семейство Qwen 3.5 включает восемь открытых моделей с разным количеством параметров и архитектурой. Вот полный список:
- 0.8B — самая компактная модель, подходит для встраиваемых систем, IoT и мобильных устройств. Требует около 1 ГБ видеопамяти в квантизации Q4.
- 2B — лёгкая модель для чатов, суммаризации и простых задач. Занимает около 2 ГБ VRAM.
- 4B — любимая модель сообщества для программирования. Стабильная, без падений производительности. Требует около 3 ГБ VRAM.
- 9B — оптимальный баланс качества и скорости. Побеждает GPT-OSS-120B на нескольких бенчмарках знаний. В квантизации Q4 занимает около 6 ГБ VRAM.
- 27B — плотная модель (dense) для творческого письма и сложных рассуждений. Требует около 16 ГБ VRAM в Q4.
- 35B-A3B — Mixture of Experts (MoE) модель, активирующая только 3 миллиарда параметров на токен. Очень быстрая: до 196 токенов в секунду на RTX 4090. Требует около 22 ГБ VRAM.
- 122B-A10B — MoE модель среднего уровня для многопроцессорных систем. Требует около 70 ГБ VRAM.
- 397B-A17B — флагманская модель с 17 миллиардами активных параметров. Для запуска нужно несколько GPU или Mac с 256+ ГБ памяти. Требует около 220 ГБ VRAM в Q4.
Кроме того, доступны API-версии: Qwen3.5-Max-Preview (топ-10 в рейтинге LMArena Expert), Qwen3.5-Plus (дешёвый вариант для продакшена) и Qwen3.5-Omni (омнимодальная модель, работающая с текстом, изображениями, аудио и видео).
Архитектура DeltaNet: почему Qwen 3.5 быстрее и эффективнее
Ключевое нововведение Qwen 3.5 — гибридная архитектура DeltaNet, которая сочетает линейное внимание с традиционными трансформерами. Линейное внимание позволяет обрабатывать длинные последовательности токенов без квадратичного роста вычислительных затрат, характерного для обычных трансформеров. В результате модели Qwen 3.5 работают значительно быстрее на больших контекстах: например, при 256 тысячах токенов скорость вывода увеличивается до 19 раз по сравнению с моделями предыдущего поколения.
Пять моделей семейства (27B, 9B, 4B, 2B, 0.8B) являются плотными (dense) — все параметры активируются на каждом токене. Это даёт предсказуемое качество и простой расчёт видеопамяти. Три модели (397B, 122B, 35B) используют архитектуру Mixture of Experts (MoE), где на каждый токен активируется только часть параметров. Например, 35B-A3B имеет 35 миллиардов параметров, но активирует лишь 3 миллиарда на токен, что обеспечивает высокую скорость при большом объёме знаний. Такая гибридность позволяет выбирать модель под конкретные задачи: плотные — для творчества и точности, MoE — для скорости и массовой обработки.
Бенчмарки: где Qwen 3.5 превосходит конкурентов, а где уступает
Флагманская модель 397B-A17B конкурирует с GPT-5.2, Claude Opus и Gemini 3 Pro. Результаты тестов показывают, где Qwen 3.5 сильна, а где есть отставание:
- MMLU-Pro (знания): 87.8 — немного ниже Claude Opus (89.5).
- GPQA Diamond (наука): 88.4 — уступает GPT-5.2 (92.4).
- IFBench (следование инструкциям): 76.5 — превосходит GPT-5.2 (75.4).
- SWE-bench Verified (программирование): 76.4 — ниже Claude Opus (80.9).
- LiveCodeBench v6: 83.6 — значительно ниже Gemini 3 Pro (90.7).
- MathVision (мультимодальная математика): 88.6 — превосходит GPT-5.2 (83.0).
- Terminal-Bench 2.0 (агентные задачи): 52.5 — огромный скачок по сравнению с Qwen3-Max (22.5).
- BrowseComp (браузерный агент): 69.0 — превосходит GPT-5.2 (65.8).
Модель 9B, будучи в 13 раз меньше, чем GPT-OSS-120B, превосходит её на нескольких бенчмарках знаний, что делает её отличным выбором для большинства практических задач. Модель 35B-A3B показывает выдающуюся скорость при сохранении высокого качества, особенно в кодинге и агентных сценариях.
Как запустить Qwen 3.5 локально: требования к железу и инструкция
Запустить Qwen 3.5 на своём компьютере можно через llama.cpp, vLLM, MLX или Ollama (с оговорками). Все модели доступны на HuggingFace в формате GGUF от Unsloth. Вот минимальные требования к видеопамяти для разных моделей в квантизации Q4_K_M:
- 0.8B: ~1 ГБ
- 2B: ~2 ГБ
- 4B: ~3 ГБ
- 9B: ~6 ГБ
- 27B: ~16 ГБ
- 35B-A3B: ~22 ГБ
- 122B-A10B: ~70 ГБ
- 397B-A17B: ~220 ГБ
Для большинства пользователей оптимальным выбором будет 9B в Q4 (помещается в 6 ГБ) или 35B-A3B в Q4 (требует 22 ГБ, но выдаёт до 196 токенов/с на RTX 4090). Если у вас 24 ГБ видеопамяти (RTX 3090/4090), 35B-A3B — лучший вариант по скорости и качеству. Для творческого письма лучше подойдёт 27B Dense (16 ГБ).
Быстрый старт с llama.cpp:
./llama-server -m Qwen3.5-9B-Q4_K_M.gguf -c 32768Важно: Ollama на момент марта 2026 года имеет проблемы с Qwen 3.5 — бесконечные циклы рассуждений, сломанный вызов инструментов и низкую скорость. Рекомендуется использовать llama.cpp или vLLM до выхода исправлений. LM Studio также ненадёжна в режиме рассуждений.
Qwen 3.5 в России: доступ без VPN и оплата картой РФ
Для российских пользователей доступ к Qwen 3.5 может быть осложнён блокировками и ограничениями на оплату. Однако существуют агрегаторы нейросетей, которые предоставляют доступ к Qwen 3.5 без VPN и с оплатой российскими картами. Например, платформа Study AI и НЕЙРО·ХАБ предлагают возможность протестировать Qwen 3.5 онлайн, выбрав нужную модель из списка. Это удобно для маркетологов, аналитиков, студентов и разработчиков, которым нужен быстрый доступ без настройки инфраструктуры.
Также можно скачать модель с официального сайта Alibaba Cloud или HuggingFace и запустить локально, что гарантирует полную конфиденциальность данных. Для этого потребуется GPU с достаточным объёмом видеопамяти (см. раздел выше). Важно: при локальном запуске вы не зависите от сторонних сервисов и можете использовать модель для коммерческих проектов без ограничений.
Агентные возможности и мультимодальность Qwen 3.5
Все модели Qwen 3.5 изначально мультимодальны: они понимают изображения и видео, а также могут генерировать текст. Это значит, что не нужно загружать отдельную версию VL — любая модель семейства готова к работе с визуальными данными. Модели поддерживают вызов функций (function calling) и протокол MCP (Model Context Protocol), что позволяет подключать внешние API, базы данных, калькуляторы и поисковые системы в одном запросе.
Агентные возможности значительно улучшены по сравнению с Qwen 3. Например, на бенчмарке Terminal-Bench 2.0, который оценивает способность модели выполнять сложные многошаговые задачи в терминале, Qwen 3.5 397B набрала 52.5 балла против 22.5 у Qwen3-Max — это более чем двукратный рост. На BrowseComp (браузерный агент) модель также превзошла GPT-5.2 (69.0 против 65.8). Это делает Qwen 3.5 отличным выбором для автоматизации рабочих процессов, создания ИИ-ассистентов и интеграции в существующие системы.
Сравнение Qwen 3.5 с конкурентами: GPT, Claude, Gemini и DeepSeek
Qwen 3.5 конкурирует с ведущими проприетарными моделями, но имеет ключевое преимущество — открытые веса и лицензия Apache 2.0. Вот основные отличия:
- Против GPT-5.2: Qwen 3.5 397B превосходит GPT-5.2 в следовании инструкциям, мультимодальной математике и агентных задачах, но уступает в научных рассуждениях (GPQA) и программировании (LiveCodeBench). При этом Qwen 3.5 можно запустить локально, что даёт полный контроль над данными.
- Против Claude Opus: Qwen 3.5 отстаёт по знаниям (MMLU-Pro) и кодингу (SWE-bench), но выигрывает в агентных сценариях и мультимодальности. Claude остаётся сильнее в творческом письме и безопасности.
- Против Gemini 3 Pro: Gemini доминирует в программировании (LiveCodeBench), но Qwen 3.5 показывает лучшие результаты в математике с изображениями и агентных задачах.
- Против DeepSeek: DeepSeek часто быстрее и эффективнее по FLOPs, особенно на английском и китайском коде. Qwen 3.5 выигрывает в мультиязычности, длинном контексте и возможности тонкой настройки под международные продукты.
Главное преимущество Qwen 3.5 — открытость. Вы можете скачать модель, дообучить её на своих данных и развернуть на собственной инфраструктуре, не платя за каждый запрос.
Как выбрать подходящую модель Qwen 3.5 для своей задачи
Выбор модели зависит от ваших задач, доступного железа и бюджета. Вот рекомендации:
- Для локального использования на слабом ПК (8 ГБ VRAM или меньше): выбирайте 4B или 2B. 4B — фаворит сообщества для кодинга, стабильна и не теряет производительность. 2B подходит для чатов и суммаризации. 0.8B — для встраиваемых систем.
- Для среднего ПК (12-16 ГБ VRAM): оптимальный выбор — 9B в Q4 (помещается в 6 ГБ, оставляя место для контекста). Превосходит модели в 13 раз больше по знаниям. Отлично подходит для агентного кодинга на RTX 3060.
- Для мощного ПК (24 ГБ VRAM): 35B-A3B в Q4 — 196 токенов/с на RTX 4090, невероятно быстро. Или 27B Dense для творческого письма и сложных рассуждений (медленнее, но плотнее).
- Для сервера (48+ ГБ VRAM): 122B-A10B — хороший баланс качества и скорости. 397B-A17B — флагман для максимального качества, требует multi-GPU или Mac с 256+ ГБ.
- Для API: Qwen3.5-Max-Preview — лучшее качество (топ-10 LMArena Expert). Qwen3.5-Plus — дешёвый вариант для продакшена ($0.26/M входных токенов). Qwen3-Max-Thinking — для пакетной обработки, где не нужно последнее поколение.
Если не уверены, начните с 9B — это универсальный выбор, который работает на большинстве современных GPU и даёт отличные результаты.
Вопросы и ответы
Где находится официальный сайт Qwen 3.5 и как скачать модель?
Официальный сайт Qwen 3.5 — это страница Alibaba Cloud на HuggingFace (huggingface.co/Qwen) и репозиторий на GitHub. Там вы найдёте все восемь моделей, инструкции по развёртыванию и ссылки на веса. Для скачивания используйте команды git lfs или загрузите GGUF-файлы от Unsloth. Также можно запустить модель онлайн через агрегаторы, такие как Study AI или НЕЙРО·ХАБ, без необходимости скачивания.
Можно ли использовать Qwen 3.5 в России без VPN?
Да, для этого существуют агрегаторы нейросетей, например Study AI и НЕЙРО·ХАБ, которые предоставляют доступ к Qwen 3.5 через веб-интерфейс без VPN и с оплатой российскими картами. Также можно скачать модель с HuggingFace и запустить локально — в этом случае VPN не нужен, так как весь трафик остаётся на вашем устройстве.
Какие требования к железу для запуска Qwen 3.5 9B?
Модель Qwen 3.5 9B в квантизации Q4_K_M требует около 6 ГБ видеопамяти. Это позволяет запускать её на большинстве современных GPU, например NVIDIA RTX 3060 с 12 ГБ. Для полной точности (BF16) потребуется 18 ГБ. Рекомендуется использовать llama.cpp или vLLM для оптимальной производительности.
В чём разница между плотными и MoE моделями Qwen 3.5?
Плотные модели (27B, 9B, 4B, 2B, 0.8B) активируют все параметры на каждом токене, что даёт предсказуемое качество и простой расчёт VRAM. MoE модели (397B, 122B, 35B) имеют больше параметров, но активируют только часть на токен, что обеспечивает высокую скорость при большом объёме знаний. Например, 35B-A3B активирует 3B из 35B, достигая 196 токенов/с на RTX 4090.
Какие бенчмарки лучше всего показывают возможности Qwen 3.5?
Для оценки знаний и рассуждений смотрите MMLU-Pro и GPQA Diamond. Для программирования — SWE-bench Verified и LiveCodeBench. Для агентных задач — Terminal-Bench 2.0 и BrowseComp. Мультимодальные способности проверяются на MathVision. Qwen 3.5 397B лидирует в следовании инструкциям (IFBench) и агентных сценариях, но уступает в научных и кодовых тестах GPT-5.2 и Gemini 3 Pro.
Можно ли дообучить Qwen 3.5 под свои задачи?
Да, все модели Qwen 3.5 выпущены под лицензией Apache 2.0, что разрешает коммерческое использование, доработку и распространение. Вы можете дообучить модель на своих данных с помощью фреймворков вроде Hugging Face Transformers, Axolotl или Unsloth. Это особенно полезно для отраслевых задач (финтех, медицина, логистика), где нужна специализированная точность.
Какие проблемы с Ollama при запуске Qwen 3.5?
По состоянию на март 2026 года Ollama имеет серьёзные проблемы с Qwen 3.5: бесконечные циклы рассуждений, полностью сломанный вызов инструментов (issue #14493), скорость 15-20 токенов/с против 100+ у llama.cpp, и неработающая мультимодальность (mmproj файлы не встроены). Рекомендуется использовать llama.cpp, vLLM или MLX до выхода исправлений (обычно 2-4 недели после релиза).