Qwen 3.5 нейросеть официальный сайт: полный обзор моделей, возможности и запуск

Подробный обзор нейросети Qwen 3.5: семейство моделей, архитектура, бенчмарки, запуск локально и через API. Узнайте, как использовать Qwen 3.5 в России без VPN и с оплатой картой РФ.

Что такое Qwen 3.5 и чем она отличается от предшественников

Qwen 3.5 — это не одна модель, а целое семейство из восьми открытых нейросетей, выпущенных Alibaba Cloud в конце февраля — начале марта 2026 года. В отличие от предыдущих версий, все модели Qwen 3.5 изначально мультимодальны: они работают с текстом, изображениями и видео без необходимости загружать отдельную версию VL. Архитектура гибридная: в моделях сочетаются линейное внимание (DeltaNet) и классические трансформеры, что даёт значительный прирост скорости при обработке длинных контекстов — до 19 раз быстрее на 256 тысячах токенов. Все модели выпущены под лицензией Apache 2.0, что разрешает коммерческое использование и доработку.

По сравнению с Qwen 3, новое поколение получило улучшенные способности к рассуждению, более широкий контекст и встроенную поддержку агентных сценариев. Младшие модели, например 9B, показывают результаты, сопоставимые с моделями в 13 раз большего размера, что делает Qwen 3.5 привлекательным выбором для разработчиков и компаний, которым нужна высокая производительность без огромных затрат на инфраструктуру.

Все модели семейства Qwen 3.5: от 0.8B до 397B параметров

Семейство Qwen 3.5 включает восемь открытых моделей с разным количеством параметров и архитектурой. Вот полный список:

  • 0.8B — самая компактная модель, подходит для встраиваемых систем, IoT и мобильных устройств. Требует около 1 ГБ видеопамяти в квантизации Q4.
  • 2B — лёгкая модель для чатов, суммаризации и простых задач. Занимает около 2 ГБ VRAM.
  • 4B — любимая модель сообщества для программирования. Стабильная, без падений производительности. Требует около 3 ГБ VRAM.
  • 9B — оптимальный баланс качества и скорости. Побеждает GPT-OSS-120B на нескольких бенчмарках знаний. В квантизации Q4 занимает около 6 ГБ VRAM.
  • 27B — плотная модель (dense) для творческого письма и сложных рассуждений. Требует около 16 ГБ VRAM в Q4.
  • 35B-A3B — Mixture of Experts (MoE) модель, активирующая только 3 миллиарда параметров на токен. Очень быстрая: до 196 токенов в секунду на RTX 4090. Требует около 22 ГБ VRAM.
  • 122B-A10B — MoE модель среднего уровня для многопроцессорных систем. Требует около 70 ГБ VRAM.
  • 397B-A17B — флагманская модель с 17 миллиардами активных параметров. Для запуска нужно несколько GPU или Mac с 256+ ГБ памяти. Требует около 220 ГБ VRAM в Q4.

Кроме того, доступны API-версии: Qwen3.5-Max-Preview (топ-10 в рейтинге LMArena Expert), Qwen3.5-Plus (дешёвый вариант для продакшена) и Qwen3.5-Omni (омнимодальная модель, работающая с текстом, изображениями, аудио и видео).

Архитектура DeltaNet: почему Qwen 3.5 быстрее и эффективнее

Ключевое нововведение Qwen 3.5 — гибридная архитектура DeltaNet, которая сочетает линейное внимание с традиционными трансформерами. Линейное внимание позволяет обрабатывать длинные последовательности токенов без квадратичного роста вычислительных затрат, характерного для обычных трансформеров. В результате модели Qwen 3.5 работают значительно быстрее на больших контекстах: например, при 256 тысячах токенов скорость вывода увеличивается до 19 раз по сравнению с моделями предыдущего поколения.

Пять моделей семейства (27B, 9B, 4B, 2B, 0.8B) являются плотными (dense) — все параметры активируются на каждом токене. Это даёт предсказуемое качество и простой расчёт видеопамяти. Три модели (397B, 122B, 35B) используют архитектуру Mixture of Experts (MoE), где на каждый токен активируется только часть параметров. Например, 35B-A3B имеет 35 миллиардов параметров, но активирует лишь 3 миллиарда на токен, что обеспечивает высокую скорость при большом объёме знаний. Такая гибридность позволяет выбирать модель под конкретные задачи: плотные — для творчества и точности, MoE — для скорости и массовой обработки.

Бенчмарки: где Qwen 3.5 превосходит конкурентов, а где уступает

Флагманская модель 397B-A17B конкурирует с GPT-5.2, Claude Opus и Gemini 3 Pro. Результаты тестов показывают, где Qwen 3.5 сильна, а где есть отставание:

  • MMLU-Pro (знания): 87.8 — немного ниже Claude Opus (89.5).
  • GPQA Diamond (наука): 88.4 — уступает GPT-5.2 (92.4).
  • IFBench (следование инструкциям): 76.5 — превосходит GPT-5.2 (75.4).
  • SWE-bench Verified (программирование): 76.4 — ниже Claude Opus (80.9).
  • LiveCodeBench v6: 83.6 — значительно ниже Gemini 3 Pro (90.7).
  • MathVision (мультимодальная математика): 88.6 — превосходит GPT-5.2 (83.0).
  • Terminal-Bench 2.0 (агентные задачи): 52.5 — огромный скачок по сравнению с Qwen3-Max (22.5).
  • BrowseComp (браузерный агент): 69.0 — превосходит GPT-5.2 (65.8).

Модель 9B, будучи в 13 раз меньше, чем GPT-OSS-120B, превосходит её на нескольких бенчмарках знаний, что делает её отличным выбором для большинства практических задач. Модель 35B-A3B показывает выдающуюся скорость при сохранении высокого качества, особенно в кодинге и агентных сценариях.

Как запустить Qwen 3.5 локально: требования к железу и инструкция

Запустить Qwen 3.5 на своём компьютере можно через llama.cpp, vLLM, MLX или Ollama (с оговорками). Все модели доступны на HuggingFace в формате GGUF от Unsloth. Вот минимальные требования к видеопамяти для разных моделей в квантизации Q4_K_M:

  • 0.8B: ~1 ГБ
  • 2B: ~2 ГБ
  • 4B: ~3 ГБ
  • 9B: ~6 ГБ
  • 27B: ~16 ГБ
  • 35B-A3B: ~22 ГБ
  • 122B-A10B: ~70 ГБ
  • 397B-A17B: ~220 ГБ

Для большинства пользователей оптимальным выбором будет 9B в Q4 (помещается в 6 ГБ) или 35B-A3B в Q4 (требует 22 ГБ, но выдаёт до 196 токенов/с на RTX 4090). Если у вас 24 ГБ видеопамяти (RTX 3090/4090), 35B-A3B — лучший вариант по скорости и качеству. Для творческого письма лучше подойдёт 27B Dense (16 ГБ).

Быстрый старт с llama.cpp:

./llama-server -m Qwen3.5-9B-Q4_K_M.gguf -c 32768

Важно: Ollama на момент марта 2026 года имеет проблемы с Qwen 3.5 — бесконечные циклы рассуждений, сломанный вызов инструментов и низкую скорость. Рекомендуется использовать llama.cpp или vLLM до выхода исправлений. LM Studio также ненадёжна в режиме рассуждений.

Qwen 3.5 в России: доступ без VPN и оплата картой РФ

Для российских пользователей доступ к Qwen 3.5 может быть осложнён блокировками и ограничениями на оплату. Однако существуют агрегаторы нейросетей, которые предоставляют доступ к Qwen 3.5 без VPN и с оплатой российскими картами. Например, платформа Study AI и НЕЙРО·ХАБ предлагают возможность протестировать Qwen 3.5 онлайн, выбрав нужную модель из списка. Это удобно для маркетологов, аналитиков, студентов и разработчиков, которым нужен быстрый доступ без настройки инфраструктуры.

Также можно скачать модель с официального сайта Alibaba Cloud или HuggingFace и запустить локально, что гарантирует полную конфиденциальность данных. Для этого потребуется GPU с достаточным объёмом видеопамяти (см. раздел выше). Важно: при локальном запуске вы не зависите от сторонних сервисов и можете использовать модель для коммерческих проектов без ограничений.

Агентные возможности и мультимодальность Qwen 3.5

Все модели Qwen 3.5 изначально мультимодальны: они понимают изображения и видео, а также могут генерировать текст. Это значит, что не нужно загружать отдельную версию VL — любая модель семейства готова к работе с визуальными данными. Модели поддерживают вызов функций (function calling) и протокол MCP (Model Context Protocol), что позволяет подключать внешние API, базы данных, калькуляторы и поисковые системы в одном запросе.

Агентные возможности значительно улучшены по сравнению с Qwen 3. Например, на бенчмарке Terminal-Bench 2.0, который оценивает способность модели выполнять сложные многошаговые задачи в терминале, Qwen 3.5 397B набрала 52.5 балла против 22.5 у Qwen3-Max — это более чем двукратный рост. На BrowseComp (браузерный агент) модель также превзошла GPT-5.2 (69.0 против 65.8). Это делает Qwen 3.5 отличным выбором для автоматизации рабочих процессов, создания ИИ-ассистентов и интеграции в существующие системы.

Сравнение Qwen 3.5 с конкурентами: GPT, Claude, Gemini и DeepSeek

Qwen 3.5 конкурирует с ведущими проприетарными моделями, но имеет ключевое преимущество — открытые веса и лицензия Apache 2.0. Вот основные отличия:

  • Против GPT-5.2: Qwen 3.5 397B превосходит GPT-5.2 в следовании инструкциям, мультимодальной математике и агентных задачах, но уступает в научных рассуждениях (GPQA) и программировании (LiveCodeBench). При этом Qwen 3.5 можно запустить локально, что даёт полный контроль над данными.
  • Против Claude Opus: Qwen 3.5 отстаёт по знаниям (MMLU-Pro) и кодингу (SWE-bench), но выигрывает в агентных сценариях и мультимодальности. Claude остаётся сильнее в творческом письме и безопасности.
  • Против Gemini 3 Pro: Gemini доминирует в программировании (LiveCodeBench), но Qwen 3.5 показывает лучшие результаты в математике с изображениями и агентных задачах.
  • Против DeepSeek: DeepSeek часто быстрее и эффективнее по FLOPs, особенно на английском и китайском коде. Qwen 3.5 выигрывает в мультиязычности, длинном контексте и возможности тонкой настройки под международные продукты.

Главное преимущество Qwen 3.5 — открытость. Вы можете скачать модель, дообучить её на своих данных и развернуть на собственной инфраструктуре, не платя за каждый запрос.

Как выбрать подходящую модель Qwen 3.5 для своей задачи

Выбор модели зависит от ваших задач, доступного железа и бюджета. Вот рекомендации:

  • Для локального использования на слабом ПК (8 ГБ VRAM или меньше): выбирайте 4B или 2B. 4B — фаворит сообщества для кодинга, стабильна и не теряет производительность. 2B подходит для чатов и суммаризации. 0.8B — для встраиваемых систем.
  • Для среднего ПК (12-16 ГБ VRAM): оптимальный выбор — 9B в Q4 (помещается в 6 ГБ, оставляя место для контекста). Превосходит модели в 13 раз больше по знаниям. Отлично подходит для агентного кодинга на RTX 3060.
  • Для мощного ПК (24 ГБ VRAM): 35B-A3B в Q4 — 196 токенов/с на RTX 4090, невероятно быстро. Или 27B Dense для творческого письма и сложных рассуждений (медленнее, но плотнее).
  • Для сервера (48+ ГБ VRAM): 122B-A10B — хороший баланс качества и скорости. 397B-A17B — флагман для максимального качества, требует multi-GPU или Mac с 256+ ГБ.
  • Для API: Qwen3.5-Max-Preview — лучшее качество (топ-10 LMArena Expert). Qwen3.5-Plus — дешёвый вариант для продакшена ($0.26/M входных токенов). Qwen3-Max-Thinking — для пакетной обработки, где не нужно последнее поколение.

Если не уверены, начните с 9B — это универсальный выбор, который работает на большинстве современных GPU и даёт отличные результаты.

Вопросы и ответы

Где находится официальный сайт Qwen 3.5 и как скачать модель?

Официальный сайт Qwen 3.5 — это страница Alibaba Cloud на HuggingFace (huggingface.co/Qwen) и репозиторий на GitHub. Там вы найдёте все восемь моделей, инструкции по развёртыванию и ссылки на веса. Для скачивания используйте команды git lfs или загрузите GGUF-файлы от Unsloth. Также можно запустить модель онлайн через агрегаторы, такие как Study AI или НЕЙРО·ХАБ, без необходимости скачивания.

Можно ли использовать Qwen 3.5 в России без VPN?

Да, для этого существуют агрегаторы нейросетей, например Study AI и НЕЙРО·ХАБ, которые предоставляют доступ к Qwen 3.5 через веб-интерфейс без VPN и с оплатой российскими картами. Также можно скачать модель с HuggingFace и запустить локально — в этом случае VPN не нужен, так как весь трафик остаётся на вашем устройстве.

Какие требования к железу для запуска Qwen 3.5 9B?

Модель Qwen 3.5 9B в квантизации Q4_K_M требует около 6 ГБ видеопамяти. Это позволяет запускать её на большинстве современных GPU, например NVIDIA RTX 3060 с 12 ГБ. Для полной точности (BF16) потребуется 18 ГБ. Рекомендуется использовать llama.cpp или vLLM для оптимальной производительности.

В чём разница между плотными и MoE моделями Qwen 3.5?

Плотные модели (27B, 9B, 4B, 2B, 0.8B) активируют все параметры на каждом токене, что даёт предсказуемое качество и простой расчёт VRAM. MoE модели (397B, 122B, 35B) имеют больше параметров, но активируют только часть на токен, что обеспечивает высокую скорость при большом объёме знаний. Например, 35B-A3B активирует 3B из 35B, достигая 196 токенов/с на RTX 4090.

Какие бенчмарки лучше всего показывают возможности Qwen 3.5?

Для оценки знаний и рассуждений смотрите MMLU-Pro и GPQA Diamond. Для программирования — SWE-bench Verified и LiveCodeBench. Для агентных задач — Terminal-Bench 2.0 и BrowseComp. Мультимодальные способности проверяются на MathVision. Qwen 3.5 397B лидирует в следовании инструкциям (IFBench) и агентных сценариях, но уступает в научных и кодовых тестах GPT-5.2 и Gemini 3 Pro.

Можно ли дообучить Qwen 3.5 под свои задачи?

Да, все модели Qwen 3.5 выпущены под лицензией Apache 2.0, что разрешает коммерческое использование, доработку и распространение. Вы можете дообучить модель на своих данных с помощью фреймворков вроде Hugging Face Transformers, Axolotl или Unsloth. Это особенно полезно для отраслевых задач (финтех, медицина, логистика), где нужна специализированная точность.

Какие проблемы с Ollama при запуске Qwen 3.5?

По состоянию на март 2026 года Ollama имеет серьёзные проблемы с Qwen 3.5: бесконечные циклы рассуждений, полностью сломанный вызов инструментов (issue #14493), скорость 15-20 токенов/с против 100+ у llama.cpp, и неработающая мультимодальность (mmproj файлы не встроены). Рекомендуется использовать llama.cpp, vLLM или MLX до выхода исправлений (обычно 2-4 недели после релиза).