Qwen3.5-122B-A10B

Active Parameters

122B

Context Length

262K

Modality

Multimodal

Architecture

Mixture of Experts (MoE)

License

Apache 2.0

Release Date

24 Feb 2026

Knowledge Cutoff

Technical Specifications

Attention

Attention Structure

Grouped-Query Attention

Attention Heads

Key-Value Heads

Attention Head Dimension

256

Position Embedding

ROPE

RoPE Theta

10,000,000

Sliding Window Attention

Sliding Window Size

Normalization

RMS Normalization

Activation Function

SwigLU

Dimensions

Hidden Dimension Size

3,072

Number of Layers

FFN Intermediate Size (Dense)

1,024

Multi-Token Prediction Heads

Tokenizer

Vocabulary Size

248,320

Mixture of Experts

Total Expert Parameters

10.0B

Number of Experts

256

Active Experts

Shared Experts

FFN Intermediate Size (per Expert)

1,024

Dense Layers Before MoE

Architecture Diagram

Qwen3.5-122B-A10B

Qwen3.5-122B-A10B is Alibaba Cloud's mid-tier multimodal foundation model, released February 2026. With 122B total parameters and 10B activated through a Mixture-of-Experts architecture (256 experts), it balances high performance with computational efficiency. It achieves strong scores on MMLU-Pro (86.1%), GPQA Diamond (85.5%), SWE-bench Verified (72.4%), and Terminal-Bench 2.0 (41.6%). Features unified vision-language capabilities, 262k native context (extensible to 1M), and excels across reasoning, coding, agentic workflows, and multilingual tasks.

About Qwen 3.5

Qwen 3.5 is Alibaba Cloud's latest-generation foundation model family, released February 2026. It represents a significant leap forward, integrating breakthroughs in multimodal learning (unified vision-language foundation), efficient hybrid architecture (Gated Delta Networks with sparse Mixture-of-Experts), scalable reinforcement learning across million-agent environments, and global linguistic coverage spanning 201 languages. Available under Apache 2.0 license with open weights.

Other Qwen 3.5 Models

Evaluation Benchmarks

Rank

#46

Benchmark	Score	Rank
General Text Text Arena	1417	46
Web Development WebDev Arena	1365	52

Rankings

Overall Rank

#46

Coding Rank

#61

Model Integrity

Total Score

C+

60 / 100

GPU Requirements

Full Calculator

Choose the quantization method for model weights

Context Size: 1,024 tokens

128k

256k

VRAM Required:

Recommended GPUs

Resources

Official Documentation Download Weights

About Contact Compute Efficiency Content Integrity Terms of Use Privacy Policy

URL: https://apxml.com/models/qwen35-122b-a10b

⇱

Qwen3.5-122B-A10B

Technical Specifications

Architecture Diagram

Qwen3.5-122B-A10B

About Qwen 3.5

Other Qwen 3.5 Models

Evaluation Benchmarks

Rankings

Model Integrity

GPU Requirements

VRAM Required:

Recommended GPUs

Resources