继 Qwen3.5 和 Qwen3.6 系列获得广泛社区采用后,阿里云通义千问团队正式推出 Qwen3.8——Qwen 开源模型家族迄今为止最强大的一代。Qwen3.8-27B 作为其中的紧凑型稠密模型,原生支持图像和视频理解,具备灵活的思维链控制能力,专为可靠地完成复杂多步骤任务而设计。本文将基于 BF16 原始版本与 FP8 量化版本的 README 文档,带您全面了解这款模型。
一、Qwen3.8 核心亮点
Qwen3.8-27B 基于 Qwen3.5 的架构基础,在以下维度实现了全面升级:
核心能力:在编码、专业工作、研究和长程 Agent 任务上实现全面提升
Agent 执行:更强的自主规划和环境反馈处理能力,端到端任务完成更可靠
下游兼容性:更广泛地支持主流测试框架和开发工具,轻松集成到现有技术栈
灵活思维控制:思维模式默认开启,可按请求关闭;通过
reasoning_effort调节推理深度;通过preserve_thinking保留历史消息的推理上下文视觉语言理解:原生支持图像和视频理解,从 STEM 图表、文档到小时级视频
二、模型架构详解
2.1 整体规格
2.2 混合注意力布局
Qwen3.8-27B 的 64 层采用 16 × (3 × Gated DeltaNet → FFN → 1 × Gated Attention → FFN) 的重复布局:
75% 的层为 Gated DeltaNet(门控增量网络/线性注意力)
Value 头数:48
QK 头数:16
头维度:128
优势:O(1) 复杂度解码,大幅提升推理吞吐
25% 的层为 Gated Attention(门控全注意力)
Query 头数:24
KV 头数:4(GQA 分组查询注意力)
头维度:256
旋转位置编码维度:64
优势:关键语义的精准捕获
这种 3:1 的线性/全注意力交替设计,在保证模型表达能力的同时,实现了高效的推理速度。
2.3 多 Token 预测(MTP)
模型内置 多 Token 预测 模块,在训练阶段使用多步预测。推理时可配合投机解码(Speculative Decoding)使用,每步预测多个未来 token,显著提升生成吞吐。
2.4 FFN 与其他参数
FFN 中间维度:17,408
LM 输出维度:248,320(Padded)
三、BF16 vs FP8:双版本对比
本次我们同时获得了 Qwen3.8-27B(BF16 原始精度) 和 Qwen3.8-27B-FP8(FP8 量化版本) 两个版本。
3.1 FP8 量化方案
根据 FP8 版本 README 的官方说明:
"The quantization method is fine-grained fp8 quantization with block size of 128, and its performance metrics are nearly identical to those of the original model."
(量化方法为 block size 128 的细粒度 FP8 量化,性能指标与原始模型几乎一致。)
从配置文件中可以确认更详细的信息:
3.2 精度保护策略
FP8 版本并非对所有模块进行量化。配置文件中列出了大量 不量化模块(modules_to_not_convert),包括:
视觉编码器全部模块(27 层视觉块的所有 attention 和 MLP)
嵌入层和输出头(lm_head、embed_tokens)
所有层的 LayerNorm 和门控模块
线性注意力层的全部参数(A_log、conv1d、in_proj 系列等)
全注意力层的 q_norm、k_norm
MTP 模块全部
这一精细策略确保了量化精度损失极小,官方明确表示性能与原始模型"几乎一致"。
3.3 版本关系
FP8 版本的 base_model 明确标注为 Qwen/Qwen3.8-27B,即 FP8 是 BF16 原始模型的量化衍生版本。两个版本共享相同的:
模型架构和配置
聊天模板(chat_template.jinja)
生成配置(generation_config.json)
基准测试结果(完全一致)
3.4 存储格式差异
FP8 版本采用按层分片存储,便于分布式加载。
四、基准测试:全面领先
两个版本共享相同的基准测试结果。以下对比 Qwen3.8-27B 与 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B、Opus4.6 Max 的表现。
4.1 文本性能
编码能力
Qwen3.8-27B 在 SWE-bench Pro、DeepSWE 1.1 和 QwenSWEBench 上取得最佳成绩。相比上一代 Qwen3.6-27B,编码能力实现飞跃式提升——QwenSWEBench 从 49.3 跃升至 79.0,DeepSWE 从 13.3 跃升至 42.2。
Agent 能力
在所有 Agent 基准测试中,Qwen3.8-27B 均取得最佳成绩,展现了卓越的自主任务执行能力。
通用能力
4.2 视觉语言性能
Agent 多模态智能
Qwen3.8-27B 在全部 7 项 Agent 多模态智能测试中取得最佳(或并列最佳)成绩,尤其在电脑操作(OSWorld 84.3%)和手机操作(AndroidWorld 81.9%)方面展现出强大的 GUI Agent 能力。
通用多模态智能
五、思维链与推理控制
5.1 默认思维模式
Qwen3.8 模型 默认在思维模式下运行,在生成最终回复前会先输出 \n...\n\n 标记的思维内容。
5.2 推理强度调节
通过 reasoning_effort 参数控制推理深度:
xhigh(默认):适合需要深度分析的复杂任务
medium:平衡精度和速度
low:高效推理,优化速度和成本
官方提示:在多轮 Agent 任务中,较低的推理强度不一定能减少总体任务完成时间。虽然每轮响应更快,但也可能导致分析不足、更多失败和重试,从而增加总延迟和 token 消耗。
5.3 推理上下文保留
preserve_thinking 默认开启,在所有历史消息中保留思维块,确保完整的推理上下文。这对 Agent 场景尤其重要——保持决策一致性、减少冗余推理,同时优化 KV Cache 利用率。
5.4 推荐采样参数
六、部署与使用
6.1 支持的推理框架
Qwen3.8 兼容主流推理框架:
SGLang:Qwen3.8 Cookbook
vLLM:Qwen3.8 Recipe
TokenSpeed:Qwen3.8 Recipe
官方建议:对于生产工作负载或高吞吐场景,推荐使用 SGLang、vLLM 或 TokenSpeed 等专用推理引擎。
6.2 Qwen Cloud 托管服务
Qwen3.8-27B 将在 Qwen Cloud 上提供托管版本,默认支持 1M 上下文长度和官方内置工具。
6.3 超长上下文(YaRN)
原生支持 262,144 tokens 上下文。通过 YaRN(RoPE 缩放)可扩展至 1,000,000 tokens:
修改
config.json中的rope_parameters,将rope_type改为yarn,设置factor为 4.0或通过 vLLM/SGLang/TokenSpeed 的命令行参数覆盖
注意:所有主流开源框架实现的是静态 YaRN,缩放因子恒定,可能影响短文本性能。建议仅在需要处理长上下文时修改配置,并根据实际使用场景调整
factor(如 524K tokens 时设为 2.0)。
6.4 长视频理解
为优化纯文本和图像的推理效率,video_preprocessor_config.json 中的 size 参数较为保守。建议将 longest_edge 设为 469,762,048(对应 224K 视频 tokens),以实现小时级视频的高帧率采样。
6.5 API 使用示例
文本对话(思维模式):
1from openai import OpenAI
2client = OpenAI()
3
4completion = client.chat.completions.create(
5 model="Qwen/Qwen3.8-27B", # 或 "Qwen/Qwen3.8-27B-FP8"
6 messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],
7 extra_body={
8 "chat_template_kwargs": {
9 "enable_thinking": True,
10 "preserve_thinking": True,
11 },
12 },
13 reasoning_effort="xhigh",
14 stream=True,
15 stream_options={"include_usage": True},
16)
图像输入:
1messages = [
2 {
3 "role": "user",
4 "content": [
5 {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},
6 {"type": "text", "text": "描述这张图片中的主要内容"}
7 ]
8 }
9]
视频输入:
1messages = [
2 {
3 "role": "user",
4 "content": [
5 {"type": "video_url", "video_url": {"url": "https://example.com/video.mp4"}},
6 {"type": "text", "text": "视频中有多少个瓷罐?"}
7 ]
8 }
9]
非思维模式(快速响应):
1completion = client.chat.completions.create(
2 model="Qwen/Qwen3.8-27B",
3 messages=messages,
4 temperature=0.7,
5 top_p=0.8,
6 presence_penalty=1.5,
7 extra_body={
8 "top_k": 20,
9 "chat_template_kwargs": {"enable_thinking": False},
10 },
11)
6.6 输出长度建议
对于 Agent 任务,官方建议在 1M 上下文范围内分配充足的输出空间:
推理内容:最大输出长度设为 262,144 tokens
最终回复:最大输出长度设为 131,072 tokens
七、版本选择建议
FP8 版本 README 明确指出:"performance metrics are nearly identical to those of the original model"(性能指标与原始模型几乎一致),且两个版本共享完全相同的基准测试结果,这意味着 FP8 版本在绝大多数场景下是更优的部署选择。
八、总结
Qwen3.8-27B 作为 Qwen 开源模型家族迄今为止最强大的一代,带来了以下核心价值:
编码能力飞跃:SWE-bench Pro 61.7%、QwenSWEBench 79.0%,相比 Qwen3.6 实现质变
Agent 能力领先:在 CoWorkBench、JobBench、Agents' Last Exam 等基准上全面第一
多模态 Agent 霸主:OSWorld 84.3%、AndroidWorld 81.9%,GUI 操作能力远超同级
灵活思维控制:三级推理强度 + 推理上下文保留,适配不同场景需求
FP8 近无损量化:block size 128 的细粒度 FP8,性能几乎与原始模型一致
BF16 和 FP8 双版本的发布,配合 Apache 2.0 开源许可,为从研究到生产的各种部署场景提供了灵活选择。无论是构建 AI 编码助手、自动化 Agent 工作流,还是多模态文档分析系统,Qwen3.8-27B 都是 2026 年值得关注的全能型开源大模型。
模型来源:Alibaba Cloud Qwen Team
许可证:Apache 2.0
引用:Qwen3.8-Max: A New Bar for Coding and Cowork, Qwen Team, August 2026