Administrator
发布于 2026-08-15 / 2 阅读
0
0

Qwen3.8-27B 深度解读:通义千问最强开源一代,BF16 与 FP8 双版本全面剖析

继 Qwen3.5 和 Qwen3.6 系列获得广泛社区采用后,阿里云通义千问团队正式推出 Qwen3.8——Qwen 开源模型家族迄今为止最强大的一代。Qwen3.8-27B 作为其中的紧凑型稠密模型,原生支持图像和视频理解,具备灵活的思维链控制能力,专为可靠地完成复杂多步骤任务而设计。本文将基于 BF16 原始版本与 FP8 量化版本的 README 文档,带您全面了解这款模型。


一、Qwen3.8 核心亮点

Qwen3.8-27B 基于 Qwen3.5 的架构基础,在以下维度实现了全面升级:

  • 核心能力:在编码、专业工作、研究和长程 Agent 任务上实现全面提升

  • Agent 执行:更强的自主规划和环境反馈处理能力,端到端任务完成更可靠

  • 下游兼容性:更广泛地支持主流测试框架和开发工具,轻松集成到现有技术栈

  • 灵活思维控制:思维模式默认开启,可按请求关闭;通过 reasoning_effort 调节推理深度;通过 preserve_thinking 保留历史消息的推理上下文

  • 视觉语言理解:原生支持图像和视频理解,从 STEM 图表、文档到小时级视频


二、模型架构详解

2.1 整体规格

维度

参数

模型类型

带视觉编码器的因果语言模型(Causal LM with Vision Encoder)

训练阶段

预训练 + 后训练

参数量

27B(稠密,全参数激活)

隐藏维度

5,120

层数

64

词表大小

248,320(Padded)

上下文长度

262,144(原生)/ 1,000,000(YaRN 扩展)

多模态支持

图像 + 视频

许可证

Apache 2.0

2.2 混合注意力布局

Qwen3.8-27B 的 64 层采用 16 × (3 × Gated DeltaNet → FFN → 1 × Gated Attention → FFN) 的重复布局:

  • 75% 的层为 Gated DeltaNet(门控增量网络/线性注意力)

    • Value 头数:48

    • QK 头数:16

    • 头维度:128

    • 优势:O(1) 复杂度解码,大幅提升推理吞吐

  • 25% 的层为 Gated Attention(门控全注意力)

    • Query 头数:24

    • KV 头数:4(GQA 分组查询注意力)

    • 头维度:256

    • 旋转位置编码维度:64

    • 优势:关键语义的精准捕获

这种 3:1 的线性/全注意力交替设计,在保证模型表达能力的同时,实现了高效的推理速度。

2.3 多 Token 预测(MTP)

模型内置 多 Token 预测 模块,在训练阶段使用多步预测。推理时可配合投机解码(Speculative Decoding)使用,每步预测多个未来 token,显著提升生成吞吐。

2.4 FFN 与其他参数

  • FFN 中间维度:17,408

  • LM 输出维度:248,320(Padded)


三、BF16 vs FP8:双版本对比

本次我们同时获得了 Qwen3.8-27B(BF16 原始精度)Qwen3.8-27B-FP8(FP8 量化版本) 两个版本。

3.1 FP8 量化方案

根据 FP8 版本 README 的官方说明:

"The quantization method is fine-grained fp8 quantization with block size of 128, and its performance metrics are nearly identical to those of the original model."

(量化方法为 block size 128 的细粒度 FP8 量化,性能指标与原始模型几乎一致。)

从配置文件中可以确认更详细的信息:

量化参数

量化方法

FP8

数据格式

e4m3(4位指数 + 3位尾数)

激活量化方案

dynamic(动态量化)

权重分块大小

128 × 128

3.2 精度保护策略

FP8 版本并非对所有模块进行量化。配置文件中列出了大量 不量化模块(modules_to_not_convert),包括:

  • 视觉编码器全部模块(27 层视觉块的所有 attention 和 MLP)

  • 嵌入层和输出头(lm_head、embed_tokens)

  • 所有层的 LayerNorm 和门控模块

  • 线性注意力层的全部参数(A_log、conv1d、in_proj 系列等)

  • 全注意力层的 q_norm、k_norm

  • MTP 模块全部

这一精细策略确保了量化精度损失极小,官方明确表示性能与原始模型"几乎一致"。

3.3 版本关系

FP8 版本的 base_model 明确标注为 Qwen/Qwen3.8-27B,即 FP8 是 BF16 原始模型的量化衍生版本。两个版本共享相同的:

  • 模型架构和配置

  • 聊天模板(chat_template.jinja)

  • 生成配置(generation_config.json)

  • 基准测试结果(完全一致)

3.4 存储格式差异

特征

BF16 版本

FP8 版本

权重分片

model-0000X-of-00018.safetensors(18 片)

layers-X.safetensors(按层分片,64+ 文件)

额外索引文件

model.safetensors.index.json

临时下载缓存

._____temp/

._____temp/

FP8 版本采用按层分片存储,便于分布式加载。


四、基准测试:全面领先

两个版本共享相同的基准测试结果。以下对比 Qwen3.8-27B 与 Qwen3.6-27B、Qwen3.7-Plus、Muse Glimmer-30B、Opus4.6 Max 的表现。

4.1 文本性能

编码能力

基准测试

Qwen3.8-27B

Qwen3.6-27B

Qwen3.7-Plus

Muse Glimmer-30B

Opus4.6 Max

Terminal Bench 2.1(终端编码)

73.0

63.4

64.0

51.7

78.2

SWE-bench Pro(Agent 编码)

61.7

53.5

57.6

51.2

53.4

NL2Repo-Bench(仓库级代码生成)

42.3

36.2

41.1

--

47.6

DeepSWE 1.1(Agent 编码)

42.2

13.3

14.2

--

--

QwenSWEBench(软件工程)

79.0

49.3

59.2

--

63.8

Qwen3.8-27B 在 SWE-bench Pro、DeepSWE 1.1 和 QwenSWEBench 上取得最佳成绩。相比上一代 Qwen3.6-27B,编码能力实现飞跃式提升——QwenSWEBench 从 49.3 跃升至 79.0,DeepSWE 从 13.3 跃升至 42.2。

Agent 能力

基准测试

Qwen3.8-27B

Qwen3.6-27B

Qwen3.7-Plus

Opus4.6 Max

CoWorkBench(长程办公任务)

70.7

61.0

65.1

68.2

JobBench(专业工作任务)

33.4

21.8

27.6

--

Agents' Last Exam Pass@1

20.4

10.6

13.2

--

Agents' Last Exam Score

42.9

27.3

33.6

--

在所有 Agent 基准测试中,Qwen3.8-27B 均取得最佳成绩,展现了卓越的自主任务执行能力。

通用能力

基准测试

Qwen3.8-27B

Qwen3.6-27B

Qwen3.7-Plus

Muse Glimmer-30B

Opus4.6 Max

IFBench(指令遵循)

79.5

69.1

79.1

77.0

62.5

GPQA Diamond(科学推理)

89.2

87.8

90.3

83.5

91.3

HLE(多学科推理)

30.8

24.0

34.7

22.0

40.0

LiveCodeBench v6(竞赛编码)

90.3

83.9

89.6

--

88.8

4.2 视觉语言性能

Agent 多模态智能

基准测试

Qwen3.8-27B

Qwen3.6-27B

Qwen3.7-Plus

Muse Glimmer-30B

Opus4.6 Max

OSWorld-Verified(电脑操作)

84.3

63.9

73.3

65.9

72.7

WebArena-Verified(浏览器操作)

64.8

48.8

55.3

--

--

AndroidWorld(手机操作)

81.9

70.3

81.0

--

62.0

RecreationBench(应用重建)

47.1

29.8

30.2

--

--

ClawEval-MM Pass@3(多模态工具使用)

57.4

42.6

57.4

--

52.5

SWE-MM(多模态软件工程)

38.6

25.7

30.0

--

27.1

Vision2Web(视觉 Web 开发)

62.9

45.0

42.1

--

--

Qwen3.8-27B 在全部 7 项 Agent 多模态智能测试中取得最佳(或并列最佳)成绩,尤其在电脑操作(OSWorld 84.3%)和手机操作(AndroidWorld 81.9%)方面展现出强大的 GUI Agent 能力。

通用多模态智能

基准测试

Qwen3.8-27B

Qwen3.6-27B

Qwen3.7-Plus

Opus4.6 Max

MathVision(视觉数学,With CI)

94.6

85.1

90.3

65.5

BabyVision(视觉推理,Without CI)

65.7

28.9

64.7

12.6

BabyVision(With CI)

85.6

--

70.4

--

CharXiv RQ(科学图表,With CI)

90.2

78.4

85.9

66.0

OmniDocBench 1.5(文档智能)

91.1

89.4

91.4

86.6

RealWorldQA(真实世界感知)

85.9

84.1

86.9

73.9

ERQA(具身智能)

65.5

62.5

69.8

40.8


五、思维链与推理控制

5.1 默认思维模式

Qwen3.8 模型 默认在思维模式下运行,在生成最终回复前会先输出 \n...\n\n 标记的思维内容。

5.2 推理强度调节

通过 reasoning_effort 参数控制推理深度:

  • xhigh(默认):适合需要深度分析的复杂任务

  • medium:平衡精度和速度

  • low:高效推理,优化速度和成本

官方提示:在多轮 Agent 任务中,较低的推理强度不一定能减少总体任务完成时间。虽然每轮响应更快,但也可能导致分析不足、更多失败和重试,从而增加总延迟和 token 消耗。

5.3 推理上下文保留

preserve_thinking 默认开启,在所有历史消息中保留思维块,确保完整的推理上下文。这对 Agent 场景尤其重要——保持决策一致性、减少冗余推理,同时优化 KV Cache 利用率。

5.4 推荐采样参数

模式

temperature

top_p

top_k

presence_penalty

repetition_penalty

思维模式

1.0

0.95

20

0.0

1.0

指令模式(非思维)

0.7

0.80

20

1.5

1.0


六、部署与使用

6.1 支持的推理框架

Qwen3.8 兼容主流推理框架:

官方建议:对于生产工作负载或高吞吐场景,推荐使用 SGLang、vLLM 或 TokenSpeed 等专用推理引擎。

6.2 Qwen Cloud 托管服务

Qwen3.8-27B 将在 Qwen Cloud 上提供托管版本,默认支持 1M 上下文长度和官方内置工具。

6.3 超长上下文(YaRN)

原生支持 262,144 tokens 上下文。通过 YaRN(RoPE 缩放)可扩展至 1,000,000 tokens:

  • 修改 config.json 中的 rope_parameters,将 rope_type 改为 yarn,设置 factor 为 4.0

  • 或通过 vLLM/SGLang/TokenSpeed 的命令行参数覆盖

注意:所有主流开源框架实现的是静态 YaRN,缩放因子恒定,可能影响短文本性能。建议仅在需要处理长上下文时修改配置,并根据实际使用场景调整 factor(如 524K tokens 时设为 2.0)。

6.4 长视频理解

为优化纯文本和图像的推理效率,video_preprocessor_config.json 中的 size 参数较为保守。建议将 longest_edge 设为 469,762,048(对应 224K 视频 tokens),以实现小时级视频的高帧率采样。

6.5 API 使用示例

文本对话(思维模式):

1from openai import OpenAI

2client = OpenAI()

3

4completion = client.chat.completions.create(

5 model="Qwen/Qwen3.8-27B", # 或 "Qwen/Qwen3.8-27B-FP8"

6 messages=[{"role": "user", "content": "Write a Python function to merge two sorted linked lists."}],

7 extra_body={

8 "chat_template_kwargs": {

9 "enable_thinking": True,

10 "preserve_thinking": True,

11 },

12 },

13 reasoning_effort="xhigh",

14 stream=True,

15 stream_options={"include_usage": True},

16)

图像输入:

1messages = [

2 {

3 "role": "user",

4 "content": [

5 {"type": "image_url", "image_url": {"url": "https://example.com/image.jpg"}},

6 {"type": "text", "text": "描述这张图片中的主要内容"}

7 ]

8 }

9]

视频输入:

1messages = [

2 {

3 "role": "user",

4 "content": [

5 {"type": "video_url", "video_url": {"url": "https://example.com/video.mp4"}},

6 {"type": "text", "text": "视频中有多少个瓷罐?"}

7 ]

8 }

9]

非思维模式(快速响应):

1completion = client.chat.completions.create(

2 model="Qwen/Qwen3.8-27B",

3 messages=messages,

4 temperature=0.7,

5 top_p=0.8,

6 presence_penalty=1.5,

7 extra_body={

8 "top_k": 20,

9 "chat_template_kwargs": {"enable_thinking": False},

10 },

11)

6.6 输出长度建议

对于 Agent 任务,官方建议在 1M 上下文范围内分配充足的输出空间:

  • 推理内容:最大输出长度设为 262,144 tokens

  • 最终回复:最大输出长度设为 131,072 tokens


七、版本选择建议

场景

推荐版本

理由

精度要求最高的研究场景

BF16

无任何量化损失

生产环境部署(有 H100/H200)

FP8

显存减半,性能几乎无损

消费级显卡部署

FP8

权重约 27GB,可在高端消费卡上运行

追求最大吞吐量

FP8 + MTP

配合投机解码加速

预算极其有限

FP8

官方保证性能与原始模型几乎一致

FP8 版本 README 明确指出:"performance metrics are nearly identical to those of the original model"(性能指标与原始模型几乎一致),且两个版本共享完全相同的基准测试结果,这意味着 FP8 版本在绝大多数场景下是更优的部署选择。


八、总结

Qwen3.8-27B 作为 Qwen 开源模型家族迄今为止最强大的一代,带来了以下核心价值:

  1. 编码能力飞跃:SWE-bench Pro 61.7%、QwenSWEBench 79.0%,相比 Qwen3.6 实现质变

  2. Agent 能力领先:在 CoWorkBench、JobBench、Agents' Last Exam 等基准上全面第一

  3. 多模态 Agent 霸主:OSWorld 84.3%、AndroidWorld 81.9%,GUI 操作能力远超同级

  4. 灵活思维控制:三级推理强度 + 推理上下文保留,适配不同场景需求

  5. FP8 近无损量化:block size 128 的细粒度 FP8,性能几乎与原始模型一致

BF16 和 FP8 双版本的发布,配合 Apache 2.0 开源许可,为从研究到生产的各种部署场景提供了灵活选择。无论是构建 AI 编码助手、自动化 Agent 工作流,还是多模态文档分析系统,Qwen3.8-27B 都是 2026 年值得关注的全能型开源大模型。


模型来源:Alibaba Cloud Qwen Team
许可证:Apache 2.0
引用:Qwen3.8-Max: A New Bar for Coding and Cowork, Qwen Team, August 2026


评论