Qwen4预览架构:Qwen3.8去拒绝版实测

Admin
89阅读
0评论
0点赞

本文解析采用Qwen4预览架构的Qwen3.8-Flash-Next去拒绝版,说明111GB GGUF分片、内存与上下文需求,并给出llama.cpp下载和启动方法,同时梳理量化差异、许可证、多模态验证及公开部署风险。

结论先说:Huihui-Qwen3.8-Flash-Next-abliterated-GGUF 是基于 Qwen3.8-Flash-Next 制作的社区去拒绝版本,目前可下载的 UD-Q4_K_XL 量化文件约 111GB。它降低了模型拒答倾向,但没有缩小架构规模,也没有公开修改后的能力评测。准备本地部署时,需要重点考虑内存、上下文缓存、分片下载、运行时兼容性以及输出安全责任。

Qwen3.8-Flash-Next 去拒绝版模型信息

2026 年 9 月 6 日,huihui.ai 在 Hugging Face 发布了 huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated-GGUF。其底座是 Qwen 团队此前开放的 Qwen/Qwen3.8-Flash-Next,并通过 abliteration 方法削弱模型常见的拒答行为。

当前仓库仅提供 UD-Q4_K_XL 量化版本,总体积约 111GB,由 4 个 GGUF 分片组成。作者表示后续会继续补充其他量化规格,但未公布具体时间。

底座是 Qwen4 预览架构,不是轻量模型

Qwen3.8-Flash-Next 更接近下一代架构的提前预览,而不是传统意义上的小模型。模型仓库将其架构标记为 qwen4exp,主网络混合使用 Gated DeltaNet 与 Qwen Sparse Attention,共有 48 层、512 个专家,每次路由激活 10 个专家,并额外使用 1 个共享专家。

从结构看,它包含以下部分:

  • 主网络总参数约 1250 亿,每次推理实际激活约 60 亿参数;
  • 约 510 亿参数的 N-gram 嵌入表;
  • 约 40 亿参数的多词预测头;
  • N-gram 表位于第 2 层,包含约 2000 万个二元和三元片段条目;
  • 原生上下文长度为 262144 token,并可借助 YaRN 继续扩展。

因此,“激活 60 亿参数”不等于只需要加载一个 60 亿参数模型。磁盘和内存仍需承载主网络、N-gram 嵌入及多词预测模块。Hugging Face 页面将完整模型规模标记为约 1770 亿参数,这也是 4bit 版本仍达到 111GB 的主要原因。

模型标签包含 unsloth 和 imatrix,量化方式与 Unsloth 的动态量化路线一致。原版 UD-Q4_K_XL 的公开数据约为 111.3GB,top-1 指标约为 92.255%。但去拒绝版本没有单独发布精度测试,不能直接把原版量化结果当作修改后模型的成绩。

官方曾为原版模型公布部分评测数据:

  • SWE-bench Pro:62.5;
  • DeepSWE 1.1:58.7;
  • GPQA Diamond:91.7;
  • 训练成本约为 Qwen3.7-Plus 的九分之一。

这些结果均属于原始模型,不能证明去拒绝版本仍保持相同能力。仓库目前也没有提供修改前后的系统对比。

模型卡将模态标记为 Image-Text-to-Text,意味着原始架构支持图像和视频输入。不过,该去拒绝版本没有明确说明视觉模块是否保持不变。即使运行时能够识别视觉组件,也应通过实际图片输入验证,而不能默认多模态能力完整可用。

此外,该模型采用 qwen-community-1.0 许可证,并非 Apache 许可证。用于商业服务、模型再分发或命名时,应先核对许可证中的相关约束。

拒绝被削弱,输出责任转移给使用者

Abliteration 并不是完整重训模型。公开方案通常会定位模型在拒绝请求时频繁出现的激活方向,再从残差表示中削弱或移除该方向,从而降低“无法提供帮助”等拒答输出的概率。

这种处理不会自动提升答案质量,也不意味着模型输出更准确。它主要改变的是拒绝行为,可能同时削弱原有的安全边界。仓库提示的风险包括:

  • 可能生成敏感、不适宜或违法内容;
  • 不适合直接用于公开场合或面向未成年人的服务;
  • 使用者需要自行承担合规与法律责任;
  • 更适合研究、测试和受控环境;
  • 应由人工审核重要输出;
  • 不建议未经防护直接部署为公开商业接口。

社区对去拒绝模型一直存在分歧。一种观点认为,本地模型应由用户自行决定用途,不应继承云服务的拒答策略;另一种观点则认为,降低拒绝能力也意味着降低安全能力,会把平台侧风险转移到个人设备和部署者身上。

无论采用哪种观点,都需要区分“模型愿意回答”和“答案可以使用”。权重能够生成内容,不代表内容准确、合法或适合公开发布。

此前同类模型曾公开过只修改部分中后层的处理方式,以减少对原始能力的影响。但 Flash-Next 仓库没有披露具体修改层数,因此不能直接套用其他模型的层号或处理参数。

111GB 是当前入口,不是完整量化菜单

虽然 UD-Q4_K_XL 属于 4bit 量化,但对于完整规模约 1770 亿参数的模型来说,文件依然很大。根据原版模型的量化体积参考,不同规格大致如下:

量化规格 参考体积
1bit 约 72.5~74.5GB
2bit 约 78.9GB
3bit 约 82~90GB
UD-IQ4_XS 约 93.7GB
UD-Q4_K_XL 约 111.3GB
5bit 约 158GB
6bit 约 169GB
8bit 约 188GB
BF16 约 355GB

这些数据来自原版量化参考,不代表去拒绝版本已经提供对应文件。目前能够确认下载的只有 UD-Q4_K_XL。

动态量化会根据不同层的敏感程度分配位宽:重要层保留更高精度,其余层使用更低位宽。imatrix 则通过校准文本估算各层量化误差,为位宽分配提供依据。该仓库带有相关标签,但没有公开完整的校准文本和误差报告。

内存不能只按 111GB 计算

111GB 只是权重文件体积,实际推理还需要为以下部分预留空间:

  • GGUF 权重加载;
  • KV 缓存;
  • 上下文和临时张量;
  • llama.cpp 运行时开销;
  • 操作系统及其他进程占用。

如果直接使用 262144 token 的完整上下文,KV 缓存可能迅速消耗剩余内存。首次运行更适合从 4096、8192 或 16384 token 开始,确认模型能够稳定加载和对话后,再逐步增加窗口。

原版文档默认启用思考模式,并给出以下采样参考:

  • 思考模式:temperature=1.0、top_p=0.95;
  • 非思考模式:temperature=0.7、top_p=0.80、presence_penalty=1.5。

去拒绝版本没有给出单独的采样参数,可先参考原版设置,再根据实际输出调整。

四个分片必须下载完整

UD-Q4_K_XL 由 4 个 GGUF 文件组成,入口文件名为:

Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf

其余 3 个分片必须放在同一目录中。只下载第一片时,加载器会在读取到分片边界后提示缺少后续文件。

先更新 llama.cpp,再逐步增加上下文

该模型使用 qwen4exp 架构标识,旧版 llama.cpp 可能无法识别。运行前应更新源码并重新编译,不要优先使用较早发布的二进制文件。

1. 检查磁盘和内存

磁盘至少需要为 111GB 权重、下载临时文件和运行日志预留空间。建议准备明显高于 111GB 的可用容量。

内存仅略高于权重体积通常不够稳妥,因为对话增长后 KV 缓存会持续占用空间。统一内存设备虽然能够让 CPU 与 GPU 共用内存池,但权重和缓存仍会竞争同一容量。

2. 下载 UD-Q4_K_XL 分片

使用 Hugging Face CLI 时,可以通过过滤条件只下载当前量化目录:

hf download huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated-GGUF \
  --local-dir Huihui-Qwen3.8-Flash-Next-abliterated-GGUF \
  --include "UD-Q4_K_XL/*"

下载完成后,应确认同一目录中存在全部 4 个 GGUF 分片。过滤条件如果写错,可能导致没有匹配文件,或者下载额外内容。

3. 从 8192 token 上下文启动

首次运行不建议直接照搬 262144 token 的最大窗口,可以先用 8192 token 验证:

llama-cli \
  -m Huihui-Qwen3.8-Flash-Next-abliterated-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
  -c 8192

正常情况下,加载器会自动找到后续分片并进入对话。如果出现架构不支持,应先更新并重新编译 llama.cpp,而不是立即判断 GGUF 文件损坏。

如果生成速度明显下降,可依次检查:

  1. 是否有大量层被卸载到系统内存;
  2. 是否因内存不足触发交换分区或磁盘换页;
  3. GPU 层数和显存分配是否合理;
  4. 上下文窗口是否设置过大;
  5. 是否有其他程序占用内存或显存。

4. 作为本地服务运行

需要给本机其他工具提供接口时,可将 llama-cli 替换为 llama-server,并根据设备能力设置端口、并发数和上下文长度。

去拒绝模型不应在缺少鉴权、内容审核和访问控制的情况下直接暴露到公网。即使只在局域网使用,也应限制调用方并保留必要的日志和人工复核流程。

如何验证去拒绝效果

可以同时保留官方原版 GGUF 与社区去拒绝版,使用相同提示词、系统提示和采样参数进行对照。测试时至少观察以下维度:

  • 是否仍然拒绝回答;
  • 回答内容是否完整;
  • 事实准确率是否变化;
  • 代码与长文本能力是否退化;
  • 是否更容易输出危险或不适宜内容;
  • 多模态能力能否正常工作。

这种对照只能说明拒答行为和输出风格的差异,不能仅凭“回答更直接”判断模型能力更强。

目前,111GB 的 UD-Q4_K_XL 是该仓库唯一明确可下载的版本。对于内存和存储有限的设备,更合理的做法是等待更低比特量化;追求精度的用户则可以等待更高精度版本。现阶段应把它视为实验性模型,在受控环境完成兼容性、能力和安全测试后,再决定是否长期保留或接入实际工作流。

上一篇GPT-6 Astra演示:从3D应用到专业工作流
下一篇暂无更多文章
评论0

暂无评论,期待您的发言...

发表评论