Qwen4预览架构:Qwen3.8去拒绝版实测
本文解析采用Qwen4预览架构的Qwen3.8-Flash-Next去拒绝版,说明111GB GGUF分片、内存与上下文需求,并给出llama.cpp下载和启动方法,同时梳理量化差异、许可证、多模态验证及公开部署风险。
结论先说:Huihui-Qwen3.8-Flash-Next-abliterated-GGUF 是基于 Qwen3.8-Flash-Next 制作的社区去拒绝版本,目前可下载的 UD-Q4_K_XL 量化文件约 111GB。它降低了模型拒答倾向,但没有缩小架构规模,也没有公开修改后的能力评测。准备本地部署时,需要重点考虑内存、上下文缓存、分片下载、运行时兼容性以及输出安全责任。

2026 年 9 月 6 日,huihui.ai 在 Hugging Face 发布了 huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated-GGUF。其底座是 Qwen 团队此前开放的 Qwen/Qwen3.8-Flash-Next,并通过 abliteration 方法削弱模型常见的拒答行为。
当前仓库仅提供 UD-Q4_K_XL 量化版本,总体积约 111GB,由 4 个 GGUF 分片组成。作者表示后续会继续补充其他量化规格,但未公布具体时间。
底座是 Qwen4 预览架构,不是轻量模型
Qwen3.8-Flash-Next 更接近下一代架构的提前预览,而不是传统意义上的小模型。模型仓库将其架构标记为 qwen4exp,主网络混合使用 Gated DeltaNet 与 Qwen Sparse Attention,共有 48 层、512 个专家,每次路由激活 10 个专家,并额外使用 1 个共享专家。
从结构看,它包含以下部分:
- 主网络总参数约 1250 亿,每次推理实际激活约 60 亿参数;
- 约 510 亿参数的 N-gram 嵌入表;
- 约 40 亿参数的多词预测头;
- N-gram 表位于第 2 层,包含约 2000 万个二元和三元片段条目;
- 原生上下文长度为 262144 token,并可借助 YaRN 继续扩展。
因此,“激活 60 亿参数”不等于只需要加载一个 60 亿参数模型。磁盘和内存仍需承载主网络、N-gram 嵌入及多词预测模块。Hugging Face 页面将完整模型规模标记为约 1770 亿参数,这也是 4bit 版本仍达到 111GB 的主要原因。
模型标签包含 unsloth 和 imatrix,量化方式与 Unsloth 的动态量化路线一致。原版 UD-Q4_K_XL 的公开数据约为 111.3GB,top-1 指标约为 92.255%。但去拒绝版本没有单独发布精度测试,不能直接把原版量化结果当作修改后模型的成绩。
官方曾为原版模型公布部分评测数据:
- SWE-bench Pro:62.5;
- DeepSWE 1.1:58.7;
- GPQA Diamond:91.7;
- 训练成本约为 Qwen3.7-Plus 的九分之一。
这些结果均属于原始模型,不能证明去拒绝版本仍保持相同能力。仓库目前也没有提供修改前后的系统对比。
模型卡将模态标记为 Image-Text-to-Text,意味着原始架构支持图像和视频输入。不过,该去拒绝版本没有明确说明视觉模块是否保持不变。即使运行时能够识别视觉组件,也应通过实际图片输入验证,而不能默认多模态能力完整可用。
此外,该模型采用 qwen-community-1.0 许可证,并非 Apache 许可证。用于商业服务、模型再分发或命名时,应先核对许可证中的相关约束。
拒绝被削弱,输出责任转移给使用者
Abliteration 并不是完整重训模型。公开方案通常会定位模型在拒绝请求时频繁出现的激活方向,再从残差表示中削弱或移除该方向,从而降低“无法提供帮助”等拒答输出的概率。
这种处理不会自动提升答案质量,也不意味着模型输出更准确。它主要改变的是拒绝行为,可能同时削弱原有的安全边界。仓库提示的风险包括:
- 可能生成敏感、不适宜或违法内容;
- 不适合直接用于公开场合或面向未成年人的服务;
- 使用者需要自行承担合规与法律责任;
- 更适合研究、测试和受控环境;
- 应由人工审核重要输出;
- 不建议未经防护直接部署为公开商业接口。
社区对去拒绝模型一直存在分歧。一种观点认为,本地模型应由用户自行决定用途,不应继承云服务的拒答策略;另一种观点则认为,降低拒绝能力也意味着降低安全能力,会把平台侧风险转移到个人设备和部署者身上。
无论采用哪种观点,都需要区分“模型愿意回答”和“答案可以使用”。权重能够生成内容,不代表内容准确、合法或适合公开发布。
此前同类模型曾公开过只修改部分中后层的处理方式,以减少对原始能力的影响。但 Flash-Next 仓库没有披露具体修改层数,因此不能直接套用其他模型的层号或处理参数。
111GB 是当前入口,不是完整量化菜单
虽然 UD-Q4_K_XL 属于 4bit 量化,但对于完整规模约 1770 亿参数的模型来说,文件依然很大。根据原版模型的量化体积参考,不同规格大致如下:
| 量化规格 | 参考体积 |
|---|---|
| 1bit | 约 72.5~74.5GB |
| 2bit | 约 78.9GB |
| 3bit | 约 82~90GB |
| UD-IQ4_XS | 约 93.7GB |
| UD-Q4_K_XL | 约 111.3GB |
| 5bit | 约 158GB |
| 6bit | 约 169GB |
| 8bit | 约 188GB |
| BF16 | 约 355GB |
这些数据来自原版量化参考,不代表去拒绝版本已经提供对应文件。目前能够确认下载的只有 UD-Q4_K_XL。
动态量化会根据不同层的敏感程度分配位宽:重要层保留更高精度,其余层使用更低位宽。imatrix 则通过校准文本估算各层量化误差,为位宽分配提供依据。该仓库带有相关标签,但没有公开完整的校准文本和误差报告。
内存不能只按 111GB 计算
111GB 只是权重文件体积,实际推理还需要为以下部分预留空间:
- GGUF 权重加载;
- KV 缓存;
- 上下文和临时张量;
- llama.cpp 运行时开销;
- 操作系统及其他进程占用。
如果直接使用 262144 token 的完整上下文,KV 缓存可能迅速消耗剩余内存。首次运行更适合从 4096、8192 或 16384 token 开始,确认模型能够稳定加载和对话后,再逐步增加窗口。
原版文档默认启用思考模式,并给出以下采样参考:
- 思考模式:
temperature=1.0、top_p=0.95; - 非思考模式:
temperature=0.7、top_p=0.80、presence_penalty=1.5。
去拒绝版本没有给出单独的采样参数,可先参考原版设置,再根据实际输出调整。
四个分片必须下载完整
UD-Q4_K_XL 由 4 个 GGUF 文件组成,入口文件名为:
Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf
其余 3 个分片必须放在同一目录中。只下载第一片时,加载器会在读取到分片边界后提示缺少后续文件。
先更新 llama.cpp,再逐步增加上下文
该模型使用 qwen4exp 架构标识,旧版 llama.cpp 可能无法识别。运行前应更新源码并重新编译,不要优先使用较早发布的二进制文件。
1. 检查磁盘和内存
磁盘至少需要为 111GB 权重、下载临时文件和运行日志预留空间。建议准备明显高于 111GB 的可用容量。
内存仅略高于权重体积通常不够稳妥,因为对话增长后 KV 缓存会持续占用空间。统一内存设备虽然能够让 CPU 与 GPU 共用内存池,但权重和缓存仍会竞争同一容量。
2. 下载 UD-Q4_K_XL 分片
使用 Hugging Face CLI 时,可以通过过滤条件只下载当前量化目录:
hf download huihui-ai/Huihui-Qwen3.8-Flash-Next-abliterated-GGUF \
--local-dir Huihui-Qwen3.8-Flash-Next-abliterated-GGUF \
--include "UD-Q4_K_XL/*"
下载完成后,应确认同一目录中存在全部 4 个 GGUF 分片。过滤条件如果写错,可能导致没有匹配文件,或者下载额外内容。
3. 从 8192 token 上下文启动
首次运行不建议直接照搬 262144 token 的最大窗口,可以先用 8192 token 验证:
llama-cli \
-m Huihui-Qwen3.8-Flash-Next-abliterated-GGUF/UD-Q4_K_XL/Qwen3.8-Flash-Next-UD-Q4_K_XL-00001-of-00004.gguf \
-c 8192
正常情况下,加载器会自动找到后续分片并进入对话。如果出现架构不支持,应先更新并重新编译 llama.cpp,而不是立即判断 GGUF 文件损坏。
如果生成速度明显下降,可依次检查:
- 是否有大量层被卸载到系统内存;
- 是否因内存不足触发交换分区或磁盘换页;
- GPU 层数和显存分配是否合理;
- 上下文窗口是否设置过大;
- 是否有其他程序占用内存或显存。
4. 作为本地服务运行
需要给本机其他工具提供接口时,可将 llama-cli 替换为 llama-server,并根据设备能力设置端口、并发数和上下文长度。
去拒绝模型不应在缺少鉴权、内容审核和访问控制的情况下直接暴露到公网。即使只在局域网使用,也应限制调用方并保留必要的日志和人工复核流程。
如何验证去拒绝效果
可以同时保留官方原版 GGUF 与社区去拒绝版,使用相同提示词、系统提示和采样参数进行对照。测试时至少观察以下维度:
- 是否仍然拒绝回答;
- 回答内容是否完整;
- 事实准确率是否变化;
- 代码与长文本能力是否退化;
- 是否更容易输出危险或不适宜内容;
- 多模态能力能否正常工作。
这种对照只能说明拒答行为和输出风格的差异,不能仅凭“回答更直接”判断模型能力更强。
目前,111GB 的 UD-Q4_K_XL 是该仓库唯一明确可下载的版本。对于内存和存储有限的设备,更合理的做法是等待更低比特量化;追求精度的用户则可以等待更高精度版本。现阶段应把它视为实验性模型,在受控环境完成兼容性、能力和安全测试后,再决定是否长期保留或接入实际工作流。





暂无评论,期待您的发言...