Introducing Unsloth Studio: a new web UI for local AI
我们更新了所有 Qwen3.5 Unsloth 动态量化 成为最先进 (SOTA) 在几乎所有位数上。我们进行了超过 150 次 KL 散度基准测试,总计 9TB 的 GGUF。我们上传了所有研究工件。
我们还修复了一个 工具调用 聊天模板问题 (影响所有量化上传器和类型,无论你在哪里使用或来自哪里).
3 月 5 日 更新:重新下载 Qwen3.5- 35B, 27B, 122B 和 397B。
- 所有 GGUF 现已使用 改进的量化 算法更新。
- 全部使用我们的 新 imatrix 数据。在聊天、编码、长上下文和工具调用的用例中可见一些改进。
新基准测试 Qwen3.5-122B-A10B 和 35-A3B 的新结果现已发布!
想了解如何运行模型 + 硬件要求?阅读我们的 推理指南.
99.9% KL 散度显示在帕累托前沿上达到 SOTA 针对 Unsloth 动态Q4_K_XL, IQ3_XXS 等:
Qwen3.5- 122B-A10B 基准测试
Qwen3.5- 35B-A3B 基准测试
- Imatrix 确实有助于降低 KLD 和 PPL,但代价是推理速度慢 5-10%。
- 我们将我们的 GGUF 与许多其他提供者进行了测试
- 对 ssm_out(Mamba 层)以及 ffn_down_exps 进行量化并不是一个好主意。
- 从所有 GGUF 量化中退役 MXFP4:Q2_K_XL、Q3_K_XL 和 Q4_K_XL,除非是纯 MXFP4_MOE。
完整基准测试
| 量化器 | 量化级别 | 磁盘空间(GB) | 困惑度(PPL) | KLD 99.9% | 平均 KLD |
|---|---|---|---|---|---|
| AesSedai | IQ3_S | 12.65 | 6.9152 | 1.8669 | 0.0613 |
| AesSedai | IQ4_XS | 16.4 | 6.6447 | 0.8067 | 0.0235 |
| AesSedai | Q4_K_M | 20.62 | 6.5665 | 0.3171 | 0.0096 |
| AesSedai | Q5_K_M | 24.45 | 6.5356 | 0.21 | 0.0058 |