Introducing Unsloth Studio: a new web UI for local AI

我们更新了所有 Qwen3.5 Unsloth 动态量化 成为最先进 (SOTA) 在几乎所有位数上。我们进行了超过 150 次 KL 散度基准测试,总计 9TB 的 GGUF。我们上传了所有研究工件。

我们还修复了一个 工具调用 聊天模板问题 (影响所有量化上传器和类型,无论你在哪里使用或来自哪里).

3 月 5 日 更新:重新下载 Qwen3.5- 35B, 27B, 122B 和 397B。

  • 所有 GGUF 现已使用 改进的量化 算法更新。
  • 全部使用我们的 新 imatrix 数据。在聊天、编码、长上下文和工具调用的用例中可见一些改进。

新基准测试 Qwen3.5-122B-A10B 和 35-A3B 的新结果现已发布!

想了解如何运行模型 + 硬件要求?阅读我们的 推理指南.

99.9% KL 散度显示在帕累托前沿上达到 SOTA 针对 Unsloth 动态Q4_K_XL, IQ3_XXS 等:

Qwen3.5- 122B-A10B 基准测试

Qwen3.5- 35B-A3B 基准测试

  • Imatrix 确实有助于降低 KLD 和 PPL,但代价是推理速度慢 5-10%。
  • 我们将我们的 GGUF 与许多其他提供者进行了测试
  • 对 ssm_out(Mamba 层)以及 ffn_down_exps 进行量化并不是一个好主意。
  • 从所有 GGUF 量化中退役 MXFP4:Q2_K_XL、Q3_K_XL 和 Q4_K_XL,除非是纯 MXFP4_MOE。

完整基准测试

量化器 量化级别 磁盘空间(GB) 困惑度(PPL) KLD 99.9% 平均 KLD
AesSedai IQ3_S 12.65 6.9152 1.8669 0.0613
AesSedai IQ4_XS 16.4 6.6447 0.8067 0.0235
AesSedai Q4_K_M 20.62 6.5665 0.3171 0.0096
AesSedai Q5_K_M 24.45 6.5356 0.21 0.0058