# Introducing Unsloth Studio: a new web UI for local AI

Gemma 4 是 Google DeepMind 的新一代开放模型家族，包括 **E2B**, **E4B**, **26B-A4B**、以及 **31B。** 这些多模态、混合思考模型支持 140 多种语言，最长可达 **256K 上下文**，并提供稠密和 MoE 变体。Gemma 4 采用 Apache-2.0 许可证，可在你的本地设备上运行。

[运行 Gemma 4](/content/docs/zh/mo-xing/gemma-4#run-gemma-4-tutorials/index.html) [微调 Gemma 4](/content/docs/zh/mo-xing/gemma-4/train/index.html)

**Gemma-4-E2B** 和 **E4B** 支持图像和音频。运行所需仅 **5GB 内存** （4 位）或 15GB（完整 16 位）。查看我们的 [Gemma 4 GGUF](https://huggingface.co/collections/unsloth/gemma-4).

**Gemma-4-26B-A4B** 可运行于 **18GB** （4 位）或 28GB（8 位）。 **Gemma-4-31B** 需要 **20GB 内存** （4 位）或 34GB（8 位）。

**4 月 11 日更新：** Gemma 4 现已更新，采用了 Google 更新后的聊天模板 + llama.cpp 修复。**不要** 将 CUDA 13.2 运行时用于任何 GGUF，否则会导致输出质量很差。

你现在可以在 [Unsloth Studio](/content/docs/zh/mo-xing/gemma-4#unsloth-studio-guide/index.html)✨

### 使用指南

Gemma 4 在推理、编程、工具使用、长上下文和智能体工作流，以及多模态任务方面表现出色。较小的 E2B 和 E4B 变体专为手机和笔记本电脑设计，而更大的模型则面向中高 CPU/VRAM 系统，例如配备 NVIDIA RTX GPU 的电脑。

## Gemma 4 变体

| 变体       | 详情                     | 最佳适用场景                                       |
| ---------- | ------------------------ | -------------------------------------------------- |
| **E2B**    | 稠密 + PLE（128K 上下文） | 适用于手机/边缘端推理、ASR、语音翻译            |
| **E4B**    | 稠密 + PLE（128K 上下文） | 适用于笔记本电脑和快速本地多模态使用的小型模型    |
| **26B-A4B**| MoE（256K 上下文）      | 用于电脑的速度/质量最佳平衡                       |
| **31B**    | 稠密（256K 上下文）     | 推理速度较慢，但性能最强                           |

### 基准测试

| Gemma 4      | MMLU Pro | AIME 2026（无工具） | LiveCodeBench v6 | MMMU Pro  |
| ------------ | -------- | ------------------ | ---------------- | --------- |
| **31B**      | 85.2%    | 89.2%              | 80.0%            | 76.9%    |
| **26B-A4B**  | 82.6%    | 88.3%              | 77.1%            | 73.8%    |
| **E4B**      | 69.4%    | 42.5%              | 52.0%            | 52.6%    |
| **E2B**      | 60.0%    | 37.5%              | 44.0%            | 44.2%    |

### 硬件要求

**表：Gemma 4 推理 GGUF 推荐硬件要求** （单位 = 总内存：RAM + VRAM，或统一内存）。你可以在 MacOS、NVIDIA RTX GPU 等设备上使用 Gemma 4。

| 变体       | 4 位    | 8 位      | BF16 / FP16  |
| ---------- | ------- | --------- | ------------- |
| **E2B**    | 4 GB    | 5–8 GB    | 10 GB        |
| **E4B**    | 5.5–6 GB| 9–12 GB   | 16 GB        |
| **26B A4B**| 16–18 GB| 28–30 GB  | 52 GB        |
| **31B**    | 17–20 GB| 34–38 GB  | 62 GB        |

一般来说，你可用的总内存至少应超过你下载的量化模型大小。如果不足，llama.cpp 仍可使用部分 RAM / 磁盘卸载运行，但生成速度会更慢。根据你使用的上下文窗口大小，还会需要更多算力。

### 推荐设置

建议使用 Google 默认的 Gemma 4 参数：

- `temperature = 1.0`
- `top_p = 0.95`
- `top_k = 64`

本地推理推荐的实用默认值：

- 先从 **32K 上下文** 开始以保证响应速度，然后再增加
- 保持 **重复/存在惩罚** 为禁用或 1.0，除非你看到循环输出。
- 句末标记是 `<turn|>`

Gemma 4 的最大上下文长度是 **128K** 用于 **E2B / E4B** 和 **256K** 用于 **26B A4B / 31B**.

### 思考模式

与旧版 Gemma 聊天模板相比，Gemma 4 使用标准的 `系统`, `助手`、以及 `用户` 角色，并增加了显式思考控制。

**如何启用思考：**

添加标记 `<|think|>` 到 **系统提示的开头**.

**输出行为：**

启用思考时，模型会在最终答案之前输出其内部推理通道。

**多轮对话规则：**

对于多轮对话， **只在聊天历史中保留最终可见答案**。 **不要** 把先前的思考块重新喂回下一轮。

### 运行 Gemma 4 教程

由于 Gemma 4 GGUF 有多种尺寸，小模型建议从 8 位开始，而大模型建议使用 **动态 4 位**.

**安装 Unsloth**

在终端中运行：

**MacOS、Linux、WSL：**
```
curl -fsSL https://unsloth.ai/install.sh | sh
```

**Windows PowerShell：**
```
irm https://unsloth.ai/install.ps1 | iex
```

**启动 Unsloth**

**MacOS、Linux、WSL 和 Windows：**
```
unsloth studio -H 0.0.0.0 -p 8888
```
**然后打开**`http://localhost:8888` **在浏览器中。**

**搜索并下载 Gemma 4**

首次启动时，你需要创建一个密码来保护账户，并在之后重新登录。随后你会看到一个简短的引导向导，用于选择模型、数据集和基本设置。你可以随时跳过。这后在 [Studio Chat](/content/docs/zh/xin-zeng/studio/chat/index.html) 标签页，在搜索栏中搜索 Gemma 4，并下载你想要的模型和量化版本。

### Llama.cpp 指南

在本指南中，我们将对 26B-A4B 和 31B 使用动态 4 位，对 E2B 和 E4B 使用 8 位。参见： [Gemma 4 GGUF 集合](https://huggingface.co/collections/unsloth/gemma-4)

要试用动态 4 位 或 8 位 量化版本，请使用相应命令。

### 提示示例

#### 简单推理提示
```
系统：
<|think|>
你是一名精确的推理助手。

用户：
一列火车于上午 8:15 出发，并于上午 11:47 到达。旅程用了多长时间？
```

#### OCR / 文档提示
```
[图像优先]
从这张收据中提取所有文本。将明细、总计、商家和日期以 JSON 返回。
```

#### 音频 ASR 提示
```
[音频优先]
将以下英文语音片段转写成英文文本。请遵循以下关于答案格式化的具体说明：
* 只输出转写内容，不要换行。
* 转写数字时，请写阿拉伯数字，例如写 1.7 而不是 one point seven，写 3 而不是 three。
```

#### 资源与链接
- [Hugging Face Gemma 4 博客文章](https://huggingface.co/blog/gemma4)
- [NVIDIA Gemma 4 博客文章](https://blogs.nvidia.com/blog/rtx-ai-garage-open-models-google-gemma-4)
- [Google 官方 Gemma 4 博客](https://blog.google/innovation-and-ai/technology/developers-tools/gemma-4/)

最后更新于 16天前
