本地与设备端 AI
完全在你的机器上运行 AI——Chrome 内置的 Gemini Nano、通过 WebGPU 在浏览器内运行的 Gemma 模型,或通过本地回环接入你自己的本地运行时(Ollama、LM Studio 等)。
Cordy 可以不使用云端 AI 服务商来处理提示。Chrome 内置模型和浏览器内 Gemma 在本地处理提示;本地原生端点会在你配置的地址接收提示。首次设置可能从模型托管服务下载权重,本地服务器也可能要求自己的 API 密钥。
本地 AI 对于隐私敏感的文本、近似离线的工作流以及避免按 token 计费都很实用。它也是实验性的——质量与稳定性随你的硬件和浏览器而异。
启用本地 AI
本地 AI 默认关闭。打开主开关(设置 → 本地 AI → 启用本地 AI)并同意标题为**「本地 AI(实验性)」**的确认弹窗。它请你确认以下如实的权衡:
- 它可能不稳定,并可能导致高内存占用、卡顿或崩溃;
- WebGPU 支持因设备和浏览器而异,部分模型可能无法加载;
- 模型可能需要较大的存储空间,并缓存在本地;
- 结果不做保证,质量可能低于云端模型。
在此开关打开之前,即使你已配置运行时,本地模型也不会真正运行。
检查你的硬件
本地 AI 标签页包含一个硬件性能评估卡片,用于检测 WebGPU——浏览器内 Gemma 模型和 Kokoro 语音合成所必需——并显示模型兼容性。若 WebGPU 不可用,浏览器内模型无法运行;Chrome 内置 AI 和本地原生运行时可能仍是可选项。
三类本地 AI
1. Chrome 内置 AI(Gemini Nano)
Chrome 通过 Prompt API 暴露设备端模型。可用性和模型下载由 Chrome 管理,但你必须先启用 Chrome 的 AI 标志:
- 打开
chrome://flags/#prompt-api-for-gemini-nano并设为 Enabled。 - 打开
chrome://flags/#optimization-guide-on-device-model并设为 Enabled BypassPerfRequirement。 - 重新启动 Chrome。
- 在设置 → 本地 AI 中,用初始化模型下载并预热 Gemini Nano。
Gemini Nano 上下文窗口较小(约 4,096 tokens),最适合简单问答、短摘要和翻译——不适合复杂推理或代码。它不支持工具调用,因此不会使用 Cordy 的浏览器工具。
2. 浏览器内模型(WebGPU):Gemma
Cordy 可以下载在你浏览器内、通过 WebGPU 运行的神经模型,并为你托管:
| 模型 | 大小 | 要求 | 最适合 |
|---|---|---|---|
| Gemma 4 E2B(2B) | 约 3.1 GB | WebGPU | 日常对话、摘要、快速问答 |
| Gemma 4 E4B(4B) | 约 4.1 GB | WebGPU + ≥4 GB 显存 | 复杂推理、较长分析、代码 |
从设置 → 本地 AI → 本地 LLM 模型下载模型;它会缓存在本地以便复用。两者都需要 WebGPU。目录声明的上下文上限为 128K,实际还受浏览器内存和 GPU 资源约束。
3. 本地原生运行时(Ollama、LM Studio 等)
如果你已在运行本地模型服务器,可通过本地回环(localhost)将 Cordy 接入它。Cordy 使用 OpenAI 兼容 API 与之通信,因此模型运行在你的服务器中,而非浏览器内。
从设置 → 本地 AI → 本地原生运行时 → 添加运行时添加。已提供以下模板:
| 运行时 | 默认地址 |
|---|---|
| Ollama | http://localhost:11434 |
| LM Studio | http://localhost:1234/v1 |
| llama.cpp(服务器) | http://localhost:8080/v1 |
| vLLM | http://localhost:8000/v1 |
| LocalAI | http://localhost:8080/v1 |
| Unsloth | http://localhost:8888/v1 |
| OpenAI 兼容 | (由你填写 URL) |
设置 Base URL;如果运行时要求认证,再添加 API 密钥,然后点击检测。首次连接 localhost 或 127.0.0.1 时,请批准相应的 Chrome 可选来源权限。Cordy 只允许回环地址不带认证;本地服务器需要密钥时,该密钥会进入与云端服务商相同的加密密钥存储。
仍在成熟中。 本地原生运行时支持较新,且范围限于 OpenAI 兼容的模型发现(
/v1/models)。Cordy 不会为你自动检测或安装运行时软件,端到端可靠性仍在改进中。选择前,请确保你的运行时已在运行且可达。
使用本地模型
本地 AI 开启且模型或运行时就绪后,在设置 → AI 配置 → 功能模型中选择它。浏览器内模型可用于支持的聊天与文本操作槽位。本地原生运行时可用于支持的文本槽位,但翻译槽位明确排除本地原生端点;其中的本地选项使用浏览器内翻译引擎。TTS 使用自己的本地引擎设置。
如实的限制
- 实验性。 相比云端模型,预期会有更多毛边。
- 不支持附件。 本地模型不接受图片/PDF/文件附件——Cordy 会请你切换到云端模型。
- 工具取决于执行路径。 浏览器内生成不会收到浏览器工具。本地原生聊天模型可以使用普通 Cordy 工具集,并遵循与云端聊天相同的审批规则。
- 受硬件约束。 WebGPU 模型需要有能力的 GPU;大模型需要显存和磁盘空间。
- 质量参差。 对于困难的推理或代码,云端模型通常更强。
隐私
发往 Gemini Nano 和浏览器内 Gemma 的提示留在浏览器中;发往回环运行时的提示会交给该本地进程。模型下载可以访问公共模型托管服务,但不会携带你的提示。本地路由不会显示一次性的云端知情同意弹窗。
疑难排查
- 「WebGPU is required… but not available」。 你的浏览器/设备未暴露 WebGPU。请更新 Chrome 和显卡驱动,或改用 Chrome 内置 AI 或本地原生运行时。
- Gemini Nano 无法初始化。 重新检查两个 Chrome 标志并重启;首次使用时下载可能需要一些时间。
- 模型下载卡住。 取消并重试;确保有足够的可用磁盘空间(Gemma 需数 GB)。
- 运行时显示「Not running」/「Wrong API」。 请启动你的本地服务器,确认 Base URL 和端口,并确保它暴露了 OpenAI 兼容的
/v1API。 - 本地模型拒绝附件。 属于正常——请将该条消息切换到云端模型。