本地与设备端 AI

完全在你的机器上运行 AI——Chrome 内置的 Gemini Nano、通过 WebGPU 在浏览器内运行的 Gemma 模型,或通过本地回环接入你自己的本地运行时(Ollama、LM Studio 等)。

Cordy 可以不使用云端 AI 服务商来处理提示。Chrome 内置模型和浏览器内 Gemma 在本地处理提示;本地原生端点会在你配置的地址接收提示。首次设置可能从模型托管服务下载权重,本地服务器也可能要求自己的 API 密钥。

本地 AI 对于隐私敏感的文本、近似离线的工作流以及避免按 token 计费都很实用。它也是实验性的——质量与稳定性随你的硬件和浏览器而异。

启用本地 AI

本地 AI 默认关闭。打开主开关(设置 → 本地 AI → 启用本地 AI)并同意标题为**「本地 AI(实验性)」**的确认弹窗。它请你确认以下如实的权衡:

  • 它可能不稳定,并可能导致高内存占用、卡顿或崩溃;
  • WebGPU 支持因设备和浏览器而异,部分模型可能无法加载;
  • 模型可能需要较大的存储空间,并缓存在本地;
  • 结果不做保证,质量可能低于云端模型。

在此开关打开之前,即使你已配置运行时,本地模型也不会真正运行。

检查你的硬件

本地 AI 标签页包含一个硬件性能评估卡片,用于检测 WebGPU——浏览器内 Gemma 模型和 Kokoro 语音合成所必需——并显示模型兼容性。若 WebGPU 不可用,浏览器内模型无法运行;Chrome 内置 AI 和本地原生运行时可能仍是可选项。

三类本地 AI

1. Chrome 内置 AI(Gemini Nano)

Chrome 通过 Prompt API 暴露设备端模型。可用性和模型下载由 Chrome 管理,但你必须先启用 Chrome 的 AI 标志:

  1. 打开 chrome://flags/#prompt-api-for-gemini-nano 并设为 Enabled
  2. 打开 chrome://flags/#optimization-guide-on-device-model 并设为 Enabled BypassPerfRequirement
  3. 重新启动 Chrome。
  4. 设置 → 本地 AI 中,用初始化模型下载并预热 Gemini Nano。

Gemini Nano 上下文窗口较小(约 4,096 tokens),最适合简单问答、短摘要和翻译——不适合复杂推理或代码。它不支持工具调用,因此不会使用 Cordy 的浏览器工具。

2. 浏览器内模型(WebGPU):Gemma

Cordy 可以下载在你浏览器内、通过 WebGPU 运行的神经模型,并为你托管:

模型大小要求最适合
Gemma 4 E2B(2B)约 3.1 GBWebGPU日常对话、摘要、快速问答
Gemma 4 E4B(4B)约 4.1 GBWebGPU + ≥4 GB 显存复杂推理、较长分析、代码

设置 → 本地 AI → 本地 LLM 模型下载模型;它会缓存在本地以便复用。两者都需要 WebGPU。目录声明的上下文上限为 128K,实际还受浏览器内存和 GPU 资源约束。

3. 本地原生运行时(Ollama、LM Studio 等)

如果你已在运行本地模型服务器,可通过本地回环(localhost)将 Cordy 接入它。Cordy 使用 OpenAI 兼容 API 与之通信,因此模型运行在你的服务器中,而非浏览器内。

设置 → 本地 AI → 本地原生运行时 → 添加运行时添加。已提供以下模板:

运行时默认地址
Ollamahttp://localhost:11434
LM Studiohttp://localhost:1234/v1
llama.cpp(服务器)http://localhost:8080/v1
vLLMhttp://localhost:8000/v1
LocalAIhttp://localhost:8080/v1
Unslothhttp://localhost:8888/v1
OpenAI 兼容(由你填写 URL)

设置 Base URL;如果运行时要求认证,再添加 API 密钥,然后点击检测。首次连接 localhost127.0.0.1 时,请批准相应的 Chrome 可选来源权限。Cordy 只允许回环地址不带认证;本地服务器需要密钥时,该密钥会进入与云端服务商相同的加密密钥存储。

仍在成熟中。 本地原生运行时支持较新,且范围限于 OpenAI 兼容的模型发现/v1/models)。Cordy 不会为你自动检测或安装运行时软件,端到端可靠性仍在改进中。选择前,请确保你的运行时已在运行且可达。

使用本地模型

本地 AI 开启且模型或运行时就绪后,在设置 → AI 配置 → 功能模型中选择它。浏览器内模型可用于支持的聊天与文本操作槽位。本地原生运行时可用于支持的文本槽位,但翻译槽位明确排除本地原生端点;其中的本地选项使用浏览器内翻译引擎。TTS 使用自己的本地引擎设置。

如实的限制

  • 实验性。 相比云端模型,预期会有更多毛边。
  • 不支持附件。 本地模型不接受图片/PDF/文件附件——Cordy 会请你切换到云端模型。
  • 工具取决于执行路径。 浏览器内生成不会收到浏览器工具。本地原生聊天模型可以使用普通 Cordy 工具集,并遵循与云端聊天相同的审批规则。
  • 受硬件约束。 WebGPU 模型需要有能力的 GPU;大模型需要显存和磁盘空间。
  • 质量参差。 对于困难的推理或代码,云端模型通常更强。

隐私

发往 Gemini Nano 和浏览器内 Gemma 的提示留在浏览器中;发往回环运行时的提示会交给该本地进程。模型下载可以访问公共模型托管服务,但不会携带你的提示。本地路由不会显示一次性的云端知情同意弹窗

疑难排查

  • 「WebGPU is required… but not available」。 你的浏览器/设备未暴露 WebGPU。请更新 Chrome 和显卡驱动,或改用 Chrome 内置 AI 或本地原生运行时。
  • Gemini Nano 无法初始化。 重新检查两个 Chrome 标志并重启;首次使用时下载可能需要一些时间。
  • 模型下载卡住。 取消并重试;确保有足够的可用磁盘空间(Gemma 需数 GB)。
  • 运行时显示「Not running」/「Wrong API」。 请启动你的本地服务器,确认 Base URL 和端口,并确保它暴露了 OpenAI 兼容的 /v1 API。
  • 本地模型拒绝附件。 属于正常——请将该条消息切换到云端模型。

相关