工具教程 · 2026-08-30

Warp 自定义推理端点
OpenAI Chat Completions,要公网 URL

截至 2026-10-07,Warp 官方文档支持自定义 OpenAI 兼容推理端点(POST /v1/chat/completions)。下一步:Settings 搜 inference endpoint,填 https://api.qcode.cc/openai/v1 和 QCode key,模型 id 从 /models 复制 GPT 或国产模型(Claude 走不了这条);选这个模型,不要选 Auto。

更新于 2026-10-07

把这个工具接到 QCode 端点:一把 key 调 Claude、GPT 与国产模型。

#warp#custom inference#BYOK#OpenAI 兼容

要点

/v1/chat/completions

端点必须实现的协议

官方:自定义推理端点必须实现 OpenAI Chat Completions API。

0

选中自定义模型时扣不扣 Warp AI credits

官方:选中端点路由的模型时,不消耗 Warp AI credits,推理费由端点提供方出。Auto 仍消耗 Warp credits。

公网 HTTPS

网络要求

官方:请求走 Warp 服务器,localhost / 内网地址会被拒。QCode 的 https://api.qcode.cc/openai/v1 是公网 HTTPS。

2026-10-07

文档抓取日

docs.warp.dev/agents/inference/custom-inference-endpoint/ 2026-08-30 首次抓取、2026-10-07 复核(页面标注 Last updated Oct 6, 2026);BYOK 页 2026-08-30 抓取。

Warp 的自定义推理是什么

Warp 是带 Agent 的终端。官方把「自定义推理端点」定义成:把 Agent 指到你控制的、实现 OpenAI Chat Completions 的公网 URL(OpenRouter、LiteLLM、z.ai、内部网关)。这和 OpenAI/Anthropic/Google 官方账号的 BYOK 不是同一条设置。Cloud Agents 用不了本地存的自定义端点。

现在还在被搜什么

2026-08 官方账号仍在讲 BYOK 与自定义推理;@warpdotdev 员工 2026-08-13 写「终端里的 agent 已有 custom inference URL,CLI 还在做」。站内没有 Warp 专页。本页只回答:官方怎么加端点,以及填 QCode 之后不要点 Auto。

时间线

2026-05-20

Warp 博客宣布 BYOK 上 Free,并支持 OpenAI Chat Completions 兼容的自定义推理端点。

文档现状

Settings 搜 inference endpoint:填暴露 /v1/chat/completions 的 base URL、凭证、模型 id。选中后不走 Warp AI credits。

2026-08-30

本轮抓取仍要求公网可达;localhost 被拒。Auto 永远消耗 Warp credits。密钥本地钥匙串,请求时在飞行中经过 Warp 后端,官方写不在服务器上存储。

已确认 vs 注意

已确认

自定义推理端点可用在 Free 及符合条件的付费档(个人 / ≤10 人组织以官方条款为准)。协议是 OpenAI Chat Completions。选中该模型时不扣 Warp AI credits。文档 2026-10-07 复核。

注意

官方:Auto 仍消耗 Warp credits。localhost 不可用。Cloud Agents 读不到本机自定义端点,继续耗 Warp credits。ChatGPT / Claude 消费级订阅不能当 Warp 的 BYOK;要用 API key。

自定义端点还是官方账号 BYOK

自定义推理端点(本页)

任意 OpenAI 兼容公网 URL。QCode 填 https://api.qcode.cc/openai/v1,配 GPT 与国产模型。

官方账号 BYOK

只接 OpenAI / Anthropic / Google 的官方账号。网关、LiteLLM、QCode 这类走自定义端点,不走官方账号 BYOK 框。

下一步怎么做

① Warp 里打开 Settings,搜 inference endpoint。② endpoint URL 填 https://api.qcode.cc/openai/v1(官方要求填暴露 /v1/chat/completions 的 base URL,官方示例也以 /v1 结尾),API key 填 QCode key,模型 id 从 /models 复制 GPT 或国产模型(如 gpt-6-sol、glm-5.3)。③ 保存后在模型选择器里点这个模型,不要点 Auto。Claude 模型在这个 OpenAI 兼容端点上不可用;要用 Claude,请在 Warp 终端里跑 Claude Code,把 ANTHROPIC_BASE_URL 设为 https://api.qcode.cc/api。

在 QCode 上

https://api.qcode.cc/openai/v1 是 QCode 的公网 OpenAI 兼容端点,满足 Warp「必须公网可达」的要求;它只服务 GPT 与国产模型,Claude 只能走 Anthropic 端点 https://api.qcode.cc/api。可调模型以 /models 为准。Business/Enterprise 上本地 agent 仍可能消耗 Warp 的 platform credits,那是 Warp 自己的平台费,不是 QCode 价。

常见问题

Warp 能接 QCode 这种网关吗?

能,限 GPT 与国产模型。官方自定义推理端点就是给 OpenRouter、LiteLLM、内部网关这类 OpenAI 兼容 URL 用的;QCode 填 https://api.qcode.cc/openai/v1。Claude 在这个端点上不可用。

能不能填 localhost?

官方拒绝 localhost 和内网地址,因为请求要经过 Warp 服务器。必须先暴露成公网 HTTPS。

为什么选 Auto 还在扣 Warp credits?

官方:Auto 依赖 Warp 的路由基础设施,即使配了自定义端点也消耗 Warp credits。要用自己的端点,必须在选择器里点那个模型。

ChatGPT Plus 能接到 Warp 吗?

官方 BYOK 页:不能把 ChatGPT 或 Claude 消费级订阅接到 Warp。要用 API key,按提供方账单付。

key 会不会留在 Warp 服务器?

官方:存在本机钥匙串;每次请求飞行中经过 Warp 后端调用你的端点,然后丢弃,不在服务器存储。

模型 id 从哪来?

/models 实时目录。

信息来源

Warp Custom inference endpoint(docs.warp.dev/agents/inference/custom-inference-endpoint/,页面标注 Last updated Oct 6, 2026),2026-08-30 抓取、2026-10-07 复核;Bring Your Own API Key 页 2026-08-30 抓取。发布说明见 warp.dev/blog/bring-your-own-inference-to-warp(2026-05-20)。QCode 端点写法依据 docs.qcode.cc 接入点与 API 格式页(2026-10-07 抓取)。

在 Warp 里加自定义端点

公网 URL https://api.qcode.cc/openai/v1,配 GPT 与国产模型。选这个模型,不要选 Auto。

先体验,再决定

不确定选哪档?先买体验版(¥60/月),满意再升级,旧套餐剩余价值按比例退回余额。