Инструмент · 30.08.2026

Свой inference в Warp
OpenAI Chat Completions, публичный URL

На 07.10.2026 Warp документирует свой OpenAI-совместимый inference (POST /v1/chat/completions). Дальше: Settings → inference endpoint, https://api.qcode.cc/openai/v1 и ключ QCode, id модели GPT или GLM / Kimi / DeepSeek / Qwen с /models (Claude здесь не работает), затем выбрать эту модель — не Auto.

Обновлено 2026-10-07

Подключите этот инструмент к эндпоинту QCode — один ключ для Claude, GPT и китайских моделей.

#warp#custom inference#BYOK#OpenAI-совместимый

Коротко

/v1/chat/completions

Какой протокол должен быть

Официально: custom inference endpoint обязан реализовать OpenAI Chat Completions API.

0

Warp AI credits при выборе этой модели

Официально: выбор модели с endpoint не тратит Warp AI credits; inference биллит endpoint. Auto по-прежнему тратит Warp credits.

Публичный HTTPS

Сеть

Официально: запросы идут через серверы Warp, localhost / частные URL отклоняются. https://api.qcode.cc/openai/v1 у QCode — публичный HTTPS.

07.10.2026

Дата снятия доков

Страница docs.warp.dev custom-inference-endpoint: снято 30.08.2026, перепроверено 07.10.2026 (отметка Last updated Oct 6, 2026); BYOK — снято 30.08.2026.

Что такое custom inference

Warp — терминал с Agent. Официально custom inference endpoint — направить Agent на публичный URL, которым вы управляете и который реализует OpenAI Chat Completions (OpenRouter, LiteLLM, z.ai, внутренний шлюз). Это не тот же виджет, что BYOK с официальными аккаунтами OpenAI/Anthropic/Google. Cloud Agents не видят локально сохранённый custom endpoint.

Что ещё ищут

В 08.2026 аккаунт Warp всё ещё говорит про BYOK и custom inference; инженер Warp 13.08.2026 написал, что custom inference URL уже есть у агента в терминале Warp, CLI ещё в работе. Страницы про Warp на сайте не было. Здесь — как официально добавить endpoint и не нажимать Auto после вставки QCode.

Линия

20.05.2026

Блог Warp объявил BYOK на Free и custom inference, совместимый с OpenAI Chat Completions.

Как в доках

Settings, поиск inference endpoint: base URL с /v1/chat/completions, учётные данные, id моделей. Выбор этой модели обходит Warp AI credits.

30.08.2026

На эту дату по-прежнему нужен публичный URL; localhost отклоняется. Auto всегда жжёт Warp credits. Ключи в локальной связке, в полёте проходят backend Warp; официально на серверах не хранятся.

Подтверждено vs осторожно

Подтверждено

Custom inference — на Free и подходящих платных планах (физлица / орги до 10 человек по условиям Warp). Протокол — OpenAI Chat Completions. Выбор этой модели не тратит Warp AI credits. Доки перепроверены 07.10.2026.

Осторожно

Официально: Auto всё равно тратит Warp credits. localhost нельзя. Cloud Agents не используют локальный custom endpoint и жгут Warp credits. Потребительская подписка ChatGPT или Claude не подключается как Warp BYOK; нужен API-ключ.

Свой endpoint или BYOK официального провайдера

Custom inference (эта страница)

Любой публичный OpenAI-совместимый URL. Для QCode: https://api.qcode.cc/openai/v1, для GPT и GLM / Kimi / DeepSeek / Qwen.

BYOK официального провайдера

Только аккаунты OpenAI / Anthropic / Google. Шлюзы, LiteLLM и QCode — виджет custom inference, не BYOK официального провайдера.

Что сделать дальше

① В Warp откройте Settings и найдите inference endpoint. ② URL: https://api.qcode.cc/openai/v1 (Warp просит base URL, который отдаёт /v1/chat/completions, и его собственный пример тоже заканчивается на /v1). Ключ QCode. Id модели GPT или GLM / Kimi / DeepSeek / Qwen с /models (например, gpt-6-sol, glm-5.3). ③ Сохраните и выберите эту модель в пикере — не Auto. Модели Claude на этом OpenAI-совместимом эндпоинте недоступны; для Claude запустите Claude Code в терминале Warp с ANTHROPIC_BASE_URL = https://api.qcode.cc/api.

На QCode

https://api.qcode.cc/openai/v1 — публичный OpenAI-совместимый эндпоинт QCode, это совпадает с правилом Warp «должен быть доступен из интернета»; он обслуживает GPT и GLM / Kimi / DeepSeek / Qwen, а Claude работает только через эндпоинт Anthropic https://api.qcode.cc/api. Живые id — /models. На Business/Enterprise локальные agent-запуски могут тратить platform credits Warp — это счётчик платформы Warp, не прайс QCode.

FAQ

Warp умеет шлюз вроде QCode?

Да, для GPT и GLM / Kimi / DeepSeek / Qwen. Официальный custom inference как раз для OpenAI-совместимых URL: OpenRouter, LiteLLM, внутренние шлюзы; для QCode — https://api.qcode.cc/openai/v1. Claude на этом эндпоинте недоступен.

Можно localhost?

Официально localhost и частные URL отклоняются: запросы идут через серверы Warp. Сначала публичный HTTPS.

Почему Auto жжёт Warp credits?

Официально: Auto зависит от маршрутизации Warp, поэтому всегда тратит Warp credits, даже если custom endpoint настроен. Чтобы использовать свой endpoint, выберите эту модель в пикере.

Можно ли воткнуть ChatGPT Plus в Warp?

Официальная страница BYOK: потребительскую подписку ChatGPT или Claude к Warp не подключить. Нужен API-ключ и оплата провайдеру.

Warp хранит ключ?

Официально: в локальной связке; в полёте проходит backend Warp, вызывается ваш endpoint, затем ключ отбрасывается, на серверах не хранится.

Откуда id моделей?

Живой каталог /models.

Источники

Warp Custom inference endpoint (docs.warp.dev/agents/inference/custom-inference-endpoint/, отметка Last updated Oct 6, 2026), снято 30.08.2026, перепроверено 07.10.2026; Bring Your Own API Key снято 30.08.2026. Анонс: warp.dev/blog/bring-your-own-inference-to-warp (20.05.2026). Эндпоинты QCode — по странице docs.qcode.cc об эндпоинтах (снята 07.10.2026).

Добавить custom endpoint в Warp

Публичный URL https://api.qcode.cc/openai/v1 для GPT и GLM. Выберите эту модель, не Auto.

Сначала попробуйте, потом решайте

Не уверены, какой тариф выбрать? Начните со «Стартового» ($8.57/мес), а при апгрейде остаток старого тарифа вернётся на баланс.