Свой inference в Warp
OpenAI Chat Completions, публичный URL
На 07.10.2026 Warp документирует свой OpenAI-совместимый inference (POST /v1/chat/completions). Дальше: Settings → inference endpoint, https://api.qcode.cc/openai/v1 и ключ QCode, id модели GPT или GLM / Kimi / DeepSeek / Qwen с /models (Claude здесь не работает), затем выбрать эту модель — не Auto.
Обновлено 2026-10-07
Подключите этот инструмент к эндпоинту QCode — один ключ для Claude, GPT и китайских моделей.
- Оплата по токенам — актуальные цены на /models
- Оплата через СБП, российскими картами, картами Visa / Mastercard / AMEX или криптовалютой
- Самообслуживание: после пополнения тариф активируется мгновенно
Коротко
Какой протокол должен быть
Официально: custom inference endpoint обязан реализовать OpenAI Chat Completions API.
Warp AI credits при выборе этой модели
Официально: выбор модели с endpoint не тратит Warp AI credits; inference биллит endpoint. Auto по-прежнему тратит Warp credits.
Сеть
Официально: запросы идут через серверы Warp, localhost / частные URL отклоняются. https://api.qcode.cc/openai/v1 у QCode — публичный HTTPS.
Дата снятия доков
Страница docs.warp.dev custom-inference-endpoint: снято 30.08.2026, перепроверено 07.10.2026 (отметка Last updated Oct 6, 2026); BYOK — снято 30.08.2026.
Что такое custom inference
Warp — терминал с Agent. Официально custom inference endpoint — направить Agent на публичный URL, которым вы управляете и который реализует OpenAI Chat Completions (OpenRouter, LiteLLM, z.ai, внутренний шлюз). Это не тот же виджет, что BYOK с официальными аккаунтами OpenAI/Anthropic/Google. Cloud Agents не видят локально сохранённый custom endpoint.
Что ещё ищут
В 08.2026 аккаунт Warp всё ещё говорит про BYOK и custom inference; инженер Warp 13.08.2026 написал, что custom inference URL уже есть у агента в терминале Warp, CLI ещё в работе. Страницы про Warp на сайте не было. Здесь — как официально добавить endpoint и не нажимать Auto после вставки QCode.
Линия
Блог Warp объявил BYOK на Free и custom inference, совместимый с OpenAI Chat Completions.
Settings, поиск inference endpoint: base URL с /v1/chat/completions, учётные данные, id моделей. Выбор этой модели обходит Warp AI credits.
На эту дату по-прежнему нужен публичный URL; localhost отклоняется. Auto всегда жжёт Warp credits. Ключи в локальной связке, в полёте проходят backend Warp; официально на серверах не хранятся.
Подтверждено vs осторожно
Подтверждено
Custom inference — на Free и подходящих платных планах (физлица / орги до 10 человек по условиям Warp). Протокол — OpenAI Chat Completions. Выбор этой модели не тратит Warp AI credits. Доки перепроверены 07.10.2026.
Осторожно
Официально: Auto всё равно тратит Warp credits. localhost нельзя. Cloud Agents не используют локальный custom endpoint и жгут Warp credits. Потребительская подписка ChatGPT или Claude не подключается как Warp BYOK; нужен API-ключ.
Свой endpoint или BYOK официального провайдера
Custom inference (эта страница)
Любой публичный OpenAI-совместимый URL. Для QCode: https://api.qcode.cc/openai/v1, для GPT и GLM / Kimi / DeepSeek / Qwen.
BYOK официального провайдера
Только аккаунты OpenAI / Anthropic / Google. Шлюзы, LiteLLM и QCode — виджет custom inference, не BYOK официального провайдера.
Что сделать дальше
① В Warp откройте Settings и найдите inference endpoint. ② URL: https://api.qcode.cc/openai/v1 (Warp просит base URL, который отдаёт /v1/chat/completions, и его собственный пример тоже заканчивается на /v1). Ключ QCode. Id модели GPT или GLM / Kimi / DeepSeek / Qwen с /models (например, gpt-6-sol, glm-5.3). ③ Сохраните и выберите эту модель в пикере — не Auto. Модели Claude на этом OpenAI-совместимом эндпоинте недоступны; для Claude запустите Claude Code в терминале Warp с ANTHROPIC_BASE_URL = https://api.qcode.cc/api.
На QCode
https://api.qcode.cc/openai/v1 — публичный OpenAI-совместимый эндпоинт QCode, это совпадает с правилом Warp «должен быть доступен из интернета»; он обслуживает GPT и GLM / Kimi / DeepSeek / Qwen, а Claude работает только через эндпоинт Anthropic https://api.qcode.cc/api. Живые id — /models. На Business/Enterprise локальные agent-запуски могут тратить platform credits Warp — это счётчик платформы Warp, не прайс QCode.
FAQ
Warp умеет шлюз вроде QCode?
Да, для GPT и GLM / Kimi / DeepSeek / Qwen. Официальный custom inference как раз для OpenAI-совместимых URL: OpenRouter, LiteLLM, внутренние шлюзы; для QCode — https://api.qcode.cc/openai/v1. Claude на этом эндпоинте недоступен.
Можно localhost?
Официально localhost и частные URL отклоняются: запросы идут через серверы Warp. Сначала публичный HTTPS.
Почему Auto жжёт Warp credits?
Официально: Auto зависит от маршрутизации Warp, поэтому всегда тратит Warp credits, даже если custom endpoint настроен. Чтобы использовать свой endpoint, выберите эту модель в пикере.
Можно ли воткнуть ChatGPT Plus в Warp?
Официальная страница BYOK: потребительскую подписку ChatGPT или Claude к Warp не подключить. Нужен API-ключ и оплата провайдеру.
Warp хранит ключ?
Официально: в локальной связке; в полёте проходит backend Warp, вызывается ваш endpoint, затем ключ отбрасывается, на серверах не хранится.
Откуда id моделей?
Живой каталог /models.
Источники
Warp Custom inference endpoint (docs.warp.dev/agents/inference/custom-inference-endpoint/, отметка Last updated Oct 6, 2026), снято 30.08.2026, перепроверено 07.10.2026; Bring Your Own API Key снято 30.08.2026. Анонс: warp.dev/blog/bring-your-own-inference-to-warp (20.05.2026). Эндпоинты QCode — по странице docs.qcode.cc об эндпоинтах (снята 07.10.2026).
Добавить custom endpoint в Warp
Публичный URL https://api.qcode.cc/openai/v1 для GPT и GLM. Выберите эту модель, не Auto.
Рядом
Claude Desktop и сторонний API: руководство
Gateway в режиме разработчика: только Anthropic Messages API и модели Claude, без ANTHROPIC_BASE_URL, плюс отличия от Claude Code.
Расширение Claude Code для VS Code: API-ключ и свой шлюз
Ключ в claudeCode.environmentVariables, общий с CLI settings.json, экран входа и выбор модели.
Гид по Codex CLI
Официальный CLI OpenAI.
Не аффилированы с Warp. Поведение — по docs.warp.dev. Это не инструкция по обходу подписки Warp или вендора моделей.