一個端點打所有模型
完整相容 OpenAI Chat Completions 介面,支援串流、工具呼叫與視覺輸入。你現有的 openai SDK、LangChain、Vercel AI SDK 都能直接指過來,改 base_url 就好。
- OpenAI 相容
- SSE 串流
- Tools / Vision
Inference 是 OpenAI 相容的 LLM 中轉閘道。把 base_url 換成我們,就能用同一支 SDK、同一把金鑰呼叫 OpenAI、Anthropic、Google Gemini 等上游 —— 程式碼一行不用改。
預付儲值 · 無月費 · 無綁約 · 隨時停用金鑰
curl https://api.alphacurve.io/v1/chat/completions \ -H "Authorization: Bearer $INFERENCE_API_KEY" \ -H "Content-Type: application/json" \ -d '{ "model": "claude-opus-4-5", "messages": [ { "role": "user", "content": "Hello, Inference!" } ], "stream": true }'你好!我是透過 Inference 閘道回覆你的。
已接上主流上游,之後新增的模型你不必改任何程式
凡是 OpenAI 相容的供應商,我們新增一筆目錄設定即可上線。
你需要的不只是一個代理。金鑰治理、預算上限、自動容錯與成本可觀測性,全都內建在同一層。
完整相容 OpenAI Chat Completions 介面,支援串流、工具呼叫與視覺輸入。你現有的 openai SDK、LangChain、Vercel AI SDK 都能直接指過來,改 base_url 就好。
每家上游可以掛多把金鑰,依優先序輪替。遇到 429、逾時或上游故障時,閘道會在同一次請求內轉往下一把可用金鑰,你的使用者不會看到錯誤。
每把金鑰都能限制可用模型清單、設定每月花費上限、標記所屬環境或團隊,並隨時停用。外包夥伴、測試環境與正式服務可以徹底隔離。
每一次請求都記錄 token 用量、成本、延遲與路由結果。可依金鑰、模型、日期拆解,找出是哪個功能在燒錢,而不是月底看到一張總帳單。
透過 Lemon Squeezy 儲值餘額,依實際 token 用量即時扣款。沒有月費、沒有座位費、沒有最低消費,餘額不用完也不會過期。
不需要新的 SDK、不需要包一層 adapter、不需要重寫 prompt 流程。你的請求與回應格式完全不變。
from openai import OpenAIclient = OpenAI( base_url="https://api.openai.com/v1", api_key=os.environ["OPENAI_API_KEY"],)# 只能用這一家的模型resp = client.chat.completions.create( model="gpt-5.2", messages=messages,)綁死一家供應商,換模型就要改程式
from openai import OpenAIclient = OpenAI( base_url="https://api.alphacurve.io/v1", api_key=os.environ["INFERENCE_API_KEY"],)# 目錄裡任何模型都能直接指定resp = client.chat.completions.create( model="claude-opus-4-5", messages=messages,)同一支 SDK 呼叫全部模型,還多了金鑰治理與用量報表
串流、function calling、多輪對話、system prompt 一律照舊運作。
https://api.alphacurve.io/v1所有模型共用同一個端點與同一把金鑰。想換模型只要改請求裡的 model 欄位,不必重新申請帳號。
| 模型 | 供應商 | Context | 輸入 / 1M | 輸出 / 1M |
|---|---|---|---|---|
claude-opus-4-5視覺工具新上架 | Anthropic | 200K | $5.00 | $25.00 |
claude-sonnet-4-5視覺工具 | Anthropic | 200K | $3.00 | $15.00 |
gpt-5.2視覺工具新上架 | OpenAI | 400K | $1.25 | $10.00 |
gpt-5.2-mini工具低延遲 | OpenAI | 400K | $0.25 | $2.00 |
gemini-3-pro視覺工具 | 1M | $1.25 | $10.00 | |
gemini-3-flash視覺低延遲 | 1M | $0.10 | $0.40 | |
deepseek-v3.2工具低延遲 | DeepSeek | 128K | $0.28 | $0.42 |
grok-4.1視覺工具 | xAI | 256K | $3.00 | $15.00 |
claude-opus-4-5Anthropicclaude-sonnet-4-5Anthropicgpt-5.2OpenAIgpt-5.2-miniOpenAIgemini-3-proGooglegemini-3-flashGoogledeepseek-v3.2DeepSeekgrok-4.1xAI價格以美元計,依實際 token 用量計費;此處為展示資料,實際以目錄 API 為準。
查看完整模型目錄Dashboard 即時彙整每次請求的 token 用量、成本與延遲,可依金鑰與模型拆解,並在餘額或預算接近上限時提醒你。
本期花費
$48.16
+12.4%
Token 用量
34.2M
+8.1%
請求數
126,480
+3.6%
P95 延遲
1.24s
-9.2%
每日花費(USD)
近 14 天
模型佔比
各金鑰用量
透過 Lemon Squeezy 一次儲值,依 token 用量即時扣款。用不完的餘額留著,隨時可以停止使用而不需要解約。
試水溫
適合做 POC、跑幾個 side project 或驗證串接。
約 800 萬 tokens(以 gemini-3-flash 估)
儲值 $10開發中
產品已經有使用者,需要穩定的容錯與用量報表。
約 1,750 萬 tokens(混用主力模型估)
儲值 $50規模化
多個環境、多組團隊金鑰,需要預算上限與成本歸屬。
約 7,100 萬 tokens(混用主力模型估)
儲值 $200需要更大額度或發票? 聯絡我們
找不到答案的話,文件裡有更完整的說明,或直接寫信給我們。
是。我們實作的是 OpenAI Chat Completions 介面,請求與回應格式完全一致,包含 SSE 串流、function calling 與多模態輸入。把 base_url 指向 https://api.alphacurve.io/v1、換上 Inference 的金鑰即可,SDK、prompt、後處理邏輯都不用動。