跳至主要內容
已支援 Claude Opus 4.5、GPT-5.2、Gemini 3 Pro→

一個端點,打所有模型

Inference 是 OpenAI 相容的 LLM 中轉閘道。把 base_url 換成我們,就能用同一支 SDK、同一把金鑰呼叫 OpenAI、Anthropic、Google Gemini 等上游 —— 程式碼一行不用改。

預付儲值 · 無月費 · 無綁約 · 隨時停用金鑰

個 base_url
1
家上游供應商
3+
自動容錯可用率
99.9%
元月費
0
~/your-app
curl https://api.alphacurve.io/v1/chat/completions \  -H "Authorization: Bearer $INFERENCE_API_KEY" \  -H "Content-Type: application/json" \  -d '{    "model": "claude-opus-4-5",    "messages": [      { "role": "user", "content": "Hello, Inference!" }    ],    "stream": true  }'
回應200 OK · 路由至 Anthropic · 首字 412ms

你好!我是透過 Inference 閘道回覆你的。

已接上主流上游,之後新增的模型你不必改任何程式

◎OpenAI
✳Anthropic
✦Google Gemini
◈DeepSeek
𝕏xAI
∞Meta Llama
▨Mistral
⏦Groq
❖Qwen
☾Moonshot

凡是 OpenAI 相容的供應商,我們新增一筆目錄設定即可上線。

為什麼選 Inference

把「串接多家模型」這件事,變成一次設定

你需要的不只是一個代理。金鑰治理、預算上限、自動容錯與成本可觀測性,全都內建在同一層。

一個端點打所有模型

完整相容 OpenAI Chat Completions 介面,支援串流、工具呼叫與視覺輸入。你現有的 openai SDK、LangChain、Vercel AI SDK 都能直接指過來,改 base_url 就好。

  • OpenAI 相容
  • SSE 串流
  • Tools / Vision

多供應商路由與自動容錯

每家上游可以掛多把金鑰,依優先序輪替。遇到 429、逾時或上游故障時,閘道會在同一次請求內轉往下一把可用金鑰,你的使用者不會看到錯誤。

  • 金鑰池輪替
  • 429 自動重試
  • 健康狀態追蹤

細緻的 API key 治理

每把金鑰都能限制可用模型清單、設定每月花費上限、標記所屬環境或團隊,並隨時停用。外包夥伴、測試環境與正式服務可以徹底隔離。

  • 模型白名單
  • 每月花費上限
  • 一鍵停用

即時用量與成本可觀測

每一次請求都記錄 token 用量、成本、延遲與路由結果。可依金鑰、模型、日期拆解,找出是哪個功能在燒錢,而不是月底看到一張總帳單。

  • Token 拆解
  • P95 延遲
  • 每把金鑰成本

預付儲值,用多少扣多少

透過 Lemon Squeezy 儲值餘額,依實際 token 用量即時扣款。沒有月費、沒有座位費、沒有最低消費,餘額不用完也不會過期。

  • 無月費
  • 即時扣款
  • 餘額不過期
遷移成本

從 OpenAI 換過來,只要改一行

不需要新的 SDK、不需要包一層 adapter、不需要重寫 prompt 流程。你的請求與回應格式完全不變。

− 改之前
client.py
from openai import OpenAIclient = OpenAI(    base_url="https://api.openai.com/v1",    api_key=os.environ["OPENAI_API_KEY"],)# 只能用這一家的模型resp = client.chat.completions.create(    model="gpt-5.2",    messages=messages,)

綁死一家供應商,換模型就要改程式

+ 改之後
client.py
from openai import OpenAIclient = OpenAI(    base_url="https://api.alphacurve.io/v1",    api_key=os.environ["INFERENCE_API_KEY"],)# 目錄裡任何模型都能直接指定resp = client.chat.completions.create(    model="claude-opus-4-5",    messages=messages,)

同一支 SDK 呼叫全部模型,還多了金鑰治理與用量報表

串流、function calling、多輪對話、system prompt 一律照舊運作。

https://api.alphacurve.io/v1
模型目錄

價格透明,全部照 token 實算

所有模型共用同一個端點與同一把金鑰。想換模型只要改請求裡的 model 欄位,不必重新申請帳號。

  • claude-opus-4-5Anthropic
    視覺工具新上架
    Context
    200K
    輸入 / 1M
    $5.00
    輸出 / 1M
    $25.00
  • claude-sonnet-4-5Anthropic
    視覺工具
    Context
    200K
    輸入 / 1M
    $3.00
    輸出 / 1M
    $15.00
  • gpt-5.2OpenAI
    視覺工具新上架
    Context
    400K
    輸入 / 1M
    $1.25
    輸出 / 1M
    $10.00
  • gpt-5.2-miniOpenAI
    工具低延遲
    Context
    400K
    輸入 / 1M
    $0.25
    輸出 / 1M
    $2.00
  • gemini-3-proGoogle
    視覺工具
    Context
    1M
    輸入 / 1M
    $1.25
    輸出 / 1M
    $10.00
  • gemini-3-flashGoogle
    視覺低延遲
    Context
    1M
    輸入 / 1M
    $0.10
    輸出 / 1M
    $0.40
  • deepseek-v3.2DeepSeek
    工具低延遲
    Context
    128K
    輸入 / 1M
    $0.28
    輸出 / 1M
    $0.42
  • grok-4.1xAI
    視覺工具
    Context
    256K
    輸入 / 1M
    $3.00
    輸出 / 1M
    $15.00

價格以美元計,依實際 token 用量計費;此處為展示資料,實際以目錄 API 為準。

查看完整模型目錄
可觀測性

錢花到哪裡,一眼看得出來

Dashboard 即時彙整每次請求的 token 用量、成本與延遲,可依金鑰與模型拆解,並在餘額或預算接近上限時提醒你。

用量總覽

近 14 天即時
本期花費

本期花費

$48.16

+12.4%

Token 用量

Token 用量

34.2M

+8.1%

請求數

請求數

126,480

+3.6%

P95 延遲

P95 延遲

1.24s

-9.2%

每日花費(USD)

近 14 天

模型佔比

  • claude-opus-4-542%
  • gpt-5.227%
  • gemini-3-pro18%
  • deepseek-v3.213%

各金鑰用量

  • prod-web$26.40
  • prod-worker$14.02
  • staging接近上限$5.91
  • agency-demo$1.83
定價

預付儲值,沒有月費也沒有綁約

透過 Lemon Squeezy 一次儲值,依 token 用量即時扣款。用不完的餘額留著,隨時可以停止使用而不需要解約。

試水溫

$10

適合做 POC、跑幾個 side project 或驗證串接。

約 800 萬 tokens(以 gemini-3-flash 估)

儲值 $10
最多人選

開發中

$50+$2.50 加贈

產品已經有使用者,需要穩定的容錯與用量報表。

約 1,750 萬 tokens(混用主力模型估)

儲值 $50

規模化

$200+$14.00 加贈

多個環境、多組團隊金鑰,需要預算上限與成本歸屬。

約 7,100 萬 tokens(混用主力模型估)

儲值 $200

需要更大額度或發票? 聯絡我們

扣款方式

只依 token 用量扣款
每次請求結束後,依模型的輸入/輸出單價乘上實際 token 數扣除餘額,精確到微分位。
沒有月費與座位費
不用訂閱、不用綁約、不用最低消費。沒有呼叫就不會被扣任何錢。
餘額不會過期
儲值後餘額一直保留,也可以在 Dashboard 設定低餘額提醒與自動儲值。
每把金鑰都能設上限
為每把金鑰設定每月花費上限,超過就自動拒絕請求,避免一支失控腳本燒光餘額。
常見問題

還有什麼想問的?

找不到答案的話,文件裡有更完整的說明,或直接寫信給我們。

  • 是。我們實作的是 OpenAI Chat Completions 介面,請求與回應格式完全一致,包含 SSE 串流、function calling 與多模態輸入。把 base_url 指向 https://api.alphacurve.io/v1、換上 Inference 的金鑰即可,SDK、prompt、後處理邏輯都不用動。

開始使用

五分鐘接好,之後換模型都不用再改程式

註冊即可建立第一把金鑰,儲值前也能用測試額度跑通流程。不需要信用卡、不需要業務通話。

把這一行換掉就開始了

base_url = "https://api.alphacurve.io/v1"
  • 不需信用卡
  • OpenAI 相容
  • 隨時停用金鑰