簡介
Inference 是一個 OpenAI 相容的 LLM API gateway,用一把金鑰存取 OpenAI、Anthropic 與 Google Gemini 模型。
簡介
Inference 是一個 OpenAI 相容的 LLM API gateway(中轉站)。你只需要一把 API 金鑰、一個 base URL,就能存取來自多家供應商的模型:OpenAI 相容供應商、Anthropic、Google Gemini。
如果你寫過 OpenAI API,你已經會用 Inference 了——把 base_url 換成我們的網域、把金鑰換成 sk-inf-...,其餘程式碼一行都不用改。
為什麼要用 Inference
| 好處 | 說明 |
|---|---|
| 單一整合 | 一套 OpenAI 相容的請求/回應格式,涵蓋所有上游供應商。 |
| 單一帳單 | 預付儲值餘額(credits),依 token 用量扣款,不必分別開設多家供應商帳號。 |
| 成本可控 | 每把金鑰可獨立設定每月花費上限與可用模型白名單。 |
| 可觀測性 | Dashboard 可查詢每次請求的模型、token 用量與成本。 |
| 標準能力 | 支援串流(SSE)、tools / function calling、vision(圖片輸入)。 |
服務端點
Base URL 一律為:
https://api.alphacurve.io/v1
| 方法 | 路徑 | 用途 |
|---|---|---|
POST | /v1/chat/completions | 對話補全,支援串流、tools、vision。 |
GET | /v1/models | 列出你的金鑰目前可用的模型。 |
WSS | /ws/…BidiGenerateContent | Gemini Live 即時語音,雙向 WebSocket。見下方。 |
即時語音(Gemini Live)
Live 模型不是 OpenAI 相容格式,也不能用 /v1/chat/completions 呼叫——它是有狀態的雙向 WebSocket 對話,協定與 Google 的 Live API 完全相同:
wss://api.alphacurve.io/ws/google.ai.generativelanguage.v1beta.GenerativeService.BidiGenerateContent?key=sk-inf-...
既有的 Google Live 客戶端程式碼只要改 host 和金鑰兩個地方,其餘不動。金鑰放在 query string 是協定原生的做法(瀏覽器的 WebSocket 握手無法帶 header);非瀏覽器的客戶端建議改用 Authorization: Bearer,避免密鑰進入 URL 與各層日誌。
音訊輸出是 24kHz 16-bit 單聲道 PCM,位於 serverContent.modelTurn.parts[].inlineData.data(base64),要自行加上 WAV 標頭才能播放。
這條路徑不支援遮蔽功能。
X-Inference-Redact與模型的遮蔽設定對即時語音無效——語音串流裡沒有可掃描替換的文字,內容會原樣送達上游。如果你是因為遮蔽功能而選擇本平台,請勿在此路徑傳送敏感內容。
30 秒體驗
curl https://api.alphacurve.io/v1/chat/completions \
-H "Authorization: Bearer $INFERENCE_API_KEY" \
-H "Content-Type: application/json" \
-d '{
"model": "openai/gpt-4o-mini",
"messages": [
{ "role": "user", "content": "用一句話說明什麼是 API gateway。" }
]
}'
接下來
- 快速開始:三個步驟送出第一個請求。
- 認證:金鑰格式、管理與安全建議。
- Chat Completions:完整的參數與回應格式參考。
- 遷移指南:從 OpenAI 或 Anthropic 轉換過來。