跳至主要內容

簡介

Inference 是一個 OpenAI 相容的 LLM API gateway,用一把金鑰存取 OpenAI、Anthropic 與 Google Gemini 模型。

簡介

Inference 是一個 OpenAI 相容的 LLM API gateway(中轉站)。你只需要一把 API 金鑰、一個 base URL,就能存取來自多家供應商的模型:OpenAI 相容供應商、Anthropic、Google Gemini。

如果你寫過 OpenAI API,你已經會用 Inference 了——把 base_url 換成我們的網域、把金鑰換成 sk-inf-...,其餘程式碼一行都不用改。

為什麼要用 Inference

好處說明
單一整合一套 OpenAI 相容的請求/回應格式,涵蓋所有上游供應商。
單一帳單預付儲值餘額(credits),依 token 用量扣款,不必分別開設多家供應商帳號。
成本可控每把金鑰可獨立設定每月花費上限與可用模型白名單。
可觀測性Dashboard 可查詢每次請求的模型、token 用量與成本。
標準能力支援串流(SSE)、tools / function calling、vision(圖片輸入)。

服務端點

Base URL 一律為:

https://api.alphacurve.io/v1
方法路徑用途
POST/v1/chat/completions對話補全,支援串流、tools、vision。
GET/v1/models列出你的金鑰目前可用的模型。
WSS/ws/…BidiGenerateContentGemini Live 即時語音,雙向 WebSocket。見下方。

即時語音(Gemini Live)

Live 模型不是 OpenAI 相容格式,也不能用 /v1/chat/completions 呼叫——它是有狀態的雙向 WebSocket 對話,協定與 Google 的 Live API 完全相同:

wss://api.alphacurve.io/ws/google.ai.generativelanguage.v1beta.GenerativeService.BidiGenerateContent?key=sk-inf-...

既有的 Google Live 客戶端程式碼只要改 host 和金鑰兩個地方,其餘不動。金鑰放在 query string 是協定原生的做法(瀏覽器的 WebSocket 握手無法帶 header);非瀏覽器的客戶端建議改用 Authorization: Bearer,避免密鑰進入 URL 與各層日誌。

音訊輸出是 24kHz 16-bit 單聲道 PCM,位於 serverContent.modelTurn.parts[].inlineData.data(base64),要自行加上 WAV 標頭才能播放。

這條路徑不支援遮蔽功能。 X-Inference-Redact 與模型的遮蔽設定對即時語音無效——語音串流裡沒有可掃描替換的文字,內容會原樣送達上游。如果你是因為遮蔽功能而選擇本平台,請勿在此路徑傳送敏感內容。

30 秒體驗

curl https://api.alphacurve.io/v1/chat/completions \
  -H "Authorization: Bearer $INFERENCE_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{
    "model": "openai/gpt-4o-mini",
    "messages": [
      { "role": "user", "content": "用一句話說明什麼是 API gateway。" }
    ]
  }'

接下來