跳轉至

LiteLLM

概述

LiteLLM 是一個功能強大的開源代理伺服器(Proxy Server),旨在為各種 ai-agent 和應用程式提供統一的 API 介面。它能夠將來自不同供應商(如 openaimistral、Google Gemini 等)以及自託管模型(透過 llama.cpp 或 vLLM)的 API 請求標準化,允許開發者使用單一的 OpenAI 兼容 SDK 呼叫上百種模型。

主要功能與優勢

  • 統一介面:透過一致的 openai 格式,降低不同模型切換時的程式碼成本。
  • 路由與負載均衡:配合 litellm-router,可實現模型故障轉移(Fallback)與請求分發。
  • 模型配置化:支援透過 config.yaml 管理模型參數(如溫度、頂端 P 值)與採樣設置,而無需修改程式邏輯。
  • 靈活部屬:支援使用 docker 快速部署,並可結合 hashicorp-vault 或環境變數管理 API 金鑰。

實踐場景

模型管理與採樣優化

開發者經常使用 LiteLLM 來管理本地伺服器運行的模型(如 Qwen 3.5 系列)。透過在 config.yaml 中定義多個模型條目,即使指向同一個物理模型伺服器,也能為每個條目設定不同的採樣參數(例如「推理專用」與「代碼專用」),從而優化 ai-agent 的輸出行為。

整合 NVIDIA NIM 與雲端服務

LiteLLM 對 nvidia-free-nim-api-access 支援極佳,開發者可直接透過 nvidia_nim/ 前綴存取 NVIDIA 託管的高性能模型。同理,它也能無縫接入 cloudflare Workers AI,只需配置 CLOUDFLARE_API_KEY 與帳戶資訊,即可在統一介面下使用邊緣運算模型。

浸沉翻譯與角色扮演

在浸沉翻譯場景中,使用者可建立多個 Virtual Keys,為不同任務(如主聊天模型 vs. 快速翻譯模型)分配權限與速率限制(RPM/TPM)。這種方式能有效保護 API 配額,並提升 SillyTavern 等前端工具的穩定性。

進階部屬建議

  • 資料庫整合:在生產環境中,透過設定 STORE_MODEL_IN_DB=True 並掛載 PostgreSQL 資料庫,可啟用 UI 介面的模型動態管理功能。
  • 安全性:務必設定 LITELLM_MASTER_KEY 作為全局管理金鑰,並利用環境變數注入敏感資訊,避免在設定檔中硬編碼 API 金鑰。
  • 部署架構:建議使用 Docker Compose 管理服務,確保包含健康檢查與網路隔離(如 cf_network),以達到最佳的穩定性與擴展性。

更多教學細節可參閱 n8n n8n-git-節點教學14-種操作完整設定指南 或進階開發者論壇討論。

Sources

See Also