LiteLLM

一个 OpenAI 兼容端点直连 100+ 模型,自带成本追踪、失败回退与限流。

开源免费 可自部署 MIT 2026-09-18 收录
一句话判断

同时用两三家模型供应商、又不想被某一家锁死的人。一个 endpoint 管所有模型,还能看每一分钱花在哪、某家挂了自动切到下一家。

LiteLLM 把 100+ 家模型供应商(OpenAI、Anthropic、Google、Azure、Ollama、DeepSeek……)统一成一套 OpenAI 兼容的调用格式。你的代码只写一次 litellm.completion(model="openai/gpt-5", ...),把前缀换成 anthropic/、ollama/ 就能切换供应商,响应格式不变,异常也映射成 OpenAI 的那套。

它有两个形态。轻量的是 Python SDK,直接 import 进项目,用来做多模型路由、重试和成本统计。重一点的是 Proxy Server——一个独立的网关服务,跑在 :4000,提供统一鉴权(虚拟 key)、按项目/用户的成本追踪、限流、负载均衡,还有个管理后台看花了多少。对一人公司来说,Proxy 形态的价值在于:你把所有 API key 收拢到服务端,代码和客户端只持有一个虚拟 key,换供应商、加预算、查账单都在一处。

失败回退是它最实用的能力之一。你可以配置「主用 Anthropic,超时或限流就切到 OpenAI」,或按成本/延迟做负载均衡。对一个要靠模型吃饭、但经不起某家 API 半夜挂掉的小团队,这种韧性比模型本身的能力更值钱。

代价是它是一层基础设施。你要管配置、管密钥、管那个常驻的代理进程,升级偶尔有破坏性改动。它也不是银弹——供应商原生的独有能力(某些 tool use、reasoning 字段)在统一格式下会被削平,需要特殊能力时还是得走原生 SDK。

能拿它做什么

  • 多供应商:OpenAI 写稿、Anthropic 审稿、本地 Ollama 跑量,一个 endpoint 全搞定
  • 成本控制:按项目/用户统计每个模型的花费,设预算上限,月底不再被账单吓一跳
  • 韧性:某家 API 挂了自动回退到另一家,线上代理不死
  • 统一接入:把旧代码里的 openai 调用换成 litellm,供应商随时可换

怎么用起来

  1. 最快试用:pip install 'litellm'(或 uv add litellm),然后 from litellm import completion 直接调
  2. 起网关:litellm --model huggingface/bigcode/starcoder,代理跑在 http://0.0.0.0:4000
  3. Docker 常驻:docker run -d -p 4000:4000 ghcr.io/berriai/litellm:main-latest
  4. 代码里接:openai.OpenAI(base_url='http://0.0.0.0:4000', api_key='虚拟key').chat.completions.create(...)

官网在 litellm.ai ,源码在 GitHub 仓库 ↗

坑在哪

注意

它是网关,就意味着你要运维一个常驻进程并保管好所有密钥——密钥集中了,一旦代理被攻破影响面也集中,务必加好鉴权和网络隔离。统一格式会削平各家的独有能力,需要原生特性的场景得走原 SDK。成本追踪默认要配数据库(Postgres),不配就只有内存态、重启即丢。版本迭代快,升级前先看 changelog,配置结构偶尔变动。另外「100+ 模型」里不少小供应商的稳定性和配额要自己验证,别默认都能上生产。

用一家怕被锁、用多家怕乱,LiteLLM 就是那个把乱理顺的网关。

官方地址
litellm.ai
前往官网 ↗