一个端点接 290 家 AI 服务商--我拆解了周增 7700 Star 的 OmniRoute

简介: OmniRoute 是一款 MIT 协议的本地 AI 网关(TS 编写),聚合 290+ 服务商、500+ 模型,提供 OpenAI 兼容接口。支持智能 Combo 路由、12 因子 auto 选模、三层弹性容错与 RTK 等 12 种 Token 压缩引擎,显著提升免费额度利用率与稳定性。(239 字)

最近在折腾 AI 编程工具链的时候,我遇到一个很烦的问题:Claude Code 用 Anthropic 的 key,Cursor 用 OpenAI 的 key,Aider 又接的 DeepSeek,每个工具一套配置,免费额度散落在各家手里根本用不顺。

然后我在 GitHub Trending 上看到 OmniRoute--MIT 协议,TypeScript 写的,号称一个端点对接 290+ 服务商、500+ 模型,还自带负载均衡和故障回退。周增 7700 Star,38k+ 总星。

花了一天半把文档和源码结构翻了一遍,这东西确实解决了我遇到的问题,但设计思路比我预期的要深。聊聊我的发现。


一、它到底干了什么事

一句话:把分散的 AI 服务商聚合成一个 OpenAI 兼容的本地端点。

你的编码工具(Claude Code、Cursor、Codex CLI 等)不再需要分别配置不同服务商的 API Key,全部指向 http://localhost:20128/v1 就行。

image.png

其中 90+ 家提供免费层级,40+ 家永久免费。文档里说聚合后大约有 15.3 亿免费 Token/月,仪表盘上实时显示剩余额度。


二、核心设计:Combo 路由系统

这是我最想聊的部分。OmniRoute 不只是个"转发代理",它有一套叫 Combo 的模型链路由机制。

什么是 Combo

Combo 就是一条预配置的模型链。比如你配 Claude -> GPT-4o -> Gemini -> DeepSeek,当 Claude 配额用尽,自动切 GPT-4o;GPT-4o 挂了,切 Gemini--应用层完全无感知

零配置的 auto 模式

如果你懒得配 Combo,直接把 model 设成 auto,OmniRoute 会从你连接的所有服务商里实时构建虚拟链。它有几种预设:

Model ID 干什么
auto 平衡模式,粘滞上次成功的服务商
auto/coding 代码生成质量优先
auto/fast 最低延迟优先
auto/cheap 每 Token 最便宜优先
auto/offline 优先选剩余配额最多的
auto/smart 质量优先 + 10% 探索更好的模型

auto/smart 那个 10% 探索挺有意思--大部分请求走已知最好的模型,但留 10% 去试别的,万一发现更好的就自动切换。

12 因子评分

auto 模式的背后是一个 12 因子评分引擎。我根据文档和路由策略列表推断,这 12 个因子大致覆盖:健康度、剩余配额、成本、延迟、历史成功率、配额重置时间、上下文匹配度、新鲜度等维度。每个候选模型实时打分,选分最高的路由。

19 种路由策略

除了 auto,还有 18 种可以手动组合的策略。我挑几个实用的说:

image.png

实际用的时候,我最常用的是 fill-first(先把免费额度吃干净再切付费的)和 priority(配 fallback 链保高可用)。


三、三层弹性机制:请求不会断

这个设计我觉得是整个架构里最扎实的部分。OmniRoute 有三层独立的弹性保障:

image.png

第一层处理单次请求的临时故障(网络抖动、瞬时 429),第二层处理模型级别的持续故障(配额耗尽、服务商宕机),第三层处理多账号场景下的配额分配。

配额层的 Quota-Share 支持三种策略:

  • hard:超配额直接拒绝,严格但不灵活
  • soft:超了降优先级但不拒绝,平滑过渡
  • burst:允许借用空闲份额,最大化吞吐

我一般用 soft,既不会突然断流,也不会把某个 Key 榨干。


四、Token 压缩:省钱的关键武器

这是 OmniRoute 和其他网关拉开差距的地方。它在请求到达上游模型之前,先过一遍压缩流水线。

12 引擎流水线

不是简单截断,而是 12 个引擎按顺序处理:

实际效果

模式 节省 适用场景
Lite ~15% 永远开启的安全默认
Standard (Caveman) ~30% 日常编码
Aggressive ~50% 长工具密集会话
Ultra ~75% 最大节省
RTK 60-90% Shell/测试/构建输出
RTK + Caveman 叠加 78-95% 混合提示+工具日志

RTK 那个对命令输出的压缩效果最让我印象深刻。你跑个 npm install 出来几百行日志,RTK 能压到原来的 10-40%,而且关键信息不丢。这对用 AI 编程工具的人来说太实用了--工具调用的输出经常占掉大半上下文。

有个 inflation guard 机制防止过度压缩导致语义损失,这个设计很务实。


五、实际接入:三步搞定

第一步:安装启动

npm install -g omniroute
omniroute

默认监听 20128 端口,浏览器打开就是仪表盘。

第二步:连免费服务商

仪表盘 -> Providers 页面,点连接。我连了几个永久免费的:

服务商 模型 特点
Z.AI GLM GLM-4.7 / 4.5-Flash 永久免费
SiliconFlow DeepSeek V3.2 / R1 免费层级
Cloudflare AI 50+ 模型 10K neurons/day
Cerebras GLM 4.7, GPT-OSS 1M tokens/day
Pollinations GPT, Llama, Claude 无需密钥

连完之后仪表盘上会显示聚合后的免费 Token 总量。

第三步:指向编码工具

# Claude Code
export ANTHROPIC_BASE_URL=http://localhost:20128/v1
export ANTHROPIC_API_KEY=你的OmniRoute密钥

# 或者一键配置
omniroute setup-claude
omniroute setup-cursor
omniroute setup-codex

所有工具指向同一个地址,model 填 auto 就行。

验证一下:

curl http://localhost:20128/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"auto","messages":[{"role":"user","content":"Hello!"}]}'

响应头里有 X-OmniRoute-Decision,能看到这次请求实际路由到了哪个服务商、延迟多少、成本多少。这个透明度我非常喜欢。


六、协议支持:不只是 REST

除了 OpenAI 兼容的 REST API,OmniRoute 还支持:

  • MCP(stdio / HTTP / SSE)--104 个工具,31 个作用域,可以直接接 Claude Desktop、Cursor
  • A2A(JSON-RPC 2.0 + SSE)--Agent 间通信,6 个技能
  • WebSocket bridge/v1/ws)--实时流式

接 Claude Code 的 MCP 非常简单:

claude mcp add-server omniroute --type http --url http://localhost:20128/api/mcp/stream

七、我的判断

值得用的三个理由:

  1. 免费额度聚合确实解决了实际问题。以前 Gemini 的免费额度用不完,DeepSeek 的额度也用不完,但分散在各家 SDK 里很难统一调度。OmniRoute 把它们拢到一个池子里,fill-first 策略自动轮转,利用率高很多。

  2. Token 压缩是实打实的成本节省。RTK 对工具输出的压缩效果太明显了,长会话场景下省的不只是钱,更是上下文窗口。

  3. 三层弹性让编码工作流不会因为某个服务商抽风就断了。这对依赖 AI 编程的开发者来说是刚需。

但也要说几个问题:

  • 项目标注 prototype 成熟度,版本迭代很快(v3.8.49),API 可能有变动
  • 压缩的 aggressive 模式对代码生成质量有明显影响,建议编码场景用 conservative
  • Fusion 策略(多模型并发+判官合成)成本会翻几倍,慎用
  • 需要常驻一个本地服务,对环境有一定要求
  • 290 家服务商里有不少是"薅羊毛"性质的免费资源,稳定性参差不齐

结语

OmniRoute 的核心洞察是:AI 服务商太多太碎,开发者不该为每个工具单独管理一套配置。 它用一个本地网关 + 智能路由 + 压缩省钱的组合拳把这件事做透了。

如果你同时在用多个 AI 编程工具、对成本敏感、又不想被单一服务商锁定,值得试试。

目录
相关文章
|
23小时前
|
人工智能 Rust JavaScript
单会话 27.8 MB,比 Claude Code 省 13 倍内存——我试了 Rust 写的 jcode
jcode是Rust编写的轻量级AI编程Agent框架,单会话仅占27.8MB内存(比Claude Code省13倍),冷启动仅14ms。支持多会话并行、Swarm协作与可选本地embedding,专为内存受限设备(如8GB MacBook Air)优化,兼顾性能与灵活性。(239字)
35 3
|
1天前
|
数据可视化 PyTorch 算法框架/工具
ComfyUI电脑版EXE文件下载、安装、配置、使用全流程图解,点击可直接运行
ComfyUI是Stable Diffusion最流行的可视化工作流工具,以节点连线方式精准控制文生图、图生图、ControlNet等全流程。官方推出免命令行的Comfy Desktop桌面版,内置环境,一键安装启动,新手也能快速上手。(239字)
|
23小时前
|
弹性计算 人工智能 负载均衡
阿里云CDT云数据传输深度解析:免费额度 + 阶梯计价双重优势
阿里云CDT是普惠型网络带宽统一计费平台,聚合20+款云产品公网及跨地域流量,提供220GB月度免费额度、阶梯降价、弹性按量、全局成本治理四大能力,无需改造架构即可显著降本增效。阿里云 CDT 云数据传输官网:https://t.aliyun.com/U/k96L00
|
1天前
|
人工智能 缓存 数据可视化
阿里云百炼平台详解:官网入口、免费AI大模型领取及常见问题解答
阿里云百炼(Model Studio)是阿里云推出的一站式大模型服务平台,集成通义千问全系列及DeepSeek、Kimi等上百款主流第三方大模型,提供兼容OpenAI的API接口、可视化应用构建、模型微调与部署等全链路能力,是个人开发者与企业快速接入AI能力的首选平台。本文将从官网入口、免费AI大模型领取流程、核心功能使用,到高频常见问题解答,全方位详解阿里云百炼平台,帮助你快速上手,高效使用免费额度,避免踩坑。
50 1
|
23小时前
|
SQL 人工智能 文字识别
阿里把内部用了两年的 AI 代码审查工具开源了——我跑了一遍 Open Code Review
阿里开源的 Open Code Review 是一款工程化 AI 代码审查工具,采用“确定性模块 + LLM Agent”混合架构,精准定位问题、严控误报率,支持 Git 差异审查与全量扫描,已落地服务数万开发者。周增星 4750,Apache-2.0 协议,轻量易集成。(239 字)
32 2
|
23小时前
|
人工智能 程序员 Python
让 Claude Code 少说废话、直接给答案——我试了这个 5200 Star 的技能包
i-have-adhd 是一款开源AI编程助手“输出风格技能包”,专治AI回答啰嗦、废话多、行动指引模糊的痛点。它强制AI首句给动作、步骤编号、禁用客套话,让调试/编码指令清晰可执行。MIT协议,支持Claude Code、Cursor等主流工具,安装即用。(239字)
32 2
|
1天前
|
人工智能 Rust 开发工具
当 AI Agent 不再是 Bot,而是你的"同事"——我花两天拆解了 Block 开源的 Buzz
Buzz是Block开源的Rust协作平台,基于Nostr协议,首创“Agent即成员”范式:人类与AI Agent共用统一签名事件流,各自持独立密钥对,授权可验证、审计可追溯。架构极简——一张事件表承载聊天、代码、CI等全部操作,Git存储采用对象存储+CAS指针,支持高并发Agent协同。
23 1
|
23小时前
|
人工智能 JavaScript Linux
让 Claude Code 用我已经登录的浏览器——ego-lite 这个设计太实用了
ego-lite是Citro Labs推出的AI浏览器,让Agent直接复用你的日常登录态,无需重复登录或绕过2FA。通过隔离Space实现任务隔离与状态共享,Snapshot技术将页面token降低99%,支持macOS,已获周增4700 Star。
31 1
|
2月前
|
人工智能 数据可视化 定位技术
CodeGraph vs Understand-Anything:一个给 Agent 查代码地图,一个把项目变成可追问图谱
CodeGraph 与 Understand-Anything 同解“代码迷路”之困:前者是面向编程 Agent 的本地索引工具,专注快速查询调用链、影响范围与上下文;后者是面向人与团队的交互式项目图谱,提供可视化架构、业务域导览与系统理解。二者互补而非替代——一重执行精度,一重认知全局。(239字)
495 1
CodeGraph vs Understand-Anything:一个给 Agent 查代码地图,一个把项目变成可追问图谱
|
2月前
|
人工智能 安全 前端开发
ECC 讲透:Claude Code 的全能增强包,不只是 Agents 和 Skills
Everything Claude Code(ECC)是2026年爆火的AI编程增强框架,非简单提示词合集,而是集Agents、Skills、Rules、Hooks、MCP与AgentShield安全扫描于一体的“AI编程操作系统”,深度优化Claude Code等Agent Harness,已获近19万Star。(239字)
384 2
ECC 讲透:Claude Code 的全能增强包,不只是 Agents 和 Skills