这个模型编排器项目拿一池开源模型搭出 Fable 同分,成本只要三分之一
乌鸦小编 发表于:2026-7-28 01:13 复制链接 发表新帖
阅读数:103
这是 adam_rida 在三周前上 那个项目 Echo。它做的事情听起来简单:把一组开源权重模型(包括 GLM-5.2、Kimi K2.7 等)组成一个池子,由一个调度器决定每条请求用哪几个模型、各自分多少计算量、最后怎么合并输出。

这个项目最让人意外的地方不是技术,是它的成本数字。它在自建的评测集上跑下来,整体表现达到了 Fable 同级,但推理成本只有 Fable 的三分之一左右。也就是说,「单模型最强」这个假设被一个调度层打破之后,开源模型池子其实可以拼出接近顶级闭源系统的水平,代价只是把路由策略想清楚。

作者做的第一个思想实验很值得拆开看。他先把同一批模型扔到同一套评测里跑,记下每个 prompt 用哪些模型的输出能拿到最高分,然后反向去想:在没有「事后知道哪个决策正确」的前提下,能不能让一个调度器在请求发生的瞬间做出接近最优的分配。Echo 就是这个调度器的工程实现。

这条思路并不新,从统计学的 bagging 到随机森林都是这种「多模型合并打败单模型」的套路。但 Echo 把它做成了产品级的实时路由,每条请求的决策时间算在生成时间内,而且合并方式不是简单投票,是按 prompt 拆分子任务再拼回去。这意味着模型池的每个成员都不需要是「全能选手」,只要在某些子问题上有自己的特长,调度器就能把它用在刀刃上。

评论区的分歧点集中在两个。一个是「路由策略本身才是产品,作者不肯披露具体路由逻辑」,这被一部分人视为护城河,也被另一部分人视为不透明。另一个是 dark pattern——Echo 一开始在首页放了一个看似可以聊天的输入框,结果要登录才给回复,作者被骂了两天后撤掉,改成显式的 sign up 加 10 美金免费额度。

这背后其实是 AI 应用的一个典型张力:免费额度做拉新很常见,但藏在「假装能聊」后面的转化漏斗在 2026 年这个时点已经被开发者社区强烈反感。一个调度器产品的护城河如果只是路由权重,确实很难说服用户「凭什么我得先注册」,所以作者拿 10 美金试用额度换透明,某种意义上是在承认:现在的开源模型池同质化已经严重到「路由」不能算核心竞争力。

把视角拉远一点看,Echo 这种项目其实在暗示 2026 下半年模型层和应用层之间会出现一个新层——模型编排层。它的入口未必是 ChatGPT 这种 chatbox,可能直接是 OpenAI 兼容 API,背后是一个调度器根据你的请求动态选模型、调计算量、配上下文。Fable、GPT、Claude 之间的差距会继续缩小,而真正定胜负的是谁能用更便宜的方式拼出同等结果。

这条路走到底还有几个问题没解决。一是评测偏差:作者目前公开的 907 条评测覆盖七类任务,coding 和 agentic 这两块的衡量标准远比单轮 QA 难做,调度器的决策质量怎么量化还在摸索。二是模型更新:开源模型一周一迭代,调度器如果对每个新模型都做完整 benchmark 评估会非常贵,需要更轻量的「能力指纹」方法。三是商业模式:API 价格最终会和上游开源模型的推理成本挂钩,留给编排层的毛利空间可能比想象中薄。

Echo 给了行业一个有意思的信号:模型层单点突破的边际收益在下降,编排层开始有产品形态出现。对普通开发者来说,这意味着即使你调不到顶级闭源 API,也可以用一池开源模型加上一个开源路由器搭出相当能打的内部工具,关键是把评测和路由策略当作一等公民来做。

创业找资源,上乌鸦部落
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落