一家 YC 新公司专门教 LLM 炒股,但 AI 学到一半就"撂挑子"了
乌鸦小编 发表于:2026-8-5 09:24 复制链接 发表新帖
阅读数:314
Hacker News 2026 年 8 月 4 日出现了一个叫 EdotEnv 的项目,YC S26 批次(edotenv.com)。EdotEnv 创始人是 Rui
和 Michael,他们做的事情是:把量化交易(Quant Trading)工作流包装成 RL 训练环境,用来训练和评测
LLM。

为什么选 Quant Trading 作为 AI 训练场?他们的逻辑很有意思——目前很多 LLM benchmark 已经"饱和",
模型在上面刷分刷到 benchmark 失去区分度。一个有用的 benchmark 应该随着模型能力提升而自动变难。
Rui 和 Michael 在 Quant 行业工作过,观察到市场就具备这个属性:当有人从低效交易机会里获利,市场
效率提升,旧策略失效,新策略更难找——这种"持续进化"的特性正好可以作为 AI 训练的动态难度环境。

具体的产品形态是这样的——给 LLM 一套完整的 Quant Trading workflow,让它在 out-of-sample 数据上
完成:构建预测 features/models,设计组合,回测策略,根据市场 regime 持续调整。每一个步骤都是
一个独立的 task,配有自建工具。比如"predictive feature building"这个 task,会给 agent 一段时间
区间 [0,T] 的市场数据,让它自己研究 idea,然后用一个 backtesting tool 在 [0, t] 时间段测试它创建
的 features,再用 execution tool 在 [t+1, T] 时间段用新 features 交易,最后做整体评估。这种 reward
设计能隔离出 agent 在 feature building 上的真实能力,同时让它享受市场本身的属性带来的训练价值。

EdotEnv 在自己环境里跑了一圈 SOTA 模型之后,公布了一个很值得 AI 训练圈关注的发现。第一是 SOTA 模
型"seem to struggle with iterating deeply on research ideas, preferring broad shallow searches"——
它们在做 research 时偏好"广而浅"的搜索,而不是深度迭代一个 idea。这意味着当前 LLM 在 ML research
类任务上倾向于表面覆盖,而不是真正的深入研究。第二是"higher reasoning does not seem to increase
performance"——推理能力更强的模型在这个环境里并没有显著优势。这两点观察对当前很多"推理能力是
通向 AGI 的关键路径"的判断提出了一个有意思的反例。第三是"agents do not understand trading, e.g.
when losing money they stop trading instead of trading smarter"——当交易亏损时,agent 选择直接
停止交易,而不是学习怎么"交易得更聪明"。这种行为模式说明当前 LLM 在连续决策任务里还缺乏"从失
败中调整策略"的能力。

创始人对产品定位有清晰认知——Quant workflow 本质上是"applied ML research, long-horizon planning
and continual learning"的综合训练场。他们想教给 LLM 的不是某个特定 task 的答案,而是 transferable
的研究能力——这种产品定位和之前大多数 RL 环境公司"教 LLM 打游戏"的定位有明显差异,更接近
真实研究流程。

商业模式上,EdotEnv 计划把"持续改进的 RL 环境"卖给 AI labs、研究者、企业用户——这些用户自己训练
agent,关心 ML modeling capabilities、continual learning、long horizon planning、Quant Research 这
几个方向。他们已经开源了一个 sample task repository(github.com/MMcollab-dotcom/feature-engineering),
邀请大家试用并反馈。

对 AI 训练基础设施领域的从业者来说,EdotEnv 这家公司有三层值得关注的判断。第一是 Quant Trading
作为"持续进化"benchmark 这个定位本身具有结构性优势——传统 benchmark 饱和的问题在 Quant 场景里
自然不存在。第二是 Rui 和 Michael 在自家环境里发现的"SOTA 模型推理能力强但深度迭代能力弱"的观察,
对当前 AI 训练方法论有直接的反例价值——这种"在小众 benchmark 上发现主流假设的问题"的反向验证,这种反向验证能给整个行业带来少见的真实信号。第三是"agent 亏损就停止交易"这种行为模式如果
在大模型训练里是普遍现象,那么连续决策类应用的部署风险会显著高于当前的预期——这是任何想做 AI
agent 应用的从业者都需要正视的现实约束。



EdotEnv 已经在 Hacker News 上线了对应的 launch 介绍,欢迎对 Quant Trading 与 LLM 训练交叉领域感兴趣的从业者直接试用他们的开源 sample task repository,也可以到 HN 上对应的 launch 帖子下面反馈。



EdotEnv 的两位创始人在 Quant 行业有过真实工作经历,他们做这件事的初衷是把行业内多年的实战经验结构化成 LLM 可以学习的训练环境。这种行业经验与 AI 训练的结合是过去几年 AI 创业里被验证过最有差异化潜力的路径之一。

(来源:Hacker News 2026 年 8 月稿件《Launch HN: EdotEnv (YC S26) – Quant Trading RL Envs to
Teach LLMs Research》)
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落