Loop engineering 的底层假设是:AI agent 跟自己说话,比跟我们说话更高效。
对新手来说这是成立的。如果你刚接触设计,AI 自我讨论产出的东西可能比你自己指导它更好。但这并不真的省时间,它只是让你在等 AI 干完活的时候可以去干别的。
但对更资深的使用者,这条路走不通。AI 之间的交流肯定比不过 AI 和专家的交流。人类专家带着模型还没学到的高价值知识;对这些用户,让 AI 在孤独的 loop 里空转是一种倒退。
等待才是根因
我们不喜欢跟 Agent 持续沟通的唯一原因是因为我们需要等待,而且不知道要等多久。就像你在餐厅点了菜,不知道是 5 分钟上还是 50 分钟上,你大概率会掏出手机做点别的打发时间。但要知道,这种"找点事做"本不必要:只要出餐够快,你根本不需要打发时间。
Agent 也是一样,如果我们有 10000 TPS 基本上可以做到一分钟输出 30 万到 60 万个中文字符。目前的 Claude 模型输出速度在 100 TPS 左右,每分钟输出 4,200–6,000 个中文字。当前市面上已经有 1000 TPS 的实现,所以我们可以期待在未来看到 10000 TPS 到来,这就是当前速度的 100 倍。
我们就不需要多线程——目前的多线程本质上是一种妥协,而不是自然而然的。因为我们必须等,所以我们要做别的事情来填满时间,但是未来如果我们可以用 100 倍的速度输出 tokens,那么一切就会不一样了,会彻底改变人类和 AI 模型以及 AI 代理的交互逻辑。
从几天到几秒
考虑目前 Agent 在正常复杂度的 Harness 中回答一个中等复杂度的问题通常可以消耗 10 分钟到 30 分钟不等的时间,个别情况下可以持续运行一个小时甚至几天。在减少到现有的 1% 后,10–30 分钟的问题会变成约 6–18 秒;1 小时会变成约 36 秒;持续几天的任务则会缩短到十几分钟到一两个小时量级。
在一个可以期待的未来,TPS 这个瓶颈一定会被打破,而且是在没那么远的未来。如果你的 Agent 可以在 18 秒内回复你,你还愿意让他自己去跑 ultracode workflow 探索吗?也许还是会,但是就算那样,你也愿意去等他跑完,而不是自己去做别的事情。因为注意力是优秀的工作的必需品,在我们的注意力过度专注之前,我们不应该考虑分散自己的注意力。
快反馈的新范式
这会引领一种新的范式,当我们有足够快的速度的时候,我们不需要让模型做所有的事情(loop / goal / yolo),我们可以保证他们极度可控,通过人类的快速反馈。
真正优秀的用户,应该是模型的指导者,教育者。在自己不了解的领域,一个普通用户需要通过 Harness 和 Skills 和其他方法将别人的专业视角来规训 AI 模型,但是对于优秀的用户,AI 不是他们的导师,而是他们的同事,或者说 rubberducking 的鸭子。
这让编程这样的任务回归传统的编程体验。程序员仍然有大量的掌控权,不会丧失对系统的失控感。一个事实是,就算你有一个万能的同事,你可以吩咐所有的事情给对方去做,你也需要知道一些细节,来向你自己的上级交差。
转折点:高速推理芯片
考虑到 AI 三巨头(谷歌、人类学、开放人工智能)的模型已经达到了特定的水平,可以在大量任务上被人类用户依赖。开源模型追赶上他们的水平只是时间问题。当然,我们可以想象一家开源模型公司例如深度求索有可能未来会把自己最强的模型停止开源。但是仍然,我认为在不久的将来(我认为是 2026 年之内),开源模型也可以开始触碰到目前顶级模型的水平。
所以,我觉得未来 AI 的一个转折点和增长是高速推理芯片。
一个可能的反驳是,就算我们可以忽略不计 AI 输出的时间,还是要等待程序运行的时间。