950个Agent,21小时,2.1亿token,20万个候选对象,最终交给人类的只有20个。大规模Agent工作流的价值不在Agent数量,在于你选的领域满不满足一个条件:机器粗筛便宜,人类验证也便宜。这篇文章把我筛领域的三个过滤器和已经在跑的四条线全部摊开。
950个Agent,21小时,20万条DNA
Anthropic今年成立生命科学研究组之后,公开了第一项成果。他们让950个Claude Agent进入庞大的DNA数据库,寻找此前没有被认识清楚的逆转录酶系统。逆转录酶干的事是把RNA信息复制回DNA。
21个小时里,这批Agent消耗了2.1亿token,收集超过20万个逆转录酶,筛出3500个候选系统,再收敛到20个重点分析对象。
转折发生在一次例行检查。一个Agent在检查某个候选对象附近的DNA时,注意到一串排列整齐的重复序列,停了下来。这种排列长得像CRISPR。噬菌体里的逆转录酶本身早被人研究过,只是没人注意它旁边连着一个功能未知的基因,加一长串间距均匀的DNA重复序列。Claude把三者当成一个完整系统看,Anthropic把它命名为ART,阵列相关逆转录酶。后续实验发现ART阵列同样会表达一组短RNA,类似的可编程机制也许存在于其中。
注意边界。Claude完成的是数据库搜索、候选筛选与分析,所有湿实验由人类科学家亲手完成。ART能不能切割、复制、粘贴DNA,目前没有答案。
3.7万名虚拟员工的药企
Claude发现ART的一周前,斯坦福大学医学院干了一票规模更大的。他们按真实药企的组织结构搭了一家虚拟生物科技公司:3.7万名AI员工,一个首席科学官管理不同部门,分别找药物靶点、分析临床数据、设计药物、规划试验。没有办公室,没有工资,没有午休。
研究人员把约5万项临床试验分给Agent,每个Agent只负责一项,系统汇总。不到一周,它们发现一组与药物成功率相关的特征:靶点集中存在于特定细胞中,且基因活动更像开关而非可缓慢调节的旋钮,这类药物从一期进入二期、最终上市的概率更高,副作用更少。
接着他们让Agent针对肺癌靶点B7-H3设计治疗方案。Agent提出制造抗体药物偶联物,找到带B7-H3的细胞,把化疗药物直接送到附近。几个月后,一家真实药企独立提出了相同的治疗思路,该药物随后获得FDA突破性疗法认定。
第三条线已经进了人体。英矽智能的Rentosertib用于特发性肺纤维化,AI参与发现了靶点TNIK,又生成并筛选了候选分子。今年9月的新研究重新分析了二期临床的血液样本:42名参与者,12周完整数据,六套蛋白质衰老时钟。六套时钟测到同方向的变化,接受治疗后患者的预测生物年龄下降了。研究者自己也承认,没法完全区分这种变化来自疾病改善还是药物真干预了衰老。
两个案例,一个模式
把三个案例放在一起,结构完全一致:
| 环节 | Anthropic ART | 斯坦福虚拟药企 |
|---|---|---|
| 粗筛 | 950 Agent扫20万逆转录酶 | 3.7万 Agent分5万临床试验 |
| 收敛 | 3500候选 → 20重点 | 全公司汇总出靶点特征 |
| 人类验证 | 湿实验做ART的RNA表达 | 真实药企独立走通B7-H3路线 |
| 耗时 | 21小时 | 不到一周 |
机器负责的是「可能性生产」,人类负责的是「可能性裁决」。原文那句话说得很准:提出假设正在变快,验证假设仍然必须等待细胞生长、动物实验、伦理审查和人体试验。AI一次产生几千个看似合理的答案,问题变成我们有没有足够的实验、时间和耐心去逐一确认哪些是真的。
这就是个人开发者选领域的全部依据。
选领域先过三个过滤器
我想建立一套千计Agent的工作流,让它持续寻找人类需要大量时间才能找到的东西。计算机本科加硕士的背景,能落地的领域要用三条标准筛。
**过滤器一:验证成本。**Agent产出1000个候选,每个候选确认一次要花多少钱、多少时间。数据库检索类验证近乎免费,复现一个漏洞要跑PoC,湿实验要养细胞。这条是第一过滤器,验证贵的领域直接降低优先级。
**过滤器二:搜索空间。**对象总量要大到人类穷尽不了。20万逆转录酶、5万临床试验,这个量级才轮得到Agent上场。搜索空间小的领域,人自己就够了。
**过滤器三:数据可得性。**全部对象能不能被程序批量获取。公开数据库、开源仓库、公开裁判文书,都能。要授权的、要爬要买的,成本先涨一截。
按这三条筛,计算机背景能碰的领域排出来是这样:
| 领域 | 搜索空间 | 验证成本 | 数据可得 | 优先级 |
|---|---|---|---|---|
| 开源代码漏洞挖掘 | 巨大 | 复现PoC,贵 | 全公开 | 高 |
| 开源情报整合 | 巨大 | 交叉验证,便宜 | 大部分公开 | 高 |
| 政策补贴匹配 | 大 | 电话/文件核实,中 | 公开但分散 | 中高 |
| 专利与文献盲区 | 巨大 | 检索验证,便宜 | 全公开 | 中 |
| 药物临床数据再分析 | 大 | 需生物知识补课 | 全公开 | 低 |
| 足球赛事事件挖掘 | 中 | 人工看回放,中 | 自采 | 长线 |
已经在跑的四条线
漏洞赏金:验证最贵的那条
这条线已经跑了几个月:多Agent流水线选候选开源库,grep危险sink,本地最小复现,再写报告提交。GitHub安全实验室和huntr的赏金是变现出口,Google OSS VRP是补充。
它的优势是全部数据公开,GitHub上一个仓库一行代码都不缺。瓶颈同样清晰:一个疑似漏洞要真正变成赏金,必须本地复现成功,这一步AI只能辅助,裁决权在提交者手里。Anthropic那20个重点对象交给人类实验室,和我这里PoC复现通过才能提交,是同一个动作。
扩到千计Agent的方向很明确:粗筛层可以无限平行,一条流水线同时盯几百个仓库的依赖变更和diff,把「新引入的危险调用」这个事件源做成常驻监控。收敛层控制在几十个,验证层保持人工。粗筛与收敛的比例,参考Anthropic的20万比20,是万分之一。
开源情报整合:验证最便宜的那条
我给企业做的背景调查和竞品监控走的是这条路。多Agent分头拉工商、司法、招投标、招聘、新闻数据,汇总成证据卡,每个事实带出处。裁判环节用多模型对抗验证加独立判官,一个事实要过两道独立检查才算数。
这条线的验证成本接近零,因为验证方式就是交叉验证:三个独立来源对上了,置信度就够。它对应斯坦福那个虚拟药企的形态,按部门分工的Agent组织,产出给人类做最终裁决。
短板在信息差变现:结论的价值取决于问题问得好不好,问「这家公司值不值得合作」比问「这家公司怎么样」值钱十倍。产品化要往具体决策场景靠,投资尽调、供应商准入、合作方风控。
政策匹配:高信息差的中间态
政府补贴、园区入驻、人才认定这类政策,营销文章写的「最高100万」「最长3年免费」要拆解成真实条件。我做过的一套核验流程,把承诺拆成资格条件、兑现路径、申请成本三块,逐条对官方原文。
全国政策库分散在各级政府网站,量级够大,数据公开。Agent的活是全量扫描加结构化,把「谁符合什么政策」做成匹配引擎。验证靠官方文件和电话,中等成本。
这条线的信息差足够大,值得做的原因恰恰是搜索空间里全是没人整理完的东西。它和个人开发者的匹配度高,冷启动成本低。
足球数据:最慢的复利
比赛视频转结构化事件JSON,只存事件不存视频,规避版权。定位5到10年长期打磨,锚点西班牙Position Play方法论,差异化是独家业余赛数据资产。
Agent在这里的用法和前面三条不同,不是搜索,是标注和挖掘。视频先转事件,事件库积累到一定规模,Agent才能开始回答「这类传控打法在业余赛事里的成功率」这种没人答得了的问题。
验证靠人看回放,成本中等。这条线的价值在复利,时间越久数据资产越厚,别人从零追要重新录像。B2C数据供应链的想象空间在这里,急不来。
还没切但值得盯着的两块
**专利与文献盲区。**用Anthropic找ART的方式扫全量专利和论文,找未被注意到的技术组合。验证方式是检索确认「这个组合是否真的没人做过」,几乎免费。这条线的门槛在于产出如何变现:发现本身不值钱,值钱的是发现加落地路径。适合等前面四条线里有流水线闲下来时开一条实验线。
**药物临床数据再分析。**ClinicalTrials.gov全量公开,斯坦福已经示范了玩法。计算机背景的人切进去要补生物领域知识,补课成本高。我的判断是这条线留给别的人,盯住方法论的进展比亲自下场划算。
排序
现金流从漏洞赏金来,它验证最贵但回报最直接,而且已经在产出。产品和公司形态从开源情报和政策匹配来,验证便宜,信息差大,能做成B2B服务。足球数据是十年尺度的资产仓,持续投,不指望它短期回报。
千计Agent不是目标,是手段。Anthropic那个案例里,20万条DNA最后只留20条给人类。比例对了,规模才有意义。
一个留在这的具体事实:那家3.7万员工的虚拟药企,整理5万项临床试验用了不到一周。而其中的B7-H3方案,从Agent提出到真实药企独立验证出同样的思路,隔了几个月。差距就在这里,机器的时间和人验证的时间,差着三个数量级。千军万马值多少钱,取决于把这三个月压缩到多短。
