在研究一件很朴素的问题:一份数据到底值多少,以及这个答案为什么会随任务、时间和分布漂移改变。
Latent Space 这次为了测 Astra,花了 200 多亿 tokens。
我原本点进去是想看 benchmark,结果真正让我停下来的是另一件事:Astra 已经开始接手 AI 工程师那些又碎、又长、还很容易跑着跑着就断掉的活。挑模型、做训练数据、盯日志、部署、调系统、管 subagents,连 benchmark、成本估算和人工评测都能自己组织。
他们甚至写了一句:
“fully capable AI Engineers in their own right.”
如果让它一直跑,按这批测试的经验值,每小时不到 6 美元。
但分数没有整齐地起飞。Coding Agent Index 是 67,差不多在 Opus 5 和 Fable 5 那一档;Intelligence Index 61,和 Sol 基本打平。银行、SciCode、长上下文推理还退了一点。单 token 更贵了,不过在 Coding Agent 任务里,相比 Sol 大约能省 70% tokens。
我看完最明显的感觉:Astra 更能把一件又长又乱的工程活接住。中间要看日志、改方案、调多个 agent,也不太容易把前面做过的事忘掉。
如果这部分真的能交出去,AI 工程师最后留在手里的会是什么?
我先押一个:发现“我们一开始就问错了”。
你们呢?