命题是:AI能力边界在哪里?端到端的匹配能力,被什么结构所制约?
我们先来看一个网站,https://isaiprofitable.com/
无一例外,全军覆没。在目前军备竞赛已经进入尾声,AI公司需要再花数年才能达到Break-even point。我们必须想起2000-2001年的血雨腥风。
过去一年的llm进入了狂飙,短短一年时间模型体量从数百B大跨步进入了T计量时代,MOE成为主流,也就是说FP16下,从1T及以内的单柜方案,到一排机柜的巨额投入。资产负债表已经达到了前所未有的压力时刻,逐渐恶化的债务危机,已经不是attention,moe,巨型模型,后训练所补得上的大洞,换句话讲,资本透支了十年,创造了今天的AI奇观。但是它的能力和创收速度完全无法支撑。
从技术原理出发,以Transformer模型的预测方法,我们永远没有办法跳出短期memory之外,AI真的可以用概率真正理解Humanity或者说你的non-verbal意图是什么吗?并且对于人类世界来说context一定要抽象成文本和向量来理解吗?目前的算力水平,甚至是未来的算力水平、当下看半导体工艺完全支撑不起来——成本再翻一倍,上升周期福利结束了,投入规模从脚踝砍掉,还能继续游戏吗?端到端的极限已然明朗,架构、资本游戏都已经没有多少时间和耐心留给基模了。那么游戏又要回到上个时代,分治法,面向场景和切分输入环节的端到端需求配——AI工具。我与我司算法关于基模能力的讨论就是围绕这几点展开的,经济账,半导体工艺迭代速度,目前ai训练架构导致的边际效用递减,人类表达能力的边界。AI做不到的,就是AI工具的土壤,但是要看到这个尽头,到底需要什么,我也正在寻找。