AdventureX 2026年 Minecraft赛道冠军
最近把大部分时间都投入到了一个我非常感兴趣的方向:AI Infrastructure(AI 基础设施)。
一开始我以为,AI 时代最大的瓶颈是 GPU 不够。
但越深入研究越发现,很多企业真正的问题不是没有 GPU,而是不会管理 GPU、不会管理算力。
GPU 买回来了,却不知道:
- 谁在使用?
- 为什么利用率这么低?
- 为什么有人排队,而另一边还有机器闲置?
- 为什么模型升级一次,整个推理服务就开始不稳定?
- 每一次推理到底花了多少钱?
这些问题,本质上都不是模型问题,而是基础设施问题。
最近我一直在研究 Kubernetes、GPU 调度、模型部署、推理引擎、AI Gateway、AI 运维(AIOps)等方向,也在思考一个问题:
AI 时代,会不会需要一个全新的 Compute OS(算力操作系统)?
它管理的不再只是服务器,而是整个 AI 生命周期:
GPU → 模型 → 推理 → Agent → 成本 → 调度 → 治理。
我的目标不是做一个 GPU 监控面板,而是探索一种更智能的 AI 基础设施管理方式。
理想状态下,开发者不需要关心 GPU 在哪里,也不需要手动选择部署环境,只需要告诉系统:
«我想完成什么任务、预算是多少、希望多久完成。»
剩下的事情,由平台自动完成:
- 自动选择模型;
- 自动调度 GPU;
- 自动控制成本;
- 自动扩缩容;
- 自动发现并处理异常。
这也是我最近正在投入时间做的方向。
我相信,未来企业竞争的不只是模型能力,还有算力管理能力。
如果你也在做 AI Infra、Kubernetes、GPU 调度、推理平台、vLLM、Ray、KubeRay、Agent 平台,欢迎交流。
我会持续分享这个方向的思考,以及我正在构建的产品和踩过的坑。