本报讯 随着AI Agent的快速发展,人工智能基础设施正经历从“承载模型”到“协同进化”的深刻变革。阿里云及多家企业技术负责人指出,Agent正在重写数据、计算与平台的使用方式,形成从数据到智能的闭环飞轮。
Agent重塑AI开发节奏,催生新型云负载
过去,工程师提交数据处理任务后需等待数十分钟才能获得反馈,形成“等待—反馈”的固定节奏。而AI Agent则打破这一空隙:它在获取一次结果后立即验证,并并发尝试多种方案,快速迭代、持续运行。这种行为模式使平台负载性质发生根本变化——不再是单次调用、静态响应,而是动态、高频、多路径的任务流。阿里云智能集团首席技术官李飞飞指出,Agent作为“数字员工”,会主动寻找数据、拆解任务、并发试错并持续执行,对计算资源与管控系统带来十倍乃至百倍的压力。
数据瓶颈凸显,全模态处理链路升级
当大模型走向物理世界,数据形态从文本扩展至视频、点云、传感信号等多模态形式。具身智能公司面临的核心挑战不再是数据量不足,而是高质量训练集的生产效率。穹彻智能首席科学家吕峻表示,一次数据版本迭代常需数周,中间涉及数十道清洗、标注与质检流程。为应对这一瓶颈,阿里云升级MaxCompute与EMR:前者将CPU、GPU与大模型Token纳入统一调度,支持SQL AI Function直接处理图像与文本;后者通过Serverless Spark集成Ray、Daft等引擎,对接Paimon、Iceberg湖表格式,使具身智能数据处理耗时减少40%,PB级原始数据可直产LeRobot、RLDS训练集。
Agent改变平台使用方式,安全与治理成关键
企业数据分散于湖仓、数仓与实时系统中,字段背后隐含复杂业务规则。传统工具依赖人工理解上下文,而Agent则需通过语义层、权限体系与上下文信息自主决策。一旦缺失有效治理,其自动化能力反而放大风险。阿里云提出“Agentic Lake”理念,通过OpenLake开放湖仓承载统一数据,DataWorks提供跨引擎语义层与任务编排,使Agent能围绕业务目标组织数据流程。新发布的AI原生大数据服务ADA采用多智能体协同,用户以自然语言提问,系统自动调度离线计算、实时分析与AI训推引擎完成任务。阿里云魏博文强调,高风险操作必须在可控制、可回滚、可审计的“数据沙箱”中执行,未来权限管理需细化至Agent的任务级调用边界。
推理基础设施适配Agent持续工作模式
Agent可能围绕单一任务连续运行数小时,调用多个模型与工具,请求量随阶段剧烈波动。这要求推理平台关注冷启动、缓存策略、弹性扩缩容与整体成本,而非仅单次Token生成速度。PAI-InferX通过智能路由、Cache感知调度与KV Cache存储优化持续推理负载;PAI-RLS提供托管式强化学习服务,利用真实任务轨迹训练专属模型。在央视体育AI解说等实时场景中,Flink Streaming Agent实现视频、音频与事件流的同步理解与动态编排,具备长中短期记忆能力,缩短“感知—行动”距离。
系统自进化:运行反馈成为优化新燃料
面对Agent引发的复杂、高频任务流,人工调优已难以为继。阿里云推动基础设施走向自我进化:PAI-CrystalLLM利用不到1% GPU资源模拟万卡训练环境,提前暴露通信与配置问题,带来2%-10% MFU提升;Hologres自进化查询优化器分析真实Workload,四个月内自主完成28项优化,湖上查询性能提升38%。穹彻智能基于阿里云Data+AI Pipeline,实现数据处理吞吐超十倍提升、模型训练效率提高50%。然而,无尽前延CTO张林峰提醒,在涉及生物实验或物理设备的场景中,Agent仍难独立闭环,行业软件与硬件自动化水平仍是智能落地的关键制约。
从数据产生智能,到智能驱动应用,再到应用反哺系统优化,阿里云正构建一条高速运转的反馈飞轮。Agent时代的基础设施竞争,已从“承载多少模型”转向“能否让数据、模型与系统协同更快进化”。
