AMD高管谈AI基础设施设计思路

IT时代网9月19日消息,在 AI Infra Summit 上,AMD 数据中心解决方案事业部执行副总裁兼总经理提出,AI 基础设施的设计不该围绕某一颗芯片或某一种互连,而应回到一个基本问题:需求变化时,系统能否方便地适配。

在他看来,没人能说清五年后 AI 会是什么样子,也没人知道下一个主流模型架构、训练与推理的比例会在何处稳定下来,更不知道有多少 AI 会跑在自己的数据中心、别人的数据中心或笔记本上。但基础设施负责人现在就得做出未来五到七年 IT 基础的决策。

他提到,几年前 AI 基础设施主要意味着大集群上可预测的批式训练需求,如今训练仍需与推理、代理式 AI 以及日益分散的工作负载共存。推理常在线,关注延迟与单次请求成本;代理式 AI 会进一步放大需求,因为一次请求可能变成检索输入、调用工具、执行代码、协调子代理并保持跨请求状态的一串步骤。

这改变的不只是算力总量,还有系统的形态。为昨日训练集群优化的基础设施不只是容量不足,而是形态不对:其算力、内存与网络的配比已与真实工作负载的去向不匹配,而形态问题无法靠继续添置原有部件解决。他把设计目标归纳为三项可核查的属性:一是可适配,需要足够深的产品组合,让工作负载变化时的答案是换一种配置而不是换一家供应商;二是经济性,即把钱花在对的工具上,训练是一次性的资本决策,推理则是每天执行十亿次的运营决策,代理式请求更是一串推理,要看的是完成单个任务的成本而非单 Token 成本;三是开放,靠被广泛采纳的标准让客户摆脱对单一厂商路线的依赖。

他同时介绍,AMD 的投入覆盖从服务器 CPU 上的推理、分词与编排,到 PCIe 加速卡上的大模型推理与微调,再到八路 GPU 系统与面向超大规模部署的整机架方案,并由统一的 ROCm 软件把整条链路串起来,让工作负载更换硬件时不必从头开始。

编辑:林一舟

THE END