AMD 在 IFA 亮出个人 AI 底牌:不比游戏帧率,只比电脑装得下多大模型

IFA 2026 的 AMD 开幕演讲没有新显卡,45 分钟只讲了一件事:Personal AI。配套的是三样东西——Ryzen AI Max 400(代号 Gorgon Halo)平台、下一代 HP ZBook 的首次曝光,以及一台 96 核、全液冷的「桌上超算」Threadripper Halo Station。AMD 高级副总裁、计算与图形总经理 Jack Huynh 从算力版图一路讲到每个人的电脑:当 AI 像员工一样整天规划、调用工具、修改结果,这些计算究竟该放在哪里。
AI 是新的电力,但电费快付不起了
Jack 把这几年生成式 AI 的变化压成四步:先学会对话,再获得视觉与语音能力,随后开始推理;到 2025 年,AI 从回答问题的模型变成会规划、会调用工具、会检查结果并继续干活的 Agent。一次普通对话几百到几千 token,而「帮我规划全家意大利旅行」这类任务要查日历、订机票、改酒店,一轮下来就是数十万甚至上百万 token。
按 AMD 的数字,消费者级用户每天消耗数百万 token,创作者是数千万,开发者和创业者 5000 万起步。过去一年,全球月度 AI token 处理量从约 0.7 quadrillion 涨到 1.7 quadrillion,2030 年预计每月达到 120 quadrillion。与此同时,93% 的企业在超支 AI 预算。一个活跃用户每天 1500 万输出 token,走云端大约 300 欧元一天,一年为一个人的用量买单接近 10 万欧元。「我们不能只是花更多钱,必须算得更聪明」,几乎就是整场发布会的题眼。

模型在变小,电脑在变大
把 AI 拉回本地的前提,是本地模型要足够能打。去年 8 月 OpenAI 放出的开放权重模型 GPT-OSS-120B,在研究生级基准 GPQA 上拿到 80 分,是不少开发者的本地部署首选;几个月后,阿里的 Qwen3.5-9B 只用 90 亿参数就在同一基准上拿到更高分,参数少 13 倍,成绩反而更好。开源与闭源的竞争也在升温:Kimi K3 对标 Fable 5,DeepSeek、GLM 乃至 Flash 系列都开始对标 Claude Opus。
AMD 的路线图顺着这条曲线展开。基于 Gorgon Point 的 Ryzen AI 400 系列能本地跑 240 亿参数模型;128GB 统一内存的 Strix Halo 能跑 2000 亿参数。现场给出的对比是,跑在 Strix Halo 上的开源模型 Laguna S 2.1,在一项软件工程基准上超过了云端 Claude Sonnet 5(70.3 分);同样 1000 万输出 token,Claude Sonnet 5 在云端约 90 欧元,在本地为零。

Gorgon Halo 与桌边超算
路线图上的主角 Gorgon Halo,市场名就是 Ryzen AI Max 400 系列:统一内存从 128GB 提到 192GB,可本地运行的模型从 2000 亿推到 3000 亿参数。现场还展示了智谱的 GLM-5.3-Flash:3200 亿参数可在 Gorgon Halo 上本地运行,同一基准上的表现优于云端 Claude Fable 5,而 Fable 5 跑 1000 万输出 token 大约要花 500 欧元。采用这颗芯片的整机,有联想在 IFA 2026 旗舰发布的 ThinkCentre X Ultra,小到能摆在桌上,最多四台可组成集群。Jack 还首次公开代号 Sundance 的下一代 HP ZBook:192GB 统一内存,现场一条 prompt 就本地实时生成了一整个 3D 世界,随后又流畅跑起《微软飞行模拟》。
演讲尾声,AMD 把个人 AI 推到了另一种尺寸。首次亮相的 Threadripper Halo Station 把 96 核 Threadripper PRO 和数据中心级 Instinct MI350P 塞进一台桌边工作站:展示机装两条 MI350P,预留扩展到四张的空间,系统内存最高 2TB,四卡时 HBM3E 总容量最高 576GB,整机液冷。AMD 称它能运行超过 1 万亿参数的模型,并叫它「全球最强工作站」。

生态拼图:系统、容器与开发者体验
硬件能把模型装进去,不等于 Agent 能在电脑上安全工作。它要跨应用和服务执行操作,系统得好上手,也得管住它能看什么、能改什么、何时需要授权。微软 Windows 与设备业务执行副总裁 Pavan Davuluri 介绍,Windows 正在为统一内存访问和工作负载调度做适配,让大模型用上 Gorgon Halo 的内存与 GPU;此前公布的 Microsoft Execution Containers 想为 Agent 提供隔离的执行环境,目前仍处于早期预览。他还公布了 Project Zenith——一套面向开发者级硬件的开箱即用 Windows 体验,要求设备至少 64GB 统一内存,预装 VS Code、WSL、GitHub Copilot CLI、PowerShell 等开发工具,将率先随 Ryzen AI Halo 设备提供。现场他用阿里 1250 亿参数的 Qwen3.8-Flash-Next 在 Gorgon Halo 上演示:从写个小函数,到对敏感文件做本地取证分析,再到一句话生成设计师作品集网站,全程不离开本地。Pavan 给这个愿景起了个名字:PC 将成为「unmetered intelligence」的家。
从能跑 24B 模型的普通 AI PC,到 192GB 统一内存的 Gorgon Halo,再到瞄准 1T+ 模型的 Threadripper Halo Station,AMD 把个人 AI 的硬件层级摆上了台,并与微软、SUSE 合作补齐 Windows 开发与企业部署。DeepSeek、千问、GLM、gpt-oss 和 Laguna 出现在台上时,它们已不只是产品,而是衡量本地算力的标尺——这套路线能否成为新的换机理由,最终取决于设备稳定性与开源模型的能力。