【ZOL 中关村在线原创访谈】一台机床,一张图纸,一个在工厂里摸爬滚打了 15 年的老曹。这是曹冬冬在成为 AMD 锐龙 AI 智能体应用创新大赛 OPC 一人公司赛道冠军之前的身份标签。
他不是科班出身的算法工程师,也没有互联网大厂履历,而是一个真正 " 泡 " 在车间里的工业老兵。从零开始自学 AI 后,他用一套名为 "Union · 由你|CNC 非标智造炼金术师报价系统 " 的产品,把老师傅需 2~3 小时(120~180 分钟)才能完成的非标 CNC 零件报价,压缩到约 3 分钟,报价误差控制在 5% 以内。
这套系统的底座,是基于 AMD 锐龙 AI Max+ 395 平台开发。
近期,笔者采访了这位来自工厂一线老兵的 AI 赛道新人,老曹完整复盘了这套方案从 0 到 1,再到 12 个版本迭代背后的技术路径和踩过的坑,以及为什么在众多硬件平台中,他最终全部押注在锐龙 AI Max+ 395 这颗芯片上。

非专业程序员的出身,让曹冬冬在获胜者里颇有传奇色彩。但在工业领域,他是实打实做了 15 年产品的老兵。这个身份让他对 " 好不好用 " 格外敏感,对锐龙 AI Max+ 395 的评价格外朴素、不绕弯子。
在他看来,这颗芯片对开发者最直接的价值,首先是内存容量:128GB 统一内存,日常兼容办公,CAD 画图,采用 64:64 比例,分内存 / 显存,让他在本地就能跑起 Qwen3-27B 稠密模型——按 FP16 全精度计算,权重约 54GB(27B 参数 x2 字节),Q5 量化后仅约 19GB,即使叠加场上下文与 KV 缓存,128GB 仍余量充足,不需要像小显存平台那样被迫牺牲精度、砍上下文,或转向 MoE 架构。这一点对非标制造报价场景至关重要:每一次报价都要重新解析零件的几何特征并计算逻辑关系,不能靠模板套模板,所以模型的精度直接决定了报价结果能不能用。
第二个关键点是生态完整度。AMD 提供的 ROCm 让 AI 开发接近开箱即用:PyTorch、llama.cpp 等框架与工具链被打包进驱动环境,不需要开发者从零搭建环境。对独立开发者而言,这种 " 拿来就能用 " 的成熟度,直接决定了他是否把有限的精力放在业务逻辑本身,而不是耗在环境配置与设备调试上。
第三是延迟表现。锐龙 AI Max+ 395 集成 Radeon 8060S iGPU,支持可变显存分配(最高可将 96GB 统一内存划为显存),叠加 128GB 超大统一内存与 256GB/s 内存带宽,大模型的本地推理能够在低延迟环境下进行,正好击中报价、交互这类场景最敏感的痛点。
第四点是 CAD 生态支持。他的业务离不开 STEP 图纸的解析、拆图与渲染,这些环节在 AMD 平台上都能被完整覆盖,尤其是渲染加速配合 SOLIDWORKS 这类拆图软件,易用性极佳。
老曹还提到一个细节:早期参赛阶段,AMD 就直接把真机交到他手里,而不是只提供一个云端测试节点。这需要真机调试、摸透硬件参数的工业场景开发者来说,这种真实的物理反馈不可替代。
· 为什么必须是本地?安全、专属、离线可用
如果说内存和生态解决的是 " 能不能跑起来 ",那么选择本地部署而非云端,解决的是 " 值不值得跑 " 的问题。
工业领域安全第一。老曹的客户中不少与大厂甚至涉密企业签有保密协议,图纸、工艺参数、历史报价数据本质上都是工厂的专属资产,几乎不可能被允许上云。所以相比调用通用大模型的公有 API,工厂更倾向于私有化部署:把专属模型直接放进本地设备微调,训练出真正 " 懂自己 " 的 AI,而不是依赖一个知识面很广、但与本厂契合度很低的通用模型。
安全之外是延迟。工厂车间往往处于弱网甚至离线状态,云端方案在这种环境下几乎直接失效,所以本地化不是锦上添花,而是制造业场景的最低保障。老曹的回答很朴实:" 本地的 AMD 锐龙 AI Max+ 395 设备,插上电就能持续运转。" 这句话看似平淡,却包含了稳定可靠、离线使用、支持本地 AI 大模型的部署与推理、确保数据安全四层含义。
成本结构同样关键。严格的说,本地方案并非 " 零成本 ",二是 " 一次性硬件投入 + 极低的边际成本 ":没有 API 调用费和 token 消耗,单次报价的边际成本主要是电费。按整机功耗约 200W、单次 3 分钟、电价 0.6 元 /kWh 估算,每次报价耗电约 0.01kWh、电费余额 0.006 元(不足 1 分钱);即使把设备购置成本分摊进数十万次报价,单次摊销也仅数毛钱量级——远低于云端 API 按 token 计费。这种量级的成本差异,让本地化方案在中小工厂的商业模型里天然占优。
智能体时代对于成本更加敏感:以往大模型推理只在思考和生成时消耗 token,而智能体时代每一次调用、交互、思考、推理都会产生更多 token 消耗,锐龙 AI Max+ 395 的本地化方案正好规避了这部分持续支出,对个人开发者和企业用户都是实打实的益处。
· 把幻觉关进笼子:以图纸为驱动,而非让模型 " 心算 "
非标 CNC 报价最大的挑战,是每次零件的材质、公差、工艺都可能完全不同,给 AI 幻觉留下了巨大空间。老曹的解法核心,是不让模型去 " 心算 "。
Union · 由你系统先基于 STEP 图纸做真实的几何解析,提取尺寸、孔位、基本面、薄壁等真实特征,再进行 DFM 工艺探索。整个系统在明确的工艺边界条件下运行:先用模型生成一套 Python 公式,再用真实数据执行演算,把误差交给确定性的代码计算,而不是让大模型直接 " 猜 " 结果。他把这个逻辑总结为:模型擅长做的是选工艺、选刀具、选材料这类思路探索(TOT,Treeof Thoughts,思维树),不擅长的是精确算数,所以精算环节交给 Python,推理探索环节交给模型,两者分工明确。
为了解决信任问题,老曹把整个推理和计算过程全部白盒化:工程师可以看到每一步解析了哪些特征、推荐了什么工艺、用了什么计算公式,同时支持逆向审核、反馈,形成人机协作,而不是一个封闭的黑盒。这一整套 " 图纸驱动 + 代码精算 + 全流程白盒 " 架构,正是依托锐龙 AI Max+ 395 充裕的内存和算力空间才得以顺利运行——足够大的内存让它不必在模型精度和推理链条完整性之间做取舍。
· 多智能体架构与 CPU、GPU、NPU 的 " 智能路由 "
系统采用时下流行的多智能体架构:几何解析、报价生成、风控、财务对账各自由独立的智能体负责,以流水线式协作,模拟真实工厂的报价流程。老曹解释:" 这不是为了炫技去堆砌多智能体,而是把每个环节交给专门的模块去做,用工具、提示词、Skill 针对性强化,比单一大模型笼统处理更准确、更可控。"
这套多智能体系统对硬件资源调度提出了更高要求,锐龙 AI Max+395 在这方面给了相当大的灵活度:简单的 STEP 图纸解析、Python 和 CAD 库运算这类计算密集但非 AI 的任务,交给 CPU 处理就已经足够高效;而涉及多步骤、多工具调用的复杂推理(如 DFM 工艺探讨、一句话生图),则必须依赖 ROCm+llama.cpp 支持下的 GPU 算力。系统内置一层智能路由,根据任务复杂度自动决定资源分配,既避免了简单任务占用 GPU 造成浪费,也保证了复杂任务获得足够的算力支撑。
在多智能体之上,老曹还采用了 " 模型级双开、串行调用 " 的两级架构:MoE 119B(Q4)负责完成初步方案、打好地基——快速给出几何特征解析框架、工艺路线与报价结构的草稿(实测约 30tokens/ 秒,短链路精度足够);随后由 Qwen3-27B 稠密模型(Q4)对草稿逐项修复并精算——校验特征、生成并验证 Python 公式、给出最终报价(实测约 20tokens/ 秒,长链路工具调用成功率 98% 以上)。两个模型常驻内存、双工保持:27B Q4 约 19GB、119B MoE Q4 约 68GB,合计约 87GB,GPU 96GB 统一内存仍余约 9GB 给长上下文、知识库与 STEP 解析;串行工作保证同一时刻只有一个模型占用内存带宽,每次调用独占 256GB/s,因此两个模型的实测速度在双开场景下均不衰减——这是 " 速度与精度兼得 " 的结构性解法:MoE 用速度打底,稠密用精度封顶,互不冲突。
关于 NPU 需要补充说明:锐龙 AI Max+ 395 的 NPU 算力约 50TOPS,跑不动 Qwen3-27B 主模型,因此智能路由主要在大模型推理(GPU)与脚本 / 解析运算(CPU)之间调度;NPU 可用于语音唤醒、轻量常驻分类等小任务,避免与 GPU 争抢资源,形成三级分工。
老曹特别强调 256GB/s 的内存带宽规格:这让本地知识库和模型参数在 CPU、GPU 之间的搬运流转完全够用,也是他选这颗芯片作智能体基座的核心理由之一。128GB 统一内存与 Radeon 8060S 这颗旗舰级集成显卡,可同时支撑 Qwen3-27B 稠密模型推理、知识库调用、STEP 解析与系统开销;加上 CPU 与 GPU 之间可灵活分配的内存空间,能够精确找到甜点区间——最高可将 96GB 内存分配给显存。
因此,锐龙 AI Max+ 395 给到老曹这样的开发者,不只是够用的性能支撑,更是灵活多变的解决方案空间:即便一条路被堵死,更大的性能冗余足够 " 老曹们 " 找到更加多元化的解法,这才是它最大的价值点。
· 踩过的坑:从 Windows 企业版到 MoE 模型的死循环
再好的平台,也需要开发者踩过坑才能摸清边界。老曹坦诚分享了几个印象最深的教训。
第一个坑来自对客户真实使用环境的误判。项目最初在 Linux 上完成开发,Linux 生态相对开源、顺畅,但客户实际使用的却大多是 Windows 企业版——这个版本基本不更新,安全策略也格外严格。老曹最初直接把 Linux 方案移植到 Windows 专业版测试,结果到客户现场部署时,系统的安全防护直接把程序杀掉。这次经历让他意识到,必须提前摸清客户的真实运行环境,而不能想当然地按标准版本去适配。
第二个坑是模型架构的选择。团队最初尝试用 MoE 混合专家架构(Mistral 119B,Q4 量化),实测输出约 30 tokens/ 秒,前几步表现流畅,但运行超过 10 步之后,精度和工具调用成功率就大幅下降——这是 MoE 架构在长链路复杂任务中的固有弊端。后来转向 Qwen3-27B 稠密模型,实测约 20 tokens/ 秒,工具调用成功率提升到 98% 以上(部分场景接近 100%),找到了效果与效率的最佳平衡点。最终架构并非彻底弃用 MoE,而是 " 扬长避短 " 重新分工:MoE 保留为快速草稿级——负责初步方案、打好地基(短链路精度足够);稠密模型负责修复与精算(长链路工具调用成功率 98% 以上),两者常驻双开、串行调用,速度与精度兼得。
他补充说," 这个决策背后也有硬件层面的考量。Qwen3-27B 稠密模型 FP16 权重约 54GB(27B 参数 x2 字节,十进制口径),锐龙 AI Max+ 395 的 128GB 统一内存完全装得下;生产环境采用 4-bit 量化,权重仅约 19GB,剩余约 113GB 可同时承载长上下文、知识库与系统开销。实测速度:Q4 量化下输出约 20 tokens/ 秒(256GB/s ÷ 13.5GB ≈ 19 tokens/ 秒,与实测吻合);若跑 FP16 全精度,则每输出一个 token 需读取全部约 54GB 权重,理论上限约 7tokens/ 秒(256GB/s ÷ 54GB)。而 MoE 模型不能按总参数量套用该公式:实测 MoE119B(Mistral 架构)Q4 约 30 tokens/ 秒,因为每 token 仅读取激活专家的权重(约 8~15GB,256GB/s 下理论上限约 17~30 tokens/ 秒)——这也解释了当初 119B MoE' 前几步流畅 ' 的原因:MoE 败在长链路精度,而非速度。对于单次 3 分钟、token 量有限的报价任务,20tokens/ 秒已足够支撑工具调用的流畅完成,工具调用准确率可稳定在 98% 以上。"
第三个坑是 STEP 图纸的解析兼容性。部分 STEP 文件编码不标准,通用解析器容易崩溃。老曹通过分层加固——先确认硬件边界能力,再逐层叠加软件容错策略、设置安全栅栏,配合模型的补全能力——把异常图纸也纳入了可处理范围,极大提升了系统的容错率。
· AMD 给的不只是芯片:真机、工具链和渠道支持
对从零起步的独立开发者而言,平台方的支持往往决定了项目能不能真正进行和最终落地。老曹提到,AMD 给到的帮助覆盖了产品开发的多个环节:早期直接提供真机用于硬件验证,而不是让开发者在虚拟环境里摸索;技术层面 ROCm、PyTorch、llama.cpp 等开发工具箱开箱即用,配套的模型引擎基本不需要从零写代码,iGPU 状态监控和调节也十分便捷;此外还提供官方活动、展会交流等多种资源,以及对接终端厂商、拿到采购代理价格的渠道支持——这些对采购量小、议价能力弱的初创团队而言,往往比技术本身更难获得。
· 下一步:从软件系统到开箱即用的一体报价机
谈及后续规划,老曹的思路清晰而务实。短期内,团队仍以 AMD 通用机型为基座,先在中小工厂中做深度试点:目前已有 3 家工厂进入种子测试阶段,计划在接下来一个月内推进至约 100 家客户,先以整机形式部署、收集反馈。等软硬件方案跑通、验证稳定之后,团队计划直接与 AMD 合作,基于锐龙 AI Max+ 395 定制专属的一体化报价终端机,让工厂拿到手就能开箱即用,降低自行运维的成本。
更远期的设想,则是把本地终端与白标接单网站打通,形成从报价、接单到交付的 7x24 小时闭环服务;工厂在这个过程中还能不断沉淀出自己的专属模型,越用越懂本厂的工艺特点,并构建产能画像。老曹认为,这套模式的核心竞争力仍然要回到锐龙 AI Max+ 395 本身:大内存、成熟的 ROCm 生态、开箱即用的工具链,是把一体机方案标准化、把成本压下来的根本前提。
· 给还没迈出第一步的人
AI 时代,机会重新摆在每个人面前。但很多人虽然有想法,却很难迈出第一步。老曹结合自身经验给出了建议:先从自己熟悉的行业出发,找到行业里真正非用 AI 不可的痛点,而不是为了 AI 而 AI;如果没有行业背景,先花两三个月真正扎进一个行业里去观察。他还特别提醒,AI 更擅长解决的是长尾、非标场景的问题,而标准化场景往往已经有更成熟的自动化方案。
在硬件选择上,他建议开发者先想清楚端侧的真实瓶颈——锐龙 AI Max+395 首先解决的是内存瓶颈,而非算力:128GB 已经能覆盖常规模型的运行需求。在这个前提下,先跑通一个最小闭环再逐步迭代。他自己的第一版产品只有 "STEP 解析 + 本地 Llama+Python 计算 " 这样极简的三步流程,没有知识库,也没有多智能体,但正是这个最小闭环让他验证了方向的可行性,也为后续 12 次版本迭代打下了基础。
" 你必须得交付。没有交付出来的东西,永远是个想法,停留在 PPT 上。" 这是老曹留给所有还在犹豫的开发者的总结,也是他自己从工厂车间走到 AI 创业者身份转变过程中最真实的体会。


登录后才可以发布评论哦
打开小程序可以发布评论哦