一类负载,两种错误的承接方式
渲染农场按帧分发任务,批量推理按请求分流,云桌面一人一机——这类业务的共同形状是大量互相独立的小任务,每个任务一颗 CPU、至多一张 GPU 卡就够。用 8-10 卡 GPU 服务器承接它们,昂贵的多卡密度与大风道完全用不上;散放几十台塔式 PC,供电、散热与资产管理又会失控。PC-Farm 系列给出的答案介于两者之间:4U4H 把 4 个可插拔 PC 节点装进 4U 机箱,6U6H 装 6 个,节点各自独立运行,机箱统一解决供电与机架安装,让“一堆小机器”进入标准机房的管理体系。
热插拔加完全独立上下电:运维粒度切到单节点
PC-Farm 的节点支持热插拔,并且完全独立上下电,两者合起来决定了运维动作的粒度。某个节点系统崩溃或硬件故障,处置动作是对该节点单独断电、拔出、推入备件,机箱内其余节点全程在线;重装系统、升级驱动这类计划内操作,同样不需要为整箱协调停机窗口。与虚拟化整合方案相比,节点之间没有共享的宿主机内核,一个节点的软件故障波及不到邻居——故障域的边界就是节点的物理边界。这对无人值守时段的流程尤其友好:值班只需把问题节点下电隔离出集群,修复可以等到白天。
750W 背板与 4 路 CRPS 1100W:供电设计的两层
供电要分两层看。节点层,背板给每个节点的供电峰值为 750W,这个预算框定了节点内 CPU、GPU 卡与外设的功耗上限,也意味着节点满载时彼此不抢电——预算按节点划死,而不是全箱共享后各凭运气。整机层,4 路 CRPS 1100W 冗余电源统一供电,单路故障时其余电源继续承载,支持在线更换;CRPS 是服务器通用冗余电源规格,备件可与机房其它设备打通。集中供电取代每台 PC 各配一只电源,故障点更少,而电源冗余本身就是散放的桌面机根本不具备的能力。
每节点一张 GPU 卡:按数量扩展的负载
6U6H 的每个节点支持一张 GPU 卡,对应的负载画像是按节点数横向扩展:渲染农场把帧或镜头切给各节点独立渲染,节点之间零通信;推理服务在每个节点部署一份模型副本,请求按节点分流,单节点故障只损失一份副本的吞吐;云图形终端则是一个节点服务一组用户。判别标准只有一条:任务之间是否需要 GPU 互联。需要多卡并行、大显存单任务的训练与大模型推理,属于 8-10 卡平台的领地——PC-Farm 扩展的是节点数量这个维度,不是单机算力。
4U4H 与 6U6H 之间
两个型号的节点热插拔、独立上下电、背板供电与 CRPS 冗余设计一致,差别在密度与形态:4U 装 4 节点,6U 装 6 节点。机柜 U 位紧张、以节点数量为先的场景选 6U6H,每节点一张 GPU 卡的支持也让它更贴近推理与渲染农场;4U4H 则以更小的机箱粒度起步,适合按业务批次逐柜扩容。说到底,PC-Farm 回答的是一个朴素的问题:当业务由几十个互不相干的小任务组成时,机架里更合理的形态是几十台可以被单独处置的小机器,而不是一台不能停的大机器。
