最近公司内部在讨论要不要把一部分核心业务从云上迁回物理机,原因很简单:云主机虽然弹性好,但长期跑高负载业务,账单看着肉疼,而且虚拟化带来的性能损耗到了凌晨业务低谷期也省不了几个钱,西南这边有个叫“西数云”的本地IDC,打出了“西南物理机,价格不到云主机六折”的口号,还号称“晚高峰延迟低于5ms”,正好我们成都有个闲置机柜,我干脆申请了一台测试机,又同步拿了阿里云和腾讯云的同配置云主机做对照组,跑了一周的真实业务数据,先给结论:物理机在某些场景下确实能省钱,但水比想象中深,不搞清楚协议条款,小心被“绑定”到哭。
测试配置与费用对比
测试物理机来自西数云西南(成都)数据中心,配置是:双路Intel Xeon Gold 5218(32核64线程),128GB DDR4 ECC内存,2块2TB NVMe SSD做Raid1,千兆独享带宽,IPMI独立管理口,标价月付1899元,签年付合同打八折,实际1519元/月,阿里云和腾讯云我选了同样CPU型号(按核数近似匹配)的ECS/轻量云,配置:32核64GB(注意云主机内存通常比物理机低一截,物理机内存是云主机的两倍),2TB SSD块存储,按同等带宽计费,阿里云月付大概3200元,腾讯云稍低一点,2800元左右。
乍一看,物理机价格确实只有云主机的五到六折,而且内存翻倍,但注意,云主机的报价包含了底层冗余、快照、自动迁移等服务,而物理机的这个价格是“裸机”——你连机柜上架费都没算进去,西数云的销售说“上架免费”,但后续每增加一个独立IP要收50元/月,更换故障硬盘另收人工费200元/次,这些细节合同里用小字写着,不仔细看真容易忽略。

西南物理机实测,是真实惠还是坑?成都机房数据拉出来遛遛
性能实测:CPU和磁盘差距不大,网络延迟很关键
我用sysbench跑了CPU和内存性能,物理机CPU单核得分1870,多核(64线程)得分11.2万;阿里云云主机单核1740,多核10.5万;腾讯云单核1690,多核10.1万,物理机因为独占物理核,没有超分竞争,整体领先约6%-10%,内存带宽方面,物理机读取速度92GB/s,云主机约75-80GB/s,差别主要来自虚拟化层开销。
磁盘IO才是重头戏,两块NVMe组成的Raid1,4K随机读实测IOPS达到78万,写42万,延迟0.2ms,阿里云Essd PL2的块存储4K读IOPS标称百万级,实际在压力测试中稳定在65万(读),写35万,但延迟波动较大,偶尔跳到2ms以上,腾讯云差不多的水平,物理机胜在延迟稳定,这对数据库类应用很友好。
但网络就有点意思了,西数云的物理机默认提供的是共享千兆,测试时从成都本地ping机房内网,延迟0.3ms,公网去程到北京延迟26ms,回程32ms,不过到了晚上8点晚高峰,公网去程飙到了48ms,丢包率0.2%,这跟他们宣传的“低于5ms”相去甚远——后来才知道那个5ms指的是同机房内网互访,跨运营商公网他们不保证,阿里云和腾讯云的BGP带宽明显更稳定,同一时段到北京的延迟稳定在32-35ms,丢包率忽略不计。
运维体验:IPMI是好东西,但响应速度让人抓狂
物理机最大的优势是全权控制,IPMI远程管理卡可以帮你做系统重装、BIOS设置、甚至直接看到开机自检画面,我测试了西数云的IPMI,反应速度尚可,但遇到一次IPMI死机,发工单后等了45分钟才有人重启管理卡,对比腾讯云的云监控和阿里云的运维事件平台,7x24小时响应,15分钟之内必回,对于只有一两台机器的小团队,物理机遇到硬件故障非常折磨人——我旁边工位的兄弟之前用另一家西南IDC的物理机,硬盘报警后等了两天才有人上门更换,这期间业务只能降级。
适合什么人,不适合什么人
如果你运行的是高IO、低延迟敏感的内部系统(比如仓库管理、制造执行系统MES),或者做机器学习推理需要长时间满载跑GPU,且你本身有运维能力(至少会看IPMI、会手动更换备件),西南物理机确实能帮你省掉40%-50%的硬件成本,但如果你做的是面向公网用户的Web服务或API,尤其是需要稳定公网延迟和自动故障迁移的,千万别贪便宜——云主机的网络质量和SLA是物理机裸机没法比的,更别提云厂商的容器、RDS、Redis全家桶了。
我个人的建议:优先把无状态的计算节点(例如批量任务、视频转码)放到物理机上,把有状态的核心业务(数据库、缓存、前端网关)留在云上,西南物理机的价格优势建立在你愿意承担运维风险的基础上,签合同前一定问清楚硬件故障响应时间、是否提供免费备用机、带宽超额怎么计费,别信广告,信测试数据。
最后补一句,他们的销售答应送的一个月免费测试期,到我还机器那天突然说“要满三个月才免”,还好我留了聊天截图,西南物理机,羊毛出在羊身上。
发表评论