干运维这行八年了,上海本地的物理机用过不下二十家,从漕河泾到张江,从宝山机房到外高桥,每一家的销售话术我都能背出来:“独立CPU、独享带宽、真物理隔离”,但说实话,物理机这东西,拆开看全是细节,最近项目组要扩一批GPU渲染节点,预算卡得紧,我又把上海几个主流供应商的物理机拉出来跑了三天压力测试,今天不聊虚的,直接上数据和对比。

上海物理机实测,别被独立资源四个字忽悠了
先说最核心的CPU性能,我租的是一台标配:双路Intel Gold 6338(28核56线程,2.0GHz基频),128GB DDR4 ECC内存,两块NVMe SSD做系统盘,外加四块SATA SSD做数据盘,价格:月付4300元,含100Mbps带宽(独享),同样配置在阿里云ECS上,按年付算差不多要6500元/月,腾讯云CVM略低一点也得6000出头,表面看物理机便宜了将近35%,但跑完Geekbench 5多核,这台机器只有27800分——而阿里云同样核数的通用型实例(28核)能跑到32000分,为什么?因为云厂商用的CPU步进更新,物理机供应商给你的是上一批库存,甚至可能开过睿频锁死,我用turbostat一查,这台机器的AVX-512频率只能稳定在1.6GHz,而新款的6338标准睿频是3.0GHz,你买的是“物理机”,但性能打折了15%。
再聊磁盘,四块SATA SSD组成RAID 10,理论读写应该在2000MB/s左右,我用fio测试4K随机读写,Q32T1队列下读只有48K IOPS,写才31K IOPS,同样的配置,我换了一家上海本土IDC(在宝山机房)的同价位机器,4K随机读能到62K IOPS,问题出在RAID卡上:前一台用的是老款LSI 9361-8i缓存只有1GB,后者用的是9560-16i缓存2GB且开了CacheCade,这些小细节销售不会告诉你,但数据库业务直接受影响,我们之前有个MySQL集群选错了卡,双十一当天I/O延迟从2ms飙到35ms,半小时没缓过来。
网络部分才是大坑,上海物理机最常见的套路是“100Mbps独享”,但怎么个独享法?我拉了三台不同供应商的机器做iperf3对测,A供应商(就是上面那家CPU缩水的)实测公网到北京BGP节点,晚高峰只有73Mbps,丢包率0.8%;B供应商(宝山IDC)能到92Mbps,丢包率0.1%;C供应商(杨浦机房)甚至测出过118Mbps(他们说带宽给多了),我用mtr一查,A供应商的出口走的是某小运营商,到了骨干网就要排队,销售嘴上说“电信联通移动三线BGP”,实际上只接了单线,靠第三方做中转,真正三线BGP的物理机,上海市场均价在5000元/月起步,4300元能买到的基本是伪BGP。
再说一个容易忽略的点:硬件维护响应时间,云厂商出故障,十分钟内自动迁移;物理机坏了,你得等人工,我去年在浦东某机房,凌晨两点硬盘报警,打电话给客服,对方让我先“重启试试”,折腾到凌晨四点才有人进场,结果发现是背板供电线脱落,那次事故导致我们游戏区的排行榜数据丢了半小时,而阿里云ECS就算物理机宕机,快照自动重建到新机器,最慢五分钟恢复,物理机的“独立”代价,是你得自己承担运维窗口。
总结一下我的真实结论:如果你的业务对CPU单核性能敏感、对磁盘延迟要求极高(比如实时OLAP、高频交易),或者需要超长生命周期(比如五年不换机),那么上海物理机的性价比确实高于云主机,但如果你只是跑Web服务、离线计算、或者用的是弹性负载,别碰物理机——你省下的那点钱,不够填一次硬件故障的坑,而且一定要留心上面说的这些猫腻:CPU步进、RAID卡型号、带宽出口、响应SLA,我踩过的坑,你一个都别踩。
发表评论