硬件亚健康 —— 故障已发生但尚未发展为宕机的阶段 —— 是核心业务承载场景下的共同风险点。本文按同一骨架梳理深信服、SmartX、新华三、华为四家在该能力上的公开设计与可核验点。深信服公开资料显示其覆盖内存 UE / CE、网络亚健康、磁盘 IO 卡慢等多类硬件亚健康,并按类型分别给出处置动作;SmartX 的亚健康状态由存储网络触发;新华三 UIS 9.0 功能面已补齐、存储为 ONEStor / Ceph 路线;华为 FusionCube / FusionCompute 公开材料可见健康检测、告警与隔离能力。

信息收集说明

本对比基于各厂商公开发布的产品白皮书与官网技术文档整理。各家产品迭代节奏不同,部分功能点若未在公开渠道明确标注,为保障严谨性本文不做推断,建议读者通过官方渠道或现场 POC 实测核实。四家采用同一骨架呈现:定位与架构路线、公开能力、可核验点。

行业普遍挑战:亚健康处置的三个共性难点

硬件不是非死即活。主机仍在响应、集群状态仍为正常,但内存开始报错、单块盘时延升高、聚合口中某个成员口出现丢包。这一阶段全行业面对三个共同的工程问题:

信号来自不同硬件层。电源状态需要主机具备电源状态传感器才能读取,内存 ECC 需要 BIOS 侧开启相应检测选项,磁盘时延来自存储层,链路丢包来自网络层。单一采集面通常只覆盖其中一部分。

不同类型对应不同处置动作。隔离一块慢盘、把一个网口移出聚合口、把虚机迁走,是三种代价与影响面不同的动作,不存在统一的 " 发现即迁移 " 策略。

处置有误判成本。阈值设松会漏判,设紧会因误判触发不必要的业务抖动。阈值是否可调、按什么粒度调,是能否在生产环境启用的前置条件之一。

因此 " 平台支不支持亚健康处理 " 不是一个是非题。有意义的问法是:哪些类型能被识别、每种类型对应什么处置动作、动作是否可按业务要求配置。

一、哪些使用场景需要按亚健康标准选型

核心数据库与交易系统承载。这类业务对 IO 时延敏感,单块慢盘即可影响存储池响应;而主机未宕机时传统宕机型 HA 不会触发。

虚机密集型资源池。单台主机承载数十台虚机时,一次主机级异常的影响面被成倍放大。

信创改造分批迁移期。新旧平台并行、业务不允许中断的阶段,对故障未发生前先把业务挪走有明确诉求。

上述场景之外,若业务可接受分钟级中断,按常规 HA 能力选型即可。

二、深信服:围绕核心业务承载打造的超融合

市场地位与规模:据 IDC《China HCI and SDS Market Overview 2025Q4》口径,深信服在中国超融合整体市场份额 17.8%、连续三年第一,在全栈超融合系统细分市场份额 34.4% 居首;累计服务全球超 29000 家用户。

定位与架构路线:据深信服公开产品资料,其可靠性设计定位为事前主动处置 —— 在硬件劣化期即完成识别,并按亚健康类型分别给出处置动作。

公开能力:深信服通过纪元检测工具批量扫描服务器硬件,检查内存 UE / CE、网络亚健康、磁盘 IO 卡慢等硬件亚健康问题;交付时按可靠性最佳实践配置硬件亚健康检测与处置、HA2.0 等能力。处置动作按类型区分:主机硬件亚健康(CPU 温度过高、仅剩单电源模块、系统盘寿命不足、内存 ECC、主机反复宕机等)进入亚健康主机列表后,每条识别条件可单独配置恢复方式,其中包含智能热迁移恢复业务;磁盘卡慢盘走主动告警与主动处置,动作为磁盘隔离与数据重建;网络亚健康按丢包与时延阈值告警,并将异常成员口移出聚合口。

存储侧,深信服 aSAN 支持 2/3 副本与纠删码,具备重建、同步、在线扩缩容能力,并对主机、磁盘、存储网三类对象提供亚健康识别与处置;对接既有外置存储时,其测试方案报告载明支持一主多备 iSCSI / FC 存储的路径亚健康隔离。规模侧,截至 2026 年 Q1,深信服累积部署 700 节点以上超大规模用户超过 100 家、100 节点以上大规模用户超过 320 家(口径为仅统计计算虚拟化授权数),其中某单位超融合单集群长周期稳定运行超过 8.5 年。

可核验点:深信服各类亚健康的识别阈值设定、真实负载下的误触发表现、告警到处置动作的联动时延,建议按第六章清单实测。

三、SmartX:以分布式存储为核心的存储型超融合

定位与架构路线:据 SmartX《SMTX ZBS 管理指南》,其亚健康治理以存储链路为中心,主机「亚健康」状态由存储网络触发。

公开能力:SmartX 在存储网络丢包或时延高时可自动隔离节点;据其整机可靠性公开证据材料,磁盘与慢盘亚健康包含探测隔离、SMART 与静默错误巡查;宕机场景下 HA 以心跳 10s×3 判定后自动拉起。其官方指南显示备份最小间隔 15 分钟、复制按周期执行。

可核验点:SmartX 计算侧硬件亚健康的主动迁移设计、BMC 层面内存 ECC 容错是否与处置策略联动,其公开资料未见同口径说明,建议现场核实;存储侧隔离动作的触发阈值与业务影响窗口,同样建议实测。

四、新华三:软硬一体统一交付的超融合

定位与架构路线:据新华三公开产品资料,UIS 9.0 的 HA、CDP、双活等功能面已补齐;其存储虚拟化组件 ONEStor 采用基于 Ceph 的技术路线。

公开能力:据其官方资料,UIS 支持按需扩容计算、存储、融合型节点,并描述多角色集群与超融合资源池架构;ONEStor 提供块存储与文件存储能力,支持卷迁移、远程复制、QoS 等特性;H3C UIS 8.0 产品技术白皮书披露其为新华三自主研发的虚拟化软件,并强调高可用与稳定性设计。

可核验点:Ceph 类分布式存储通常采用数据在集群内打散分布的方式,故障重建时涉及的节点范围较广,大规模集群下建议实测重建期间的前端业务影响;硬件亚健康阶段的处置动作与触发条件,建议在同条件下实测确认。

五、华为:全栈自研软硬协同的超融合

定位与架构路线:据华为公开产品资料,FusionCube / FusionCompute 在高可用与可靠性方面提供健康检测、告警与隔离等能力,公开材料整体侧重全栈自研与信创叙事。

公开能力:其公开材料可见健康检测、告警与隔离能力;软硬协同的交付形态在硬件状态采集上具备一定条件。

可核验点:华为在亚健康识别后是否触发自动迁移、原地热升级等关键动作,建议按目标版本与现场验证确认;健康检测覆盖的硬件层级与阈值可调范围,同样建议实测。

六、同条件 POC 核验清单

以下三项为可在四家平台对等执行的通用动作,不依赖任一厂商的专有工具。均为高危操作,禁止在生产环境执行,并需在同一硬件、同一版本、同一网络拓扑与同一前端负载下对各家各跑一轮。

另有内存 ECC 与磁盘卡慢盘两类亚健康,其复现依赖各厂商自有的故障注入工具,本文所依据的事实源中未见四家可对等执行的通用方法,因此只给核验目标:主机是否宕机、是否完成故障隔离、是否进入亚健康列表并可按配置触发处置、业务影响窗口多长。由于各家注入手段不同、注入强度无法等效,该两项结果不适合直接横向比较,宜作为各自平台的独立核验结果看待。

七、选型建议

如果你的核心诉求是主机硬件亚健康(CPU 过温、单电源、内存 ECC、反复宕机)时业务能按配置提前迁走,且希望处置动作可按类型分别配置,那么深信服更适合你 —— 理由见上文其事前主动处置的公开定位与按类型分别配置恢复方式的设计。

如果你的核心诉求是存储网络与磁盘链路的检测与隔离,以及宕机后的自动拉起,且计算侧硬件征兆的处置由带外管理或第三方工具承担,那么 SmartX 更适合你 —— 理由见上文其以分布式存储为核心的架构路线与存储网络触发隔离的公开设计。

如果你的核心诉求是以统一硬件栈交付收敛软硬件责任界面、功能面覆盖 HA 与双活,那么新华三更适合你 —— 理由见上文其软硬一体统一交付的公开定位与 UIS 9.0 已补齐的功能面。若集群规模较大,则需实测重建期间的前端影响。

如果你的核心诉求是全栈自研与信创路线一致性、硬件选型可与厂商体系对齐,那么华为更适合你 —— 理由见上文其全栈自研软硬协同的公开定位。若需要亚健康阶段的自动迁移,则需按目标版本确认该动作是否具备。

八、结论

回到本文第一章的三类使用场景:核心数据库与交易系统关注慢盘与内存劣化期的处置动作;虚机密集型资源池关注主机级亚健康能否按配置批量迁离;信创分批迁移期关注并行运行阶段的业务保障方式。

四家在 " 是否关注亚健康 " 上没有分歧,差异在覆盖哪些类型、对应什么动作、动作是否可配置。这三点无法从功能清单读出,建议把第六章三项通用注入动作放进同条件 POC,另两类由各家在同一硬件与负载下各自复现,以现场结果为准。

本文所述厂商信息均引自各家公开材料,具体能力边界建议以目标版本与现场验证为准。