ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

HP服务器硬盘故障怎么办?从报警判断到RAID重建的完整实战指南

HP服务器硬盘故障怎么办?从报警判断到RAID重建的完整实战指南 凌晨两点机房报警短信先响随后iLO邮件也到了一台DL380 Gen10的Smart Array P408i阵列卡发现物理盘状态异常硬盘Cap LED开始跳琥珀色。说实话HP服务器硬盘故障在运维里属于高频事件但很多人卡住的地方并不是换盘那几十秒而是换之前的判断、换之后的确认。这篇文章就拿一台典型的HP ProLiant DL380 Gen9/Gen10为例把从报警出现到新盘重建完成的完整流程拆开讲清楚包括怎么看状态、怎么选备件、怎么安全热插拔、怎么跟踪重建进度以及周围人最容易踩的几个坑。适合刚接手HP服务器的新人也适合给那些已经会换盘、但没细究过为什么的运维同行做个参考。1. 判断故障盘报警灯亮了不代表马上要拔先说一个反直觉的结论服务器硬盘报警分两种一种是预测性故障Predictive Failure一种是直接失效Failed。前者意味着硬盘还能读能写只是SMART或阵列卡已经嗅到风险正在向你发出替换建议后者才代表盘彻底下线逻辑盘可能已经降级。看到报警就火急火燎去拔盘往往会把一台仍在正常服务的服务器提前搞成降级状态。1.1 先分清报警级别再行动HP服务器的报警来源大致有三个iLO事件日志、阵列卡事件、机箱前面板硬盘灯。iLO里的报警信息通常带严谨措辞比如Predictive failure on physical drive这一类盘在操作系统里可能仍然显示Online但阵列卡已经给它打上了该换了的标记而如果事件里写的是Physical drive failed那才是真正掉了。判断逻辑是这样阵列卡状态盘的实际表现该不该立刻换Predictive Failure未掉线逻辑盘正常建议尽早换但可以先准备备件Failed盘已离线逻辑盘降级立刻换越快越好Missing盘被拔走或接触不良按故障处理优先检查物理连接Rebuilding新盘正在重建不要碰等它跑完很多第一次处理的人会犯一个错Windows或Linux系统里看分区还在就以为报警是误报。实际在阵列卡层面硬盘的健康状态和数据可用是两码事。数据还能读是因为RAID冗余还在撑着盘本身已经随时可能彻底罢工。1.2 用命令确认故障盘别靠肉眼HP服务器的阵列卡老一点的是Smart Array P420/P440ar新一点的是P408i-P/i或MR系列。无论哪一代命令行工具都建议优先掌握。操作系统里装好ssacli新版本叫ssacli老版本叫hpssacli之后第一条命令就是看控制器ssacli ctrl slot0 ld all show status ssacli ctrl slot0 pd all show第一行是查看逻辑盘状态第二行是查看所有物理盘。输出里会看到类似NORMAL、OKAY的字段还有盘的接口类型、容量、固件版本和状态。真正的故障盘会明确标出Predictive Failure或Failed。如果嫌命令行复杂开机自检界面按F8进入Option ROM配置工具或者用HP Smart Storage AdministratorSSA也能看到同样信息。但生产环境通常在跑业务进不了自检界面所以命令行是首选。1.3 灯闪一下确认到底拔哪块定位盘位是整个流程里最容易被忽略也最容易翻车的一步。以前见过一个同行机柜里两台HP服务器并排报警邮件没错盘位显示是Bay 3结果他拉开另一台服务器的Bay 3把健康盘给拔了。这种事发生一次就是事故。解决办法是用阵列卡的定位功能ssacli ctrl slot0 pd 1I:3 modify ledon执行之后对应位置的硬盘指示灯会闪烁或长亮你到机柜前直接看哪个盘在闪确认无误后再动手。如果没有命令行工具iLO的远程控制台进入Storage页也能找到Identify之类的按钮效果一样。不要嫌这一步多花了一分钟这一分钟买的是数据安全。2. 更换前的30分钟备件、冗余和风险清单确定到底哪块盘坏之后别急着拔。我见过最莽的操作是报警一响直接拿一块盘去机房结果备件容量比原盘小插入后阵列卡怎么也不认。花两分钟弄清楚下面三件事能避免后面几小时的折腾。2.1 阵列冗余度决定你能多淡定先确认逻辑盘的RAID级别。RAID 1两块盘互为镜像坏一块还能继续跑但此时剩余盘不再有冗余再坏一块数据就没了。RAID 5坏一块盘时逻辑盘仍可读写但所有I/O都会顺带触发校验重算性能明显下降。RAID 6允许坏两块盘坏一块的表现比RAID 5从容得多。RAID 10允许每个镜像对里坏一块坏盘后同样进入降级状态。这个信息直接影响更换节奏。如果已经是RAID 5加一块热备盘故障盘触发热备后系统可能已经自动开始重建你需要做的反而只是把坏盘拔下来再把新盘当作新的热备盘补进配置里。如果没有热备那么从故障盘报警这一刻起整个阵列就在裸奔每一分钟都是在赌剩余盘不会出问题这种情况必须尽快把新盘插进去。2.2 备件选择SAS盘、SATA盘、还是M.2这一点特别想提醒新人服务器硬盘不是随便拿一块就能用的。HP ProLiant系列服务器常规盘位分2.5寸和3.5寸接口以SAS和SATA为主M.2盘在普通DL机架上通常只用来做启动镜像很少会接到阵列卡上做数据盘。选备件时优先满足几个条件接口类型必须一致SAS盘槽位可以插SATA盘但性能会打折SATA盘槽位插不了SAS盘。容量要么等于原盘要么大于原盘。RAID重建通常要求新盘容量不小于故障盘小容量盘插入后阵列卡会直接拒绝加入。RPM优先一致7200转原盘就别拿万转盘替不是不能用但风扇策略和发热都可能受影响。固件版本不要差太远尤其是HP服务器对原厂盘有一定认证机制杂牌盘或刷过机的盘有时候会出现在Unsupported状态。另外多说一句尽量别去买来路不明的拆机盘或清零盘。服务器硬盘本身就是七成以上的故障来自物理磨损二手盘做备件等于给故障池里再扔一块雷。正规渠道的全新盘价格没贵到无法接受但它提供的稳定性和保修能省掉大量晚上跑机房的痛苦。2.3 先把数据安全边界划清楚换盘前还要确认故障盘上有没有系统分区、交换分区或其他关键数据。RAID阵列下逻辑盘跨越多块物理盘单块物理盘拿下来并不影响数据完整但下面的细节要心里有数如果操作系统装在同一个逻辑盘上而你是从Linux/Windows里直接拔盘务必确保系统不是正在对这块物理盘做大量读写否则触发I/O错误可能导致系统挂起。换盘前最好用监控工具确认逻辑盘当前没有正在执行一致性检查或者扩容任务有的话要等它结束。如果是数据库或虚拟化宿主机建议先在业务低峰期操作并提前和业务负责人打个招呼。这些准备工作做完才算是真正到了可以动手的阶段。3. 实操抽旧盘、插新盘的标准动作HP ProLiant服务器只要不是那种老掉牙的非热插拔机型盘位做得已经足够友好。绝大多数3.5寸和2.5寸热插拔盘位都支持开机状态下直接更换不需要关系统、不需要关电源。但支持热插拔不等于可以随便来动作标准是一样的。3.1 拔盘前的最后30秒检查走到机柜前先找到报警盘的位置。确认前面板这个盘位的Cap LED是琥珀色/红色正常盘是绿色。如果前面板看不出就再执行一次led命令让目标盘闪烁。接下来用一两秒扫一眼旁边盘位的状态。如果发现不止一个盘报警比如RAID 5阵列同时有两块盘亮红灯那就不是换一块盘的事情了逻辑盘大概率已经Offline数据能不能保住都需要专业评估这种场景下不要贸然拔任何一块盘应该先停业务找备份做恢复再让专人处理。3.2 抽盘的正确手法别和托架较劲HP的硬盘托架设计通常是这样的按下卡扣或者扳动拉手硬盘会解锁并自动弹出一小段把手。这时握住把手垂直向后匀速拉出即可。几个要注意的细节拉出来的时候不要左右晃动2.5寸小盘位很容易在抽出时卡住旁边盘位的托架边。遇到托架死活拉不出来的情况绝对不要用硬物撬大概率是背板卡扣没解锁到位重新按压卡扣再试。抽盘时戴好防静电手环或者至少先摸一下机柜金属外壳放掉身体静电。服务器内部对静电尤其敏感尤其是冬天干燥环境手一碰就可能废掉一块健康盘。旧盘抽出来之后不管它还能不能通电都建议在盘体上直接贴标签注明故障盘、日期、机器名、原盘位。别偷懒一块故障盘扔进抽屉里两周后你会认不出它为什么会在那里。3.3 新盘插入方向对了剩下的交给卡新盘拆包后先检查有没有运输损伤再看看接口是不是和原盘一致。装进托架时务必注意托架的左右方向许多新型号托架是防呆设计反了插不进去但有些老款托架硬怼也能怼进去一半最后就是金手指别断。插入时对准盘位导轨轻轻推到底然后把拉手或卡扣复位锁好。如果阵列卡带热插拔检测你在指示灯上会看到新盘从无状态变为绿色或者开始规律闪烁。这里有个几乎所有新手都会问的问题新盘插入后系统里要不要先分区、格式化答案是不要。阵列卡层面的操作和操作系统无关新盘会被识别为Unconfigured Good的裸盘既不需要预先分区也绝不能手动做任何操作否则反而会干扰自动重建。4. 新盘上机后等待重建的正确姿势有位朋友跟我讲过一个经历他换完盘后看系统里没立刻出现新盘的数据以为没识别成功于是把盘又拔了重插结果把重建过程打断第二天到单位发现RAID还在降级。这其实是很多刚接触服务器的人都会有的困惑——新盘插上之后到底发生了什么4.1 自动重建不是格式化是算数据阵列卡检测到插入了一块新的容量等于或大于原故障盘的磁盘后会将其标记为一个未分配的好盘。如果这个阵列的逻辑盘处于Degraded状态阵列卡就会自动启动Rebuild重建过程。重建的核心逻辑是读取同一阵列里其他所有成员盘上对应的数据块通过RAID校验算法算出缺失的那部分数据再写入新盘。这意味着新盘上的数据不是复制来的而是计算出来的。RAID 1就是直接镜像复制RAID 5需要逐块读取所有成员盘的数据并做异或运算RAID 6的校验算法更复杂。这也是为什么阵列卡型号越老、盘容量越大、业务负载越重重建时间就越长的根本原因。4.2 怎么实时跟踪重建进度重建过程中逻辑盘依然在提供读写服务但I/O表现会明显下降。这时不要不断重启服务器去看进度正确做法是用命令跟踪ssacli ctrl slot0 ld all show status ssacli ctrl slot0 pd all show输出里逻辑盘状态会显示Rebuilding物理盘会显示Rebuilding并附带一个百分比进度。如果环境没有命令也可以通过iLO web界面进入Storage页面查看逻辑盘状态页面上能直接看到重建百分比以及预计剩余时间。还有一种情况需要留意如果阵列配置了热备盘并在故障后已经自动触发重建你插的新盘可能并不会立刻重建而是先被看作空闲盘。此时需要在阵列管理软件里把新盘配置为热备盘或者手动指定它加入原阵列。全自动流程只发生在没有热备盘的情况下。4.3 重建时间估算别拿消费级盘的标准算很多人以为一块4TB盘重建也就几十分钟实际完全不是。真实场景里一块4TB SATA盘配P408i阵列卡在线业务负载不高的情况下重建大概需要6到10小时如果业务IO很重阵列卡会自动降低重建优先级拖到一两天也不奇怪。盘容量接口预计重建时间近似1TBSATA 72001-3小时2TBSATA 72003-6小时4TBSATA 72006-12小时8TBSATA12-24小时甚至更久注意这只是经验值实际还要看阵列卡的处理能力、盘是SAS还是SATA、有没有其他IO抢占。重建期间的合理策略是把能延后的业务高峰延后减少系统负载让阵列卡尽快完成计算。5. 重建期的坑和重建完成后的收尾换盘本身五分钟但恰恰是重建期和收尾阶段藏着不少容易被忽略的坑。这些坑平时不显眼踩一次就是事故。5.1 盘位拔错的惨案为什么我用led定位还是出错有一次一个朋友换盘位置定位也做了led也亮了结果拔的时候因为灯光和看错方向把Bay 4的盘拔出而报警盘是Bay 3。拔错之后那台服务器直接进入降级错误盘插入后也出现无法识别场面一度很紧张——因为即使你把热插拔盘插回去阵列卡也可能需要重新识别The drive状态短暂变成Failed或Missing。避免这个问题的最后一招是拔盘前用记号笔或标签在机箱前面板做个物理标记标记位置就是led闪的位置。不要怕多写一个标签这件事的成本几乎是零但防错效果远超人脑记忆。5.2 重建中断会怎样比你想的麻烦重建过程中如果服务器意外断电、无故重启、或者有人手贱把正在重建的盘再拔一次阵列卡会记录一个Rebuild Interrupted事件重新开机后它会接着上次的进度继续但另外产生一个隐患如果重建过程中有另一块盘发生严重坏扇区重建可能直接失败。此时逻辑盘彻底Offline数据恢复只能靠备份。所以重建期间机房电源、空调、散热都要保持稳定。如果有UPS确认UPS电量足够如果没有UPS最好通知相关同事不要在重建期间安排机房断电维护。5.3 新盘状态异常主力战场的三种解法新盘插进去后不一定会老实进入重建常见三种异常现象可能原因处理新盘显示Unconfigured Good但阵列不自动重建有热备盘配置系统认为不需要重建手动将新盘加入原阵列或手动指定为新热备盘新盘显示Failed盘本身故障或背板/线缆接触不良重新插拔一次不行就换一块硬测新盘显示Foreign盘里带有阵列卡识别到的外部RAID元数据用SSA或ssacli执行import foreign config注意别选错盘第三种最常见于拿曾经装过别的主机RAID卡的盘当备件的情况。旧盘上的元数据会让新控制器觉得这个盘属于另一个阵列除非你明确导入否则它不会被自动使用。导入前一定要确认盘里没有重要数据因为导入操作本质上是把它的元数据合并进当前控制器盘上的用户数据会变成不可见。5.4 重建完成不等于万事大吉重建完成后逻辑盘状态恢复为OK此时要做两件事第一清理报警。登录iLO或SSA确认故障事件已经被标记为已处理尤其是Predictive Failure的日志留着会让以后翻日志时混淆视听。第二把故障盘做物理消磁或销毁。服务器硬盘里装的是生产数据直接扔二手回收渠道风险极大。哪怕盘只有4TB里面存的财务表、客户数据一旦泄露后果不止是丢工作的问题。换下来的故障盘如果没有正规销毁渠道至少用物理方式破坏盘片。5.5 重建完成后再主动做一次全阵列巡检这是我个人在实际运维中坚持的做法重建完成并稳定运行一周后对阵列卡做一次完整巡检检查各物理盘的SMART日志、温度、坏道情况同时把阵列卡固件和iLO固件查一遍看有没有必要的安全或稳定性更新。HP的固件更新很频繁尤其是老机器一些重建性能问题或控制器兼容性问题往往会在新固件里被修复。等到这一步也做完一次硬盘更换才算真正画上句号。另外给坚持看到这的人一个实用小建议每次换盘之后把换盘时间、盘位号、盘型号、重建结束时间记到运维文档里。两台机器同时报警、盘序却全乱掉的场景一旦发生这份记录就是你的救命索引。
返回列表