
做存储开局这事儿干过的人都知道最怕的不是设备复杂而是开局前脑子一团乱麻上去就插线、上电、点界面结果配到一半发现端口规划错了、管理IP冲突、时区不对整套配置推倒重来。宏杉MacroSan存储的开局流程在国产存储里属于比较典型的设计控制器的初始化逻辑、存储池的创建方式、主机映射的机制都有它自己的套路。这篇文章就按我实际开局的经验把全过程拆开讲清楚从环境准备到控制器初始化再到存储池、卷映射和外地问题处理一步步说透。1. 开局之前必须做好的三件事很多新手开局翻车问题都出在准备工作上。存储设备不像服务器接上电就能跑它要承担的是后续几年甚至更长时间的数据承载任务开局时的规划直接决定了未来的运维体验。安装文档上往往只写了硬件怎么装、线怎么插但真正决定开局顺利与否的是你在上电之前做了哪些规划和检查。1.1 环境勘察与机柜空间分配先说环境这一块。宏杉存储多数是机架式设备控制柜和扩展柜的尺寸、高度、重量都不一样开局前必须确认机柜里的空间够不够。我见过不止一次设备发货到了现场机柜里没有预留足够U位或者电源插座数量不够导致只能临时调换设备位置非常折腾。机柜空间规划也有一些经验可以参考。控制柜建议放在机柜中下部不要太靠近机柜顶部因为存储的散热风道是前后贯通式的顶上如果有其他设备挡着出风温度会飙升。扩展柜和控制柜之间最好挨着放因为级联线的长度是有限的一般随设备附带的级联线也就一两米柜子隔得太远线就够不着了。电源这块也要提前算清楚。存储设备一般是双电源设计每个电源模块的功率在几百瓦到上千瓦不等控制柜加扩展柜整体功率加起来不是小数字。机柜里的PDU电源分配单元接口数量、总承载功率都要提前核对避免开局之后发现插头不够用或者PDU过载跳闸。建议控制柜的两个电源模块分别接到不同的PDU上最好是接在不同的上游电路这样一路电路检修时存储设备不至于完全断电。接地这块特别容易被忽略。存储设备要求机柜接地良好接地电阻需要符合机房标准否则静电积累、雷击浪涌都可能导致设备异常。虽然听起来是老生常谈但真正在开局时测试过接地的人真不多。1.2 版本信息与出厂配置核对设备开箱之后先别急着上电。第一步是核对设备型号、控制器数量、硬盘数量、版本信息确保和你预期的配置一致。我习惯的做法是先把所有模块的标签看一遍包括控制器模块上的型号标签、硬盘笼里的硬盘编号、电源模块的功率标签拍照片留档。宏杉存储一般会在控制器模块上有管理口有些型号出厂时已经设置了默认管理IP有些则需要通过串口或专门的初始化工具来配置。这个信息在产品手册里会有但实际开局时最好在设备外壳标签上找找许多设备会把默认管理地址直接印在标签上省去翻手册的麻烦。还应该检查一下控制器上的扩展柜连接端口宏杉存储一般是通过专用的级联端口比如Infiniband或者SAS端口连接扩展柜。开局前要确认控制柜和扩展柜之间的级联线已经插好并且记住哪个端口接了哪台扩展柜后续配置时即使出错也能快速定位。1.3 管理网与业务网IP规划这是开局前最重要、也最容易被忽视的一项。存储设备上至少有两类网络一类是管理网用于登录管理界面一类是业务网主机接口用于承接主机业务流量。有些场景还会分独立的带外管理网络。管理网的IP要提前规划好不要临时拍脑袋。建议管理IP和业务IP分属于不同网段尽量不要让管理流量和业务流量混在同一VLAN里否则某个VLAN广播风暴的时候管理界面可能会卡死。有个非常实用的经验把管理IP规划表打印出来贴在机柜门上。表格内容包括每台控制器的管理IP、掩码、网关、对应用途。开局时如果配置到一半网络断开了或者换人了看这张表就能快速恢复上下文比翻聊天记录和笔记高效得多。业务网这块更要仔细。存储控制器的每一个主机接口比如FCoE口、iSCSI口、FC口都建议分配固定IP或WWN并在规划表里标注清楚哪个口接哪台交换机、对端是哪个服务器的哪块HBA卡。开局时如果乱插线后续排查链路故障时就得一根根线去理工作量巨大。提示IP规划表不是只有开局时用。后续扩容、故障替换、链路调整都要参考这张表。开局时多花十分钟把表做好后面能省下一整天。2. 首次上电与控制器初始化前期规划做完就到了上电环节。上电这事看起来简单但顺序错了也可能引出问题。存储设备含有大量硬盘没有正确的上电顺序可能出现硬盘无法识别的情况。2.1 上电顺序与状态检查宏杉存储的上电顺序一般建议是先开扩展柜磁盘柜等磁盘柜稳定后再开控制柜。这样能让控制器上电时就能顺利识别到所有磁盘柜和硬盘。我一开始也不理解为什么要有这个顺序后来琢磨明白了——控制器在启动过程中有一个枚举盘柜和硬盘的过程如果扩展柜没有准备好部分硬盘就可能识别不到报出missing disk之类的告警。上电之后不要马上开始配置。存储设备的启动时间比较长从按下电源到管理界面可以登录反应快的设备也要三到五分钟启动慢的可能要十几分钟。控制器的启动状态可以看面板上的指示灯一般有RUN/ALARM之类的状态灯RUN灯正常闪烁、ALARM灯不亮才说明系统基本起来了。在等待启动的过程中可以顺便检查硬盘状态。硬盘笼上的硬盘指示灯一般是绿色常亮或闪烁如果有黄色或红色告警说明硬盘存在问题。需要注意的是新设备出厂时硬盘是全部安装好的理论上灯的状态应该一致如果出现个别硬盘灯不一致先拍照记录别急着拔插等系统起来后用管理界面的告警信息来判断更准确。2.2 如何正确修改管理IP宏杉存储的管理界面现在一般是基于Web的存储管理平台但在浏览器登录之前你必须先让这台存储有一个能访问的IP。不同型号、不同固件版本的管理IP初始状态不完全一样有的是出厂固定地址有的需要你通过串口或初始化工具分配。最稳妥的办法是先把电脑用网线直连控制器的管理口把电脑的网卡IP配成和存储管理口在同一网段如果存储原来有默认管理IP的话然后打开浏览器尝试访问。如果默认IP被改掉了或者不确定可以使用存储的串口管理方式通过串口线登录命令行在命令行里查看和修改管理IP。修改管理IP之后建议立即验证两点一是用ping命令从电脑侧能通二是Web管理界面能正常登录并显示控制器信息。确认管理IP生效后再做其他配置不要改完IP就继续往下走等发现登录不上了再回头排查很被动。注意修改管理IP时一定要看清楚哪个口是管理口。宏杉控制器的管理口一般会有专门的标识标着MGMT之类。有些存储设备可以配置管理口的IP为DHCP动态获取开局时不建议这样做因为动态IP一旦变化后续管理会非常麻烦。开局阶段一律使用静态IP。2.3 时区、时间与NTP容易被忽略的坑在实际开局中很多人配完管理IP就开始创建存储池完全忽略了系统时间和时区的设置。这个坑埋得很深表面上不影响存储使用但到了排查故障的时候会坑死人。存储设备内部会产生大量日志日志上记录的时间是设备本地时间。如果设备时间和实际时间不一致比如差了8小时或者完全错乱后续分析故障日志时你会发现日志时间线和业务事件对不上排查起来非常费劲。更严重的是如果上了双活、复制等功能时间差太大会直接影响数据一致性校验。所以开局时配完管理IP我建议立即做三件事设置正确的时区国内项目一般是GMT8也就是Asia/Shanghai设置正确的系统时间配置NTP服务器让存储设备能自动对时NTP服务器可以选用机房里已有的NTP服务或者用存储设备可以访问到的公网NTP服务。在内网隔离环境下至少要有内网的NTP源。配置完NTP后过几分钟再查看一下时间同步状态确认没有偏差。3. 存储池创建容量规划与RAID策略选择存储池是宏杉存储的核心概念所有的卷LUN都是从存储池里划分出来的。存储池怎么建、RAID怎么选、热备盘怎么配直接决定了存储系统的可靠性、性能和使用体验。3.1 硬盘分组与RAID级别选型硬盘是存储系统最底层的基础设施。开局时首要任务是根据需求把硬盘分成合适的组然后为每个组选择RAID级别。宏杉存储支持的RAID级别包括RAID 0、1、5、6、10等。不同级别的性能和冗余能力不同RAID 5单盘冗余读性能好写性能需要计算校验建议在有日常备份的情况下使用RAID 6双盘冗余能容忍两块盘同时故障但写性能比RAID 5低一些RAID 10镜像条带性能最高、冗余也最好但空间利用率低只有50%适合核心数据库类应用选型没有绝对的对错关键是看业务需求。我的习惯是核心交易类数据库用RAID 10非核心文件共享用RAID 5归档类数据用RAID 6。第一次开局时拿不准的可以查一下宏杉官方支持矩阵看看不同RAID级别的可用空间计算方法和最大支持硬盘数量按业务需求来倒推。组盘还有一个注意点同一组RAID的硬盘尽量选择同一批次、同样容量的盘。不同容量的盘混在一个RAID组里会按最小容量计算单盘可用空间浪费一部分容量而且后续替换故障盘时如果找不到同容量盘替换会很麻烦。3.2 热备盘与备电模块的检查热备盘是存储系统里非常重要但是容易被忽略的部分。所谓热备盘就是硬盘组之外的备用的硬盘平时不参与业务当组内的某块盘故障时热备盘能自动接管数据重建。在RAID 5或者RAID 6的环境下热备盘能显著缩短数据重建的窗口期。宏杉存储开局时建存储池之前建议先预留一块或两块热备盘。热备盘不是越多越好因为每块热备盘都在占用机箱空间和成本一般单盘容量较大的场景建议配置1块以上全局热备盘。除了热备盘存储控制器上一般还有备电模块BBU——电池备份单元。备电模块的作用是当外部电源突然掉电时给控制器的缓存供电让数据能落盘防止缓存数据丢失。开局时一定要检查备电模块的状态是否正常决不能在备电模块异常的状态下继续配置。如果备电模块没充满电存储控制器可能会把写缓存降为直写模式导致业务性能明显下降。3.3 创建存储池的界面操作与参数解释宏杉存储的Web管理界面中创建存储池一般就是按照新建存储池→选择硬盘→选择RAID级别→确认容量的流程走下来。这个流程看起来简单但有几个参数要仔细理解。首先存储池的命名。建议按业务场景规范命名比如DB_LUNPOOL_01、FILE_STORE_01不要用test1、pool2这种无意义的名字。存储设备可能会服务很多业务如果不规范命名后期创建卷、做映射时根本分不清哪个存储池是给哪个业务用的。其次存储池的容量分配。宏杉存储一般支持在存储池内创建多个卷每个卷可以根据需要设置容量上限也可以设置预分配空间。预分配空间的意思是把存储池里的物理空间预先划分给卷看起来很大实际用了多少是多少。不同业务的卷分配策略不一样数据库类卷建议预留足够空间文件共享类卷则可以考虑按需增长。创建存储池的过程中管理界面会显示预计可用容量、已选择硬盘数量等参数。这里要特别注意一点可用容量不等于硬盘总容量乘以数量RAID校验信息、热备盘、文件系统开销都会占一部分。不要等到创建卷的时候才发现空间不够开局时就要把容量规划做仔细预留至少20%的余量应对后期数据增长。提示大多数SAN存储的卷创建后对主机呈现的容量是裸容量指逻辑单元大小文件系统格式化后实际可用空间会减少。在规划时需要提前预留足够容量否则后期扩容会涉及在线扩容虽然宏杉存储支持在线扩容但扩容后文件系统调整仍是操作步骤较多的任务。4. 卷分配与主机映射把存储用起来存储池和RAID建完之后只是做好了地基。房子要靠卷和主机映射来搭建。主机能不能看到存储、看到之后能不能正常格式化使用都在这一步见分晓。4.1 创建卷的逻辑与性能配置在宏杉存储中卷就是从存储池中划分出的逻辑单元在主机侧看起来就像是一块块磁盘。创建卷时需要在管理界面上指定卷名称、所属存储池、容量大小等参数。创建卷的时候有几个地方值得注意。第一个是条带深度Stripe Size的设置这个参数决定数据在硬盘间分布的基本单位较小的条带深度适合顺序读写较大的条带深度适合随机读写。数据库OLTP场景一般建议较小的条带深度如64KB或128KB视频监控类大文件顺序写场景则可以用较大的条带深度。对于第一次开局如果不确定可以用系统默认值然后根据实际测试结果再调整。第二个是预分配策略。有些场景下存储支持精简配置Thin Provisioning即创建卷时只记录逻辑容量不实际占满物理空间。这种策略的好处是空间利用率高但如果业务实际写入量超过了物理空间可能发生空间不足的情况需要看到存储池告警马上扩容。卷的容量具体怎么设我建议先问清楚业务方业务方对容量要求最清楚同时准备一个容量申请表避免随口报一个数就创建卷事后发现不够用再扩非常被动。4.2 主机映射与多路径搭建创建好卷之后不是主机立刻就能看到的。你需要把卷映射给特定主机告诉存储哪个主机可以访问这个卷。这个过程在宏杉存储里称为主机映射或LUN映射。映射配置里有两个关键概念主机和主机关联的HBA端口。宏杉存储一般允许你去按WWPNFC环境或IQNiSCSI环境来识别主机然后建立映射关系。开局时建议通过主机名来命名映射关系比如WEB_SERVER_01、DB_SERVER_02做到见名知意。映射做完主机侧还需要安装多路径软件如操作系统原生的Device Mapper Multipath或存储厂商自带的多路径组件。多路径的作用是让主机系统把通过多条链路看到的同一块存储盘识别成一台设备并在其中一条链路故障时自动切换到其他链路。宏杉存储的多路径配置在Linux环境下一般需要做以下几步确保主机的HBA驱动正常安装并启动多路径软件服务如multipathd修改多路径配置文件添加宏杉存储设备的识别规则根据实际情况可能需要参考宏杉官方多路径配置手册重新扫描SCSI设备确认能看到多路径设备多路径配置完成后建议在主机的多路径状态下查看一下链路数量和状态。正常情况下应该有两条或更多条正常链路链路状态都是active。如果只有一条active说明另一条链路没起来需要排查光纤线缆、交换机zone配置或iSCSI组网等问题。4.3 主机端识别磁盘与格式化映射配置和多路径搞定后主机系统执行一次SCSI设备重新扫描就能看到新的磁盘设备了。在Linux下可以用fdisk或lsblk命令查看新设备在Windows下可以在服务器管理器里扫描磁盘。识别到磁盘后需要分区、格式化、挂载或Windows下做联机、初始化和分配盘符。这一步看起来是操作系统常规操作但有一个坑值得提醒格式化前一定要确认盘符或设备名对应的是哪块存储卷。如果磁盘设备识别错格式化错了盘数据就没了。我习惯的做法是先用lsblk列出所有磁盘设备的WWNWWID信息再和存储管理界面上卷的WWN一一核对确认无误后再进行格式化。格式化的文件系统选型也有讲究。Linux环境下如果是跑数据库等对性能敏感的应用建议使用XFS它对大容量存储和并发读写的支持比较好。Windows环境下默认用NTFS即可。需要提醒的是不管用什么文件系统格式化后建议马上测试一下读写确认存储链路和数据通路整体正常再让业务方使用。5. 开局过程中那些不致命但特别烦的问题存储开局做了这么多年真正让人头疼的往往不是配置本身而是那些看起来不严重、但是特别耗时间的小问题。在这一节里我把实际开局时常遇到的情况和排查思路整理出来希望你能少走弯路。5.1 管理口连接不上管理口连接不上是开局最常见的故障。场景一般是笔记本电脑网线直连存储管理口浏览器打开管理地址页面转圈半天出不来或者干脆提示无法访问。遇到这种情况第一步不是怀疑设备坏了而是先确认网络层面确认电脑的IP地址和存储管理IP确实在同一个网段确认管理口插的是控制器上正确的管理口有些控制器的网口很多管理口有专门的丝印标识如果电脑有多个网卡比如无线和有线同时开着确认浏览器走的是有线网卡如果这些都正常再看存储设备本身。可以尝试用串口线连接控制器在命令行里查看管理口的IP配置是否正确。宏杉存储一般支持通过串口进入CLI用show之类的命令查看当前IP配置。如果IP配置没问题可以用本地ping回路的方式确认管理口的物理状态是否UP。如果以上都查了还不行一个被低估的原因是浏览器兼容性问题。有些存储管理界面老旧对Chrome最新版本不兼容会出现登录页面能打开但点按钮没反应的情况。遇到这种切换到IE兼容模式或Firefox ESR版本试试往往就好了。5.2 硬盘状态异常与告警误报开局时最怕看到盘柜上某个硬盘指示灯异常。有的是点亮黄色告警有的是硬盘没有被识别到。首先要理解硬盘指示灯的告警不等于硬盘坏了。可能的情况有很多硬盘松动没有插到位硬盘和背板接触不良硬盘固件版本和控制器不兼容在混合批次设备上比较常见硬盘处于异常状态下需要手工复位开局时的硬盘告警如果不是物理性的比如明显是运输途中损坏建议先看看管理界面里对该硬盘的具体描述确认是predictive failure还是media error还是missing disk。不同的告警类型处理的优先级和方式不一样。如果是missing disk大概率是物理连接问题。先把硬盘拔出来检查金手指是否干净再重新插回去。插硬盘的动作要垂直、用力均匀有些硬盘架的卡扣设计比较紧没插到底也会报异常。重新插好后在管理界面里手工扫描磁盘一般能重新识别。如果确实是硬盘硬件故障在热备盘或冗余RAID的保护下系统应该还能正常运行但需要尽快走厂商售后流程更换硬盘。开局时就遇到硬盘故障建议直接报修不要拖延。同时提醒一下更换硬盘时一定要选择同型号、同容量、同固件版本的硬盘混用可能导致RAID重建失败。5.3 控制柜和扩展柜之间的线缆识别宏杉存储控制柜连接扩展柜的线缆一般是专用线缆两端接口有防呆设计插反了插不进去。但线比较多的情况下很容易搞混哪根线接的是哪个扩展柜的哪个端口。我一般在上电之前会拿标签纸把每一根线缆两端都贴上编号比如EXP-1-A表示扩展柜1的A端口。这样的好处是后续出现盘柜识别异常时可以快速定位到具体的物理连接。还有一个容易踩的坑控制柜和扩展柜之间的级联线有方向要求不同存储设备对线缆两端的连接位置可能有限制比如从控制柜的Port A出必须接扩展柜的In端口。如果线缆接反了有的设备会自动纠错有的不会遇到识别不到扩展柜的情况先检查线缆两端的接入端口是否和规划一致。上电后发现扩展柜识别不到常见原因包括扩展柜没上电扩展柜电源没开级联线松动或损坏换一根线试试扩展柜上的端口指示灯异常常灭可能说明端口或线缆故障控制器的扩展端口未使能部分设备需要在管理界面手动使能排查顺序建议从物理层往上查先看电源再看线缆物理连接最后看控制器配置。5.4 主机与存储之间的链路异常处理我遇到过一种很常见的情况存储配置完全正确主机侧多路径软件也看到了链路但业务访问存储时性能极差或者频繁报I/O超时。这种问题大概率不在存储配置上而在链路质量上。FC链路下检查光模块的光功率是否在正常范围内。光模块用过一段时间后光功率可能会下降一旦低于设备接收灵敏度阈值就会产生大量链路错误表现为时好时坏。iSCSI链路下检查交换机的端口统计看有没有大量CRC错误包、丢包、重传。这些统计在交换机上很容易看到是排查链路质量的第一手资料。链路异常还可能是交换机zone配置问题。FC交换机如果zone没有配置完整会导致主机无法看到存储的端口或者看到了一部分端口但另一部分链路不通。开局时建议把所有涉及到的FC交换机的zone配置导出来核对一遍确认每个主机都能访问到宏杉存储所有应该访问的控制器端口包括控制器的两个控制器各自的主机端口。6. 开局之后的运维余项与收尾建议开局配置完成业务正常跑起来了很多人的第一个念头是总算结束了可以放松了。以我的经验开局完成之后还有几件事应该顺手做完否则后面会以各种形式给你添堵。6.1 告警通知与日志检查配置存储设备是7x24小时运行的时代不可能等你发现故障了才去处理。宏杉存储的管理界面一般支持配置告警通知比如通过SNMP或邮件通知开局时应该花几分钟把告警通知配置好确保设备出现问题时第一时间知道。SNMP告警配置一般有两种方式第一种是存储端作为SNMP agent把告警主动发送给监控系统比如Zabbix、Nagios第二种是监控系统定期去存储设备上轮询状态SNMP walk。具体哪种方式要看你们机房里的监控系统支持情况。不管哪种开局时都要确认监控系统能收到测试告警而不是配完就不管了。除了告警日志服务也需要确认一下。存储设备产生大量日志建议开启远程日志功能把日志实时转发到日志服务器或者至少定期导出。这样一旦存储出问题能结合系统日志排查根因而不只是靠猜。6.2 开局资料的整理与验收最后一步把所有开局过程中的文档整理归档。包括规划表IP规划表、端口规划表、存储池规划表配置截图管理界面配置、存储池、卷、映射关系尤其是配置参数和告警状态验收单记录实际配置与规划要求的差异业务方确认签字这份文档的意义在于将来任何人接手不需要重新摸一遍设备就能快速了解环境。而且存储设备生命周期很长几年后扩容时这份文档就是最可靠的参考。6.3 个人经验与补充提醒做存储开局这些年我总结出一条核心经验存储开局最大的敌人不是技术难度而是差不多就行的心态。IP地址规划差不多、时区时间差不多、热备盘配差不多、主机映射命名差不多这些差不多积累到最后就是线上故障时找不到原因。再分享一个小技巧宏杉存储配置完成后如果条件允许做一次整机重启验证。很多问题比如某块盘启动顺序、某个端口使能状态只有在重启后才会暴露出来。开局时做一次重启验证比业务正式上线后被迫重启要安全得多。存储开局是一次性的工作但开局留下的配置和管理习惯会陪伴设备整个生命周期。把每一处细节都做仔细后面几年都会受益。