ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

CANN/ge图编译调试参数

CANN/ge图编译调试参数 功能调试【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/geDEBUG_DIR用于配置保存算子编译生成的调试相关的过程文件的路径过程文件包括但不限于算子.o算子二进制文件、.json算子描述文件、.cce等文件。此参数实际对应的options参数为ge.debugDir。默认生成在当前路径下。使用约束如果要自行指定算子编译的过程文件存放路径需DEBUG_DIR参数与OP_DEBUG_LEVEL参数配合使用且当OP_DEBUG_LEVEL取值为0时不能使用DEBUG_DIR参数。算子编译生成的调试文件存储路径除DEBUG_DIR参数设置的方式外还可以配置环境变量ASCEND_WORK_PATH几种方式优先级为配置参数“DEBUG_DIR”环境变量ASCEND_WORK_PATH 默认存储路径。关于环境变量ASCEND_WORK_PATH的详细说明请参见《环境变量参考》。配置示例{ge::ir_option::OP_DEBUG_LEVEL, 1}, {ge::ir_option::DEBUG_DIR, /home/test/module/out_debug_info}产品支持情况全量芯片支持。OP_DEBUG_LEVEL算子编译debug功能开关。此参数实际对应的options参数为ge.opDebugLevel。如果要自行指定算子编译的过程文件存放路径则需要通过DEBUG_DIR参数指定OP_DEBUG_LEVEL取值为0时使用DEBUG_DIR参数不生效。参数取值0默认值不开启算子debug功能在当前执行路径不生成算子编译目录kernel_meta。1开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹下生成*.o算子二进制文件、*.json文件算子描述文件和TBE指令映射文件算子cce文件*.cce和python-cce映射文件*_loc.json用于后续分析AICore Error问题。Ascend 950PR/Ascend 950DT不会生成TBE指令映射文件。2开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹下生成*.o算子二进制文件、*.json文件算子描述文件和TBE指令映射文件算子cce文件*.cce和python-cce映射文件*_loc.json用于后续分析AICore Error问题同时设置为2还会关闭编译优化开关、开启ccec调试功能ccec编译器选项设置为-O0-g。Ascend 950PR/Ascend 950DT不会生成TBE指令映射文件。3不开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹中生成*.o算子二进制文件和*.json文件算子描述文件分析算子问题时可参考。4不开启算子debug功能在当前执行路径生成kernel_meta文件夹并在该文件夹下生成*.o算子二进制文件、*.json文件算子描述文件、TBE指令映射文件算子cce文件*.cce和UB融合计算描述文件{$kernel_name}_compute.json可在分析算子问题时进行问题复现、精度比对时使用。Ascend 950PR/Ascend 950DT不会生成TBE指令映射文件和UB融合计算描述文件。[!NOTE]说明若OP_DEBUG_LEVEL配置为0同时配置了OP_DEBUG_CONFIG参数该场景下在当前执行路径会保留算子编译目录kernel_meta。若OP_DEBUG_LEVEL配置为0同时设置了NPU_COLLECT_PATH环境变量则会始终保留编译目录kernel_meta若设置了ASCEND_WORK_PATH环境变量则保留在该环境变量指定路径下若无ASCEND_WORK_PATH环境变量则保留在当前执行路径。训练执行时建议配置为0或3。如果需要进行问题定位再选择调试开关选项1和2是因为加入了调试功能会导致网络性能下降。配置为2即开启ccec编译选项时会导致算子Kernel*.o文件大小增大。动态Shape场景下由于算子编译时会遍历可能的Shape场景因此可能会导致算子Kernel文件过大而无法进行编译此种场景下建议不要配置ccec编译选项。 由于算子Kernel文件过大而无法编译的报错日志示例如下message:link error ld.lld: error: InputSection too large for range extension thunk ./kernel_meta_xxxxx.odebug功能开关打开场景下若模型中含有如下通算融合算子算子编译目录kernel_meta中不会生成下述算子的*.o、*.json、*.cce文件。MatMulAllReduceMatMulAllReduceAddRmsNormAllGatherMatMulMatMulReduceScatterAlltoAllAllGatherBatchMatMulBatchMatMulReduceScatterAlltoAll配置示例{ge::ir_option::OP_DEBUG_LEVEL, 1}产品支持情况全量芯片支持。OP_DEBUG_CONFIGGlobal Memory内存检测功能开关。此参数实际对应的options参数为op_debug_config。参数取值取值为.cfg配置文件路径配置文件内多个选项用英文逗号分隔oom算子执行过程中检测Global Memory是否内存越界。配置该选项算子编译时在当前执行路径算子编译生成的kernel_meta文件夹中保留.o算子二进制文件和.json文件算子描述文件。使用该选项后在算子编译过程中会加入如下的检测逻辑用户可以通过再使用dump_cce参数在生成的.cce文件中查看如下的代码。inline __aicore__ void CheckInvalidAccessOfDDR(xxx) { if (access_offset 0 || access_offset access_extent ddr_size) { if (read_or_write 1) { trap(0X5A5A0001); } else { trap(0X5A5A0002); } } }dump_cce算子编译时在当前执行路径算子编译生成的kernel_meta文件夹中保留算子cce文件*.cce以及.o算子二进制文件和.json文件算子描述文件。dump_loc算子编译时在当前执行路径算子编译生成的kernel_meta文件夹中保留python-cce映射文件*_loc.json以及.o算子二进制文件和.json文件算子描述文件。ccec_O0算子编译时开启ccec编译器选项-O0配置该选项不会对调试信息执行优化操作用于后续分析AI Core Error问题。ccec_g算子编译时开启ccec编译器选项-g配置该选项会对调试信息执行优化操作用于后续分析AI Core Error问题。check_flag算子执行时检测算子内部流水线同步信号是否匹配。配置该选项算子编译时在当前执行路径算子编译生成的kernel_meta文件夹中保留.o算子二进制文件和.json文件算子描述文件。使用该选项后在算子编译过程中会加入如下的检测逻辑用户可以通过再使用dump_cce参数在生成的.cce文件中查看如下的代码。set_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID0); set_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID1); set_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID2); set_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID3); .... pipe_barrier(PIPE_MTE3); pipe_barrier(PIPE_MTE2); pipe_barrier(PIPE_M); pipe_barrier(PIPE_V); pipe_barrier(PIPE_MTE1); pipe_barrier(PIPE_ALL); wait_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID0); wait_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID1); wait_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID2); wait_flag(PIPE_MTE3, PIPE_MTE2, EVENT_ID3); ...实际执行推理过程中如果确实存在算子内部流水线同步信号不匹配则最终会在有问题的算子处超时报错并终止程序报错信息示例为Aicore kernel execute failed, ..., fault kernel_name算子名,... rtStreamSynchronizeWithTimeout execute failed....配置示例{ge::ir_option::OP_DEBUG_CONFIG, /root/test0.cfg}其中test0.cfg文件信息为op_debug_configccec_g,oom使用约束算子编译时如果用户不想编译所有AI Core算子而是指定某些AI Core算子进行编译则需要在上述test0.cfg配置文件中新增OP_DEBUG_LIST字段算子编译时只编译该列表指定的算子并按照OP_DEBUG_CONFIG配置的选项进行编译。OP_DEBUG_LIST字段要求如下支持指定算子名称或者算子类型。算子之间使用英文逗号分隔若为算子类型则以OpType::TypeName格式进行配置支持算子类型和算子名称混合配置。要编译的算子必须放在OP_DEBUG_CONFIG参数指定的配置文件中。配置示例如下test0.cfg文件中增加如下信息op_debug_configccec_g,oom op_debug_listGatherV2,opType::ReduceSum模型编译时_GatherV2,ReduceSum_算子按照ccec_g,oom选项进行编译。[!NOTE]说明开启ccec编译选项的场景下即ccec_O0、ccec_g选项会增大算子Kernel*.o文件的大小。动态shape场景下由于算子编译时会遍历可能存在的所有场景最终可能会导致由于算子Kernel文件过大而无法进行编译的情况此种场景下建议不要开启ccec编译选项。 由于算子kernel文件过大而无法编译的日志显示如下 message:link error ld.lld:error: InputSection too large for range extension thunk./kernel_meta_xxxxx.o:(xxxx)ccec编译器选项ccec_O0和oom不能同时开启可能会导致AICore Error报错报错信息示例如下...there is an aivec error exception, core id is 49, error code 0x4 ...若配置NPU_COLLECT_PATH环境变量不支持打开“检测Global Memory是否内存越界”的开关OP_DEBUG_CONFIG指定的配置文件中配置oom否则编译出来的模型文件或算子kernel包在使用时会报错。配置编译选项oom、dump_cce、dump_loc时若模型中含有如下通算融合算子算子编译目录kernel_meta中不会生成下述算子的*.o、*.json、*.cce文件。MatMulAllReduceMatMulAllReduceAddRmsNormAllGatherMatMulMatMulReduceScatterAlltoAllAllGatherBatchMatMulBatchMatMulReduceScatterAlltoAll产品支持情况全量芯片支持。OPTION_SCREEN_PRINT_MODE控制图编译过程是否打屏。此参数实际对应的options参数为ge.screen_print_mode。参数取值enable打屏默认为enable。disable不打屏。配置示例{ge::ir_option::OPTION_SCREEN_PRINT_MODE, disable}产品支持情况全量芯片支持。OPTION_EXPORT_COMPILE_STAT配置图编译过程中是否生成算子融合信息包括图融合和UB融合的结果文件fusion_result.json。此参数实际对应的options参数为ge.exportCompileStat。该文件用于记录图编译过程中使用的融合规则而精度比对中的FUSION_SWITCH_FILE参数可以关闭指定的融合规则关闭的融合规则不会在fusion_result.json文件中呈现文件中session_and_graph_id_xx_xx表示融合结果所属线程和图编号。graph_fusion表示图融合。ub_fusion表示UB融合Ascend 950PR/Ascend 950DT不支持UB融合不会生成该信息。match_times表示图编译过程中匹配到的融合规则次数。effect_times表示实际生效的次数。repository_hit_times优化UB融合知识库命中的次数Ascend 950PR/Ascend 950DT不支持UB融合不会生成该信息。参数取值0不生成算子融合信息结果文件。1默认值程序运行正常退出时生成算子融合信息结果文件。2图编译完成时生成算子融合信息结果文件。即如果图编译已完成后续程序提前中断也会生成算子融合信息结果文件。[!NOTE]说明若未设置ASCEND_WORK_PATH环境变量结果文件默认生成在执行脚本的当前路径若设置了ASCEND_WORK_PATH环境变量则保存路径为$ASCEND_WORK_PATH/FE/${进程号}/fusion_result.json。环境变量详细说明请参见《环境变量参考》。通过FUSION_SWITCH_FILE参数关闭的融合规则不会在fusion_result.json文件中呈现。配置示例{ge::ir_option::OPTION_EXPORT_COMPILE_STAT, 1}产品支持情况全量芯片支持。【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表