
试验参数【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/geALLOW_HF32该参数预留当前版本暂不支持。是否启用HF32自动代替float32数据类型的功能当前版本该参数仅针对Conv类算子与Matmul类算子生效。此参数实际对应的options参数为ge.exec.allow_hf32。HF32是昇腾推出的专门用于算子内部计算的单精度浮点类型与其他常用数据类型的比较如下图所示。可见HF32与float32支持相同的数值范围但尾数位精度11位却接近FP1610位。通过降低精度让HF32单精度数据类型代替原有的float32单精度数据类型可大大降低数据所占空间大小实现性能的提升。参数取值true针对Conv类算子与Matmul类算子开启FP32数据类型自动转换为HF32数据类型的功能。具体涉及哪些算子请参见CANN软件安装后文件存储路径的opp/built-in/op_impl/ai_core/tbe/impl_mode/allow_hf32_matmul_t_conv_t.ini该文件不支持用户修改。false针对Conv类算子与Matmul类算子关闭FP32数据类型自动转换为HF32数据类型的功能。具体涉及哪些算子请参见CANN软件安装后文件存储路径的opp/built-in/op_impl/ai_core/tbe/impl_mode/allow_hf32_matmul_f_conv_f.ini该文件不支持用户修改。**参数默认值**针对Conv类算子默认开启FP32到HF32的转换针对Matmul类算子默认关闭该转换功能。使用约束针对同一个算子如果通过OP_PRECISION_MODE参数配置了enable_hi_float_32_execution或enable_float_32_execution该场景下不建议再与ALLOW_HF32参数同时使用若同时使用则优先级如下OP_PRECISION_MODE(ByNodeName按节点名称设置精度模式) ALLOW_HF32 OP_PRECISION_MODE(ByOpType按算子类型设置精度模式)。由于ALLOW_HF32是使用HF32自动代替float32要想该参数生效必须保证被涉及算子的输入或者输出类型为float32。由于PRECISION_MODE_V2参数默认值为fp16原始网络模型中算子类型为float32时会被强制转为float16类型该场景下使用ALLOW_HF32参数不生效建议修改PRECISION_MODE_V2参数值为originPRECISION_MODE参数默认值为force_fp16建议修改为must_keep_origin_dtype或者force_fp32。配置示例{ge::ir_option::ALLOW_HF32, true}产品支持情况Ascend 950PR/Ascend 950DT支持Atlas A3 训练系列产品/Atlas A3 推理系列产品支持Atlas A2 训练系列产品/Atlas A2 推理系列产品支持Atlas 200I/500 A2 推理产品不支持Atlas 推理系列产品不支持Atlas 训练系列产品不支持IPV350不支持OO_CONSTANT_FOLDING调试功能扩展参数当前不支持应用于商用产品中后续版本会作为正式功能更新发布。是否开启常量折叠优化。此参数实际对应的options参数为ge.oo.constantFolding。常量折叠是将计算图中可以预先确定输出值的节点替换成常量并对计算图进行一些结构简化的操作。参数取值true默认值开启。false关闭。配置示例{ge::ir_option::OO_CONSTANT_FOLDING, true}产品支持情况全量芯片支持。OO_DEAD_CODE_ELIMINATION调试功能扩展参数当前不支持应用于商用产品中后续版本会作为正式功能更新发布。是否开启死边消除优化。此参数实际对应的options参数为ge.oo.deadCodeElimination。死边消除switch死边消除switch的pred输入1号输入为const节点时根据const的值消除其中一条分支const为true时消除false分支const为false时消除true分支。参数取值true默认值开启。false关闭。配置示例{ge::ir_option::OO_DEAD_CODE_ELIMINATION, true}产品支持情况全量芯片支持。OO_LEVEL调试功能扩展参数当前不支持应用于商用产品中后续版本会作为正式功能更新发布。图编译多级优化选项包括子图优化、整图优化、静态Shape模型下沉等。此参数实际对应的options参数为ge.oo.level。静态Shape模型下沉静态Shape模型在编译时即可确定所有算子的输入输出Shape完成模型级内存编排、算子的Tiling计算等Host侧计算在模型加载时整体下发到Device流上但不立即执行通过下发模型执行Task触发模型中所有Task的执行。参数取值O1会关闭所有图融合和UB融合Pass只做促成静态下沉的相关优化如InferShape进行输出Tensor的shape推导、常量折叠、死边消除等。Ascend 950PR/Ascend 950DT不支持UB融合只关闭图融合Pass。O3默认值开启所有优化。使用约束取值为O1时会关闭所有图融合和UB融合PASS只开启静态下沉的相关PASS但是如下路径文件中的图融合PASS由于关闭后会有功能问题会默认开启${INSTALL_DIR}/_arch_-linux/lib64/plugin/opskernel/fusion_pass/config/fusion_config.json文件中ExceptionalPassOfO1Level字段下的所有图融合PASS。其中${INSTALL_DIR}请替换为CANN软件安装后文件存储路径。以root用户安装为例安装后文件默认存储路径为/usr/local/Ascend/cann。arch表示具体操作系统架构。配置示例{ge::ir_option::OO_LEVEL, O3}产品支持情况全量芯片支持。TUNE_DEVICE_IDS当前版本暂不支持。【免费下载链接】geGEGraph Engine是面向昇腾的图编译器和执行器提供了计算图优化、多流并行、内存复用和模型下沉等技术手段加速模型执行效率减少模型内存占用。 GE 提供对 PyTorch、TensorFlow 前端的友好接入能力并同时支持 onnx、pb 等主流模型格式的解析与编译。项目地址: https://gitcode.com/cann/ge创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考