ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

影刀RPA实操指南:小红书店铺后台数据导出——笔记带货数据报表

影刀RPA实操指南:小红书店铺后台数据导出——笔记带货数据报表 影刀RPA实操指南小红书店铺后台数据导出——笔记带货数据报表小红书店铺后台的笔记带货数据只能一页一页点、一格一格抄运营每天光整理报表就要花掉一个小时而且月末对账时手抄数据还容易错位。我自己的做法是用影刀RPA把这件事彻底自动化每天早上登录后台、进数据页、逐条抓取笔记曝光、点击、成交写入Excel生成日报全程不用人守着。这篇文章把我实操两年踩过的坑一次讲清楚非技术出身也能照着做出来。先说结论小红书店铺后台是标准的网页应用用影刀RPA做数据导出非常合适核心链路就四步——打开网页、定位元素、循环提取、写入表格。难点不在会不会做而在元素定位怎么选、登录态怎么保、翻页怎么处理。我在最开始做这个流程时最大的问题不是不会写而是定位方式乱选一会儿用默认捕获一会儿手写XPath页面一改版整个流程就瘫痪。所以下文我会把定位方法放在最前面讲这是整个流程能不能稳定跑下去的根。下载安装与浏览器插件跑通环境是前提如果你还没装影刀RPA去官网下载安装包Windows系统直接下一步装完。装完后必须再装浏览器插件编辑器右上角设置里找到浏览器扩展入口给Chrome装上影刀插件并保持启用状态。没有插件网页自动化指令全部会报找不到浏览器之类的错误这是新手第一个坑。我建议Chrome版本不要太旧插件装好后重启一次浏览器再回来操作。登录态这块用浏览器Profile最省事先用影刀打开的浏览器手动登录小红书商家后台一次Cookie会留在Profile里之后流程启动直接就是已登录状态不用每次扫码。元素定位四合一XPath与CSS怎么选小红书后台的报表元素class名是哈希串页面一更新就变所以稳定定位基本靠XPath的语义写法。影刀里捕获元素后会自动生成选择器你可以在元素编辑器里手动改成XPath这是保证流程抗改版的关键动作。给你几个我自己在后台数据页实测用过的写法参考着改成你页面的实际结构# 捕获元素数据报表里的表格行每行一条笔记数据 //table//tr[contains(class,row)] # 捕获元素某一行的曝光量单元格第2列 //table//tr[2]/td[2] # 模糊匹配通过列头文字找到成交金额所在列的表头 //*[contains(text(),成交金额)] # 参照物定位通过曝光量文字定位到同一行的数据单元格 //*[contains(text(),曝光量)]/following-sibling::td[1]CSS选择器适合结构简单、class稳定的场景写法短、执行快比如td:nth-child(2)取第二列。但小红书这种class带随机串的后台页面CSS一改版就废我的选型原则是对外部网站XPath优先对内部结构固定的页面CSS够用。正则表达式在第三层起作用抓出来的文本经常带1,234.56元这种格式用正则把数字抠出来再入库后面做汇总才不会报错。XPath、CSS、正则、默认捕获这四样就是定位的全部掌握前三样够用百分之九十的场景。变量类型与循环提取把报表逐行抠下来定位做完后进入提取环节。影刀RPA里变量类型不复杂但用错会直接报错数字、字符串、列表、字典四类抓出来的单元格内容默认是字符串1,234.56想参与计算得先转成数字。批量提取用【获取相似元素列表(web)】指令捕获一行笔记数据的元素后它会返回页面上所有同结构行的列表再配合获取元素文本内容把每行的曝光、点击、成交逐项读出来。循环用【For次数循环】配合下标取列表项官方文档专门讲过这个方案——直接用相似元素循环在页面局部刷新时会丢项用次数循环每次循环内重新获取列表更稳。这里我用一段Python示例展示两个列表按下标配对提取# 输入exposure_list曝光量列表、click_list点击量列表两个列表长度相同# 输出rows二维列表每行是一组笔记数据rows[]foriinrange(len(exposure_list)):exposureexposure_list[i].replace(,,)# 去掉千分位逗号1,234变1234clickclick_list[i].replace(,,)ifexposure.isdigit():# 过滤掉空值和-占位符ctrround(int(click)/int(exposure)*100,2)# 算点击率保留2位小数else:ctr0rows.append([exposure,click,str(ctr)%])# 拼成一行数据这段逻辑放在Python节点的def函数里封装好主流程只调一次是我推荐的做法。两个列表长度不一致时按下标关联会取错数据提取前先判断长度是否相等这是官方文档里点名的坑。数据写入与处理从数据表格到Excel抓到的数据我建议先写入影刀的【数据表格】再一次性落到Excel比逐行写快得多。落表用【打开/新建Excel】指令创建文件把二维列表一次性写入区域最后【关闭Excel】时记得保存。数据清洗在写入前后各做一次写入前把千分位、百分号、货币符号去掉写入后用【读取Excel内容】把整表读出来核对行数行数对不上说明有数据页没抓全。数据特征处理方式千分位1,234replace去逗号再转数字百分号3.5%去百分号数值÷100空值或-填0并记日志日期文本统一转成yyyy-MM-dd格式按日期给文件命名也是个实用技巧文件名里带上当天日期一个月跑下来就是30份自动归档的报表月末不用再手工补历史数据。流程控制与异常处理让流程夜跑不中断流程控制就三样If条件判断、循环、Try-Catch。判断是否有数据用If判断列表长度是否大于0翻页用循环配合下一页按钮的可用状态判断按钮变灰说明到底了。异常处理一定要加。把主体抓取逻辑放进Try块Catch块里用【打印日志】把报错信息和当前日期记下来Finally块放清理动作比如关闭多余的弹窗。官方的异常处理结构是Try、Catch、Finally、End Try四段Finally可缺省但我建议保留。小红书后台偶尔会弹出验证码或登录失效窗口这类情况程序自己处理不了正确做法是Catch里判断元素发现验证码就通过群机器人发消息通知人工处理而不是让流程硬等超时。我第一次夜跑就是没做这个判断卡了四十分钟白跑一晚。鼠标键盘与图像自动化应对抓不动的控件报表页面大部分操作用元素定位就能完成但总有控件是抓不到元素的比如某些自绘的下拉框。这时候用【键盘输入】指令发送快捷键比模拟鼠标点击更稳官方文档也推荐优先用键盘操作替代点击。图像识别做兜底影刀的等待图像出现和点击图像指令靠截图匹配适合元素定位完全失效的控件。但图像匹配对分辨率敏感我专门因为换了显示器导致图像定位全失败过所以图像方案只做兜底不做主力。鼠标操作注意模拟模式与驱动模式的区别驱动模式更接近真实输入能过一些风控检测普通网页用默认模拟模式即可个别顽固控件切换驱动模式再试。平台实战对比小红书与拼多多后台的差异同一套思路可以直接迁移到其他平台我拿拼多多后台做过对照拼多多的推广报表同样是表格结构但它是SPA单页应用切菜单不会整页刷新所以提取前必须用【等待网页加载完成】加等待元素出现双保险否则会抓到上一页的残留数据。淘宝系后台的坑在于弹性加载一页显示50条但页面代码里可能只渲染了16条需要边滚动边等加载官方文档给的方案是滚动后判断元素数量是否变化不再增加才算加载完。对比项小红书后台拼多多后台淘宝系后台页面类型传统表格页单页应用弹性加载关键等待等元素出现加载完成等元素滚动判断数量| 主要风险 | 登录失效 | 局部刷新残留 | 懒加载漏抓 || 定位首选 | 语义XPath | 语义XPath | 相对XPath |多平台批量采集时建议把每个平台做成独立子流程公共的清洗、落表逻辑抽成通用子流程复用这套打法我在多个店铺项目里都在用。系统联动报表自动发到飞书和邮箱报表生成后别让它在硬盘里睡大觉。影刀有现成的【发送邮件】指令SMTP服务器下拉支持163、126、QQ等常用邮箱需要配置授权码而不是登录密码这是第一次配置最容易搞错的地方。即时通知用群机器人飞书群机器人、企业微信群机器人都支持Webhook方式推送把日报的汇总数字当天总曝光、总成交、异常条数拼成一段文本发进运营群老板和同事第一时间能看到。联动方式适用内容配置要点发送邮件完整Excel报表SMTP授权码勿用密码飞书机器人文字摘要告警Webhook地址企微机器人运行报错通知支持格式化文本定时计划任务每日自动跑应用需先发版定时运行要注意两点应用必须先发版才能添加到计划任务这是官方明确说明的另外Windows自动锁屏或待机会导致计划任务不执行要在电源设置里关闭睡眠我在这上面浪费过一整个周末排查。工程化规范子流程拆分与调试习惯流程写完能跑只是及格线能长期稳定跑才叫完工。我的拆分习惯是三层主流程只做调度“登录态管理”“数据提取”报表生成各做成子流程子流程之间用输入输出参数传数据。调试时多用断点在可疑指令前右键打断点流程会停在断点处看左侧变量面板里每个变量的实际值比凭空猜快十倍。变量值不对时先【打印日志】打印出来看看很多报错本质是列表被当成了字符串用官方文档里Can not convert Array to String这个高频报错就是典型。命名规范也简单说一句子流程用编号前缀加功能名比如01_登录管理“02_数据提取”几十个流程的项目里一眼能看出执行顺序这是我吃过乱命名苦头后的固定习惯。易错速查表出问题先对着查报错/异常现象常见原因解决方法找不到浏览器/元素插件未启用或未装重装扩展并重启浏览器Can not convert Array to String列表直接填进文本框转字符串或按下标取项抓到的数据是空的页面未加载完就提取加等待元素出现定时任务没跑应用未发版或电脑休眠先发版关闭系统睡眠提取行数比页面少懒加载未完成滚动后判断数量再提取图像定位全部失效分辨率或缩放变了重新截取参照图学习资源与延伸阅读官方文档里的网页自动化FAQ和数据抓取案例篇值得通读一遍比我上面写的还要细遇到诡异问题优先翻官方FAQ。另外我把这个流程的可复用模板、XPath写法和踩坑笔记整理在自己的代码仓库里了地址是 home.linyan.cloud 里面有这套小红书日报流程的完整版本可以下载后直接改成你自己的账号跑。如果你刚接触影刀RPA建议先把这个流程做出来再谈进阶一个小而完整的项目比看十个教程都有用。数据导出这件事一旦自动化你每天省下的那一小时才是RPA给你的真实回报。#影刀RPA #RPA自动化 #小红书数据采集 #笔记带货数据 #电商自动化作者林焱
返回列表