
AI 技能AI 插件人工智能工作流自动化【免费下载链接】awesome-claude-skillsA curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows项目地址https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills点击查看免费下载本文基于当前仓库中 composio-skills/apify-automation/SKILL.md 编写完整讲解如何在 Claude Code 中通过 Composio 的 Apify 集成以自然语言同步/异步运行 Apify Actor、管理数据集、创建可复用抓取任务并排查运行日志。读完本文你将掌握全部 6 类核心工作流、11 个工具插槽Tool Slug的准确语义、关键参数取值以及避免抓取任务失败的高频踩坑清单并了解该 Skill 在 awesome-claude-skills 仓库中的定位与运行机制。Skill 定位一份开箱即用的 Apify 自动化操作手册在 awesome-claude-skills 仓库中README.md 将composio-skills/目录定义为通过 Rube MCPComposio为 78 个 SaaS 应用提供的预构建工作流 Skill每个 Skill 都包含工具序列tool sequences、参数指引、已知陷阱known pitfalls和速查表并且全部使用从 Composio API 发现的真实工具插槽命名。apify-automation正是其中的一份独立 Skill。从 SKILL.md 的 YAML frontmatter 可以看出其标准结构name:Apify Automation—— Skill 的标识名description: 一句话描述能力范围——自动化 Apify 的网页抓取与数据抽取运行 Actor、管理数据集、创建可复用任务、检索爬取结果requires.mcp:rube—— 声明该 Skill 依赖名为rube的 MCP 服务器。这与 README 中描述的 Claude Skills 加载机制一致会话启动时 Agent 只看到 Skill 的名称与描述约 100 tokens只有当任务与 Skill 相关时才会加载完整正文。因此这份 SKILL.md 本身就是给 Agent 在需要抓取网页数据时按需调用的操作手册无需把全部抓取知识常驻上下文。环境准备接入 Rube MCP 并连接 Apify 账户根据 SKILL.md 的 Setup 章节使用该 Skill 只需三步添加 Composio MCP 服务器在客户端配置中加入https://rube.app/mcp作为 MCP 服务器地址无需预置 API Key添加后即可工作。连接 Apify 账户触发连接后Agent 会返回一个授权链接authentication link按提示完成 Apify 账户授权即可。挑选 Actor在 Apify 的 Actor 商店中浏览可用的 Actor。每个 Actor 都有自己独有的输入 schema——运行前务必查看该 Actor 的文档确认字段名后再构造输入。对于连接状态的确认可以参考同目录下 composio-skills/geoapify-automation/SKILL.md 给出的通用 Rube MCP 工作模式作为对该 Skill 的底层机制补充用RUBE_SEARCH_TOOLS搜索当前可用的工具插槽与输入 schema工具 schema 会随 API 演进不要硬编码工具名或参数用RUBE_MANAGE_CONNECTIONS传入toolkits: [apify]检查连接状态若未显示ACTIVE则跟随返回的授权链接完成配置用RUBE_MULTI_EXECUTE_TOOL执行具体工具且调用时即使无额外上下文也要带上memory参数可为空{}在同一工作流内复用session_id新工作流则生成新的会话 ID。这套先发现工具、再检查连接、最后执行的节奏与本 Skill 中每个工作流的使用方式是吻合的。核心工作流一同步运行 Actor 并直接获取结果工具APIFY_RUN_ACTOR_SYNC_GET_DATASET_ITEMS该工具在一次调用内完成运行 Actor 立即返回数据集条目适合快速抓取任务。关键参数如下参数说明actorId必填Actor ID格式为username/actor-name例如compass/crawler-google-placesinputJSON 输入对象必须匹配该 Actor 的 schema每个 Actor 字段名不同以 Actor 商店页文档为准limit最多返回的条目数offset分页跳过的条目数format输出格式json默认、csv、jsonl、html、xlsx、xmltimeout运行超时时间秒waitForFinish最大等待时间范围 0–300 秒fields逗号分隔的字段白名单omit逗号分隔的字段黑名单典型用法示例自然语言提示Run the Google Places scraper for restaurants in New York and return the first 50 results即运行 Google Places 抓取器抓取纽约的餐厅并返回前 50 条结果。需要注意waitForFinish上限为 300 秒5 分钟超过此耗时的任务应改用异步工作流见下节。核心工作流二异步运行 Actor工具APIFY_RUN_ACTOR异步模式先触发运行并立即返回不等待任务完成适合长时间抓取任务。关键参数参数说明actorId必填Actor 的 slug 或 IDbody传给 Actor 的 JSON 输入对象memory内存上限MB必须为 2 的幂且最小 128timeout运行超时时间秒maxItems返回条目的上限build指定构建标签例如latest、beta异步运行返回后利用返回结果中的datasetId再调用APIFY_GET_DATASET_ITEMS轮询拉取数据形成先触发、后取数的标准异步流程。典型用法示例Start the web scraper Actor for example.com asynchronously with 1024MB memory即以 1024MB 内存异步启动针对 example.com 的网页抓取 Actor。核心工作流三读取数据集条目工具APIFY_GET_DATASET_ITEMS从指定数据集获取数据支持分页、字段选择与过滤。关键参数参数说明datasetId必填数据集标识符limit每页条目数默认与上限均为 1000offset分页偏移默认 0format输出格式json推荐、csv、xlsxfields只包含指定字段omit排除指定字段clean是否移除 Apify 自带的元数据desc是否倒序返回最新在前典型用法示例Get the first 500 items from dataset myDatasetId in JSON format即以 JSON 格式从数据集 myDatasetId 获取前 500 条。由于单次limit上限为 1000面对大数据集时需要循环递增offset分批取完——这也是该 Skill 的 Known Pitfalls 中明确提醒的分页策略详见后文。核心工作流四检查 Actor 详情工具APIFY_GET_ACTOR在运行 Actor 之前先用它查看 Actor 的元数据、输入 schema 与配置信息确认参数后再构造input。参数说明actorId必填Actor ID格式为username/actor-name或十六进制 ID典型用法示例Show me the details and input schema for the apify/web-scraper Actor即展示 apify/web-scraper 这个 Actor 的详情和输入 schema。对于每个字段名不同的 Actor这一步是避免输入字段被拒绝的最直接手段。核心工作流五创建可复用任务工具APIFY_CREATE_TASK为反复执行的抓取任务预置固定输入配置一次、重复触发非常适合定时或周期性的数据采集场景。任务带有固定的输入参数组合后续触发无需重新构造输入。典型用法示例Create an Apify task for the Google Search scraper with default query AI startups and US location即为 Google Search 抓取器创建一个 Apify 任务默认查询词为 AI startups定位美国。配合APIFY_GET_TASK_INPUT速查表中列出可以随时查看任务中已存储的输入确认任务配置是否符合预期。核心工作流六运行与数据集管理、日志调试工具APIFY_GET_LIST_OF_RUNS、APIFY_DATASETS_GET、APIFY_DATASET_GET、APIFY_GET_LOG这一组工具覆盖监控运行状态 → 定位数据集 → 拉取数据 → 排查日志的完整闭环列出运行APIFY_GET_LIST_OF_RUNS按 Actor 过滤可附带状态过滤从运行详情中拿到datasetId后即可用于数据拉取。数据集管理APIFY_DATASETS_GET—— 分页列出当前账户下的全部数据集APIFY_DATASET_GET—— 获取单个数据集的元数据如条目数等。调试日志APIFY_GET_LOG获取某次运行或构建的执行日志用于定位抓取失败、超时或字段报错的原因。典型用法示例List the last 10 runs for the web scraper Actor and show logs for the most recent one即列出 web scraper Actor 最近 10 次运行并展示最近一次的日志。这一组工具是异步工作流和定时任务日常运维的必备能力。高频踩坑指南让抓取任务一次跑通SKILL.md 专门整理了一份 Known Pitfalls 清单是实战中最容易翻车的 7 个点全部继承如下Actor 输入 schema 千差万别每个 Actor 的输入字段都不同通用字段名如queries、search_terms会被拒绝。务必先查看该 Actor 在商店页的字段定义例如 Google Maps 抓取用的是searchStringsArray网页抓取器用的是startUrls。URL 必须带完整协议URL 中一定要包含https://或http://前缀很多 Actor 还要求 URL 以对象形式给出即{startUrls: [{url: https://example.com}]}。数据集分页有上限APIFY_GET_DATASET_ITEMS单次limit最大为 1000。大数据集必须用offset循环分页取完不能指望一次调用拿全。枚举值一律小写绝大多数 Actor 期望小写枚举值例如relevance而非RELEVANCE、all而非ALL。同步等待最长 5 分钟APIFY_RUN_ACTOR_SYNC_GET_DATASET_ITEMS的waitForFinish上限为 300 秒。更长的运行请改用APIFY_RUN_ACTOR异步并用APIFY_GET_DATASET_ITEMS轮询。数据量决定成本大数据集的拉取成本高建议采用适中的limit与增量处理避免超时或内存压力。优先使用 JSON 格式虽然支持 CSV/XLSX但 JSON 对自动化处理最可靠下游自动化流程中尽量避免 CSV/XLSX。工具速查表11 个 Tool Slug 一览Tool Slug描述APIFY_RUN_ACTOR_SYNC_GET_DATASET_ITEMS同步运行 Actor 并立即返回结果APIFY_RUN_ACTOR异步运行 Actor触发后即返回APIFY_RUN_ACTOR_SYNC同步运行 Actor返回输出记录APIFY_GET_ACTOR获取 Actor 元数据与输入 schemaAPIFY_GET_DATASET_ITEMS从数据集检索条目支持分页APIFY_DATASET_GET获取数据集元数据如条目数等APIFY_DATASETS_GET列出当前账户全部数据集APIFY_CREATE_TASK创建可复用的 Actor 任务APIFY_GET_TASK_INPUT查看任务中存储的输入APIFY_GET_LIST_OF_RUNS列出某 Actor 的运行记录APIFY_GET_LOG获取某次运行的执行日志总结apify-automation这份 Skill 将 Apify 的选 Actor → 跑任务 → 取数据 → 看日志全链路封装为可直接调用的工具序列同步调用解决快速抓取异步调用应对长任务datasetId在运行与取数之间完成数据交接APIFY_CREATE_TASK支持周期性任务的沉淀复用而APIFY_GET_LOG与运行列表则保证了任务的可观测性。使用时牢记三条主线——先查 Actor 的输入 schema、同步等待别超 300 秒、大数据集用 offset 分页——即可让 Claude Code 稳定地替你完成网页数据采集。更多同类预构建 Skill 可在仓库的 composio-skills 目录中按应用分类浏览。赞分享AI 技能AI 插件人工智能工作流自动化【免费下载链接】awesome-claude-skillsA curated list of awesome Claude Skills, resources, and tools for customizing Claude AI workflows项目地址https://gitcode.com/GitHub_Trending/aw/awesome-claude-skills点击查看免费下载相关推荐apify-mcp-server Bug Triage 工作流用 Claude Agent Skill 自动化 GitHub Issue 分诊apify mcp server Bug Triage 工作流用 Claude Agent Skill 自动化 GitHub Issue 分诊 导读 本文讲解agentic-awesome-skills 实战用 apify-lead-generation 技能与 Apify Actors 自动化多平台潜在客户挖掘agentic awesome skills 实战用 apify lead generation 技能与 Apify Actors 自动化多平台潜在客户挖掘AI 技能AI 插件agentic-awesome-skills 中 apify-market-research Skill 实战指南基于 Apify Actors 的多平台市场调研工作流agentic awesome skills 中 apify market research Skill 实战指南基于 Apify Actors 的多平台市场AI 技能AI 插件上一篇wvp-GB28181-pro 开箱即用GB28181 国标视频平台从部署到级联的完整实战指南下一篇ExplorerPatcher 任务栏冲突排查指南10 分钟解决与 Windhawk 模块的兼容问题创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考