ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

AI 助手只会回文字?一行命令让它学会「发自拍」——Clawra 上手与原理拆解

AI 助手只会回文字?一行命令让它学会「发自拍」——Clawra 上手与原理拆解 你有没有遇到过这种尴尬在 Telegram 或者 Discord 上跟自己的 AI 助手聊天随口来一句「你现在在干嘛发张图看看」然后它一本正经地回你——「抱歉我没有实体无法拍照」。聊得再投缘它也永远只是一串文字。想要一张「它的照片」得自己另开一个文生图工具生成完还得手动转发回聊天窗口一来一回氛围全无。我最近发现一个叫Clawra的开源项目GitHub 仓库专门解决这个别扭的问题装上它之后你的 AI 助手真的能按你的要求「发自拍」而且每次发的都是同一张脸。Clawra 是个啥一句话说清楚Clawra 是给OpenClaw一个开源 AI 助手框架可以接入 Telegram、Discord、WhatsApp 等聊天渠道用的一个Skill技能包你可以理解成给 AI 助手装的「App」——本体不会拍照装个插件就会了。装好之后你能干这些事对助手说「发张自拍」「发一张戴牛仔帽的」「你现在在咖啡馆发张图」它就真的回你一张图图不是随便生成的而是始终保持着同一个形象——不会今天一张脸明天一张脸发图走的是 OpenClaw 的 Gateway消息出入口相当于助手和各聊天平台之间的总机所以 Telegram、Discord、WhatsApp、Slack、Signal、MS Teams 这些渠道都能直接收图。这个项目是 SumeLabs 在 2026 年 2 月开源的MIT 协议目前 GitHub 上 1.4k Star、259 Fork还有个官网 clawra.dev。它是怎么做到的我翻了翻源码先看整体链路一句话到一张图中间要走五步拆开讲几个关键环节。1. 形象一致靠一张「定妆照」Clawra 生成图片时永远会带上同一张参考图reference image可以理解成给画师的一份「定妆照」——换场景、换衣服都行脸必须是这一张这张图每次都随提示词一起传给图像模型所以不管你要「沙滩」还是「咖啡馆」出来的人物形象都是同一个人。想换成自己的虚拟形象fork 仓库把这张图替换掉就行。2. 两种自拍模式靠关键词自动切换我看了它的 SKILL.md里面就定义了两种模式选哪个取决于你说的话里带了什么关键词模式效果适合的关键词Mirror对镜自拍全身照、穿搭展示outfit、wearing、fashionDirect举机自拍近景、场景感cafe、beach、portrait、smile说「发一张穿这身衣服的」→ 走 Mirror给你一张对镜全身像说「你现在在咖啡馆」→ 走 Direct给你一张举着手机的自拍近景。对应的提示词模板长这样# Mirror 模式对镜自拍 make a pic of this person, but 你的场景. the person is taking a mirror selfie # Direct 模式举机近景 a close-up selfie taken by herself at 你的场景, direct eye contact with the camera, looking straight into the lens, eyes centered and clearly visible, not a mirror selfie, phone held at arms length大致意思就是「画这个人但是场景她正在对镜自拍」和「她在场景举起手机拍了张近景直视镜头」。3. 生图和发图生图走的是fal.ai一个按调用次数收费的 AI 模型云平台不用自己搞显卡上的xAI Grok ImaginexAI 家的文生图模型。我在脚本里看到实际请求的接口是fal.run/xai/grok-imagine-image拿到返回 JSON 里的images[0].url之后再把图片地址 POST 给 OpenClaw 的 Gateway 消息接口图就出现在你聊天的地方了。还有个细节挺周到脚本会先检查机器上有没有装 openclaw 命令行工具没有的话会降级成直接调 API不至于直接报错罢工。怎么装方式一一条命令推荐前提是你的机器上已经跑着 OpenClaw然后npx clawralatest这个安装脚本会帮你干完全部活检查 OpenClaw 环境、引导你去申请 fal.ai 的 API Key密钥相当于你在 fal.ai 的身份证付款凭证、把技能装到~/.openclaw/skills/clawra-selfie/、写好配置最后还会往助手的人设文件里加一句「你有形象可以自拍」。方式二手动装想折腾的看这里第一步去 fal.ai/dashboard/keys 创建一个 API Key有免费额度够玩。第二步把仓库克隆到 OpenClaw 的技能目录gitclone https://github.com/SumeLabs/clawra ~/.openclaw/skills/clawra-selfie第三步在~/.openclaw/openclaw.json里启用技能并填入 Key{skills:{entries:{clawra-selfie:{enabled:true,env:{FAL_KEY:你的_fal_key}}}}}第四步在~/.openclaw/workspace/SOUL.md助手的人设文件相当于它的「性格剧本」里加一段## Clawra Selfie Capability You have a physical appearance and can take selfies! When users ask for pictures, use the clawra-selfie skill.装完重启 Gateway在任意已配置的渠道里说句「Send me a selfie」试试就行。这一步不是必须的但不写的话助手可能不会主动想到「哦原来我能发图」得你每次明说「用 clawra-selfie 发一张」。实际用起来什么感觉从社区反馈和我自己的体验看最顺手的点在于无感你不需要切出去开别的工具也不需要复制粘贴图片就在平时聊天的那个窗口里一句「发张自拍」几秒钟后图就回来了。要「戴牛仔帽的」就戴牛仔帽要「在沙滩的」就在沙滩。适合的场景大概这几类陪伴/人设类助手给聊天机器人一个稳定的「脸」交互感明显不一样虚拟穿搭展示用 Mirror 模式给虚拟形象换装、出全身照场景化回复说「你在咖啡馆」它就回一张咖啡馆场景图代入感拉满学习参考整个项目就一个安装器 一个技能目录 一个模板结构非常清晰想自己写 OpenClaw Skill 或者接其他图像 API 的话拿它当模板很合适。和其他方案比一比对比项Clawra OpenClaw纯文本 OpenClaw独立图像 Bot 聊天 Bot 两套发图能力按人设生成直接发进当前会话无需要两套 Bot或手动转发形象一致性固定参考图每次同一张脸—看各家实现部署成本一条 npx 命令 一个 fal Key同 OpenClaw多套服务多套配置渠道覆盖复用 OpenClaw 已配置的所有渠道同左每个渠道单独对接简单说如果你的助手已经在 OpenClaw 上跑着加 Clawra 是成本最低的「会发图」方案。用之前想清楚三件事它不能单独用。Clawra 只是技能包底下必须有跑起来的 OpenClaw且至少配好一个聊天渠道和一个 LLM。生图要花钱少量。图像生成走 fal.ai 按次计费注册送的免费额度用完就得充值另外 API Key 别泄露那玩意儿连着你的钱包。形象不是你说了算默认情况下。默认参考图是项目方定好的那个形象想要自己的虚拟形象得 fork 仓库替换参考图。另外生成内容受 fal.ai 和 xAI 的内容政策约束别拿去干违规的事。名词速查表名词一句话解释OpenClaw开源 AI 助手框架能把同一个助手接入 Telegram、Discord 等多个聊天平台Skill技能包给助手装的「插件」装一个多一项能力fal.ai按调用次数收费的 AI 模型云平台不用自己买显卡跑模型Grok ImaginexAI 的文生图模型在 fal.ai 上可以调用GatewayOpenClaw 的消息出入口助手收发消息和图片都走它参考图传给图像模型的「定妆照」用来保证每次生成的人物形象一致SOUL.md助手的人设文件描述「它是谁、有什么能力」API Key调用云端服务的密钥相当于身份证 付款凭证项目信息仓库github.com/SumeLabs/clawra官网clawra.dev协议MIT |创建时间2026 年 2 月 |热度1.4k Star / 259 Fork如果你也在玩 OpenClaw一条npx clawralatest的事值得一试。
返回列表