ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

OpenMontage HyperFrames Media 依赖与凭据全指南:`requirements.md` 深层解读

OpenMontage HyperFrames Media 依赖与凭据全指南:`requirements.md` 深层解读 OpenMontage HyperFrames Media 依赖与凭据全指南requirements.md深层解读【免费下载链接】OpenMontageWorlds first open-source, agentic video production system. 12 production pipelines, 100 tools, 700 agent skill and production-knowledge files. Turn your AI coding assistant into a full video production studio.项目地址: https://gitcode.com/GitHub_Trending/op/OpenMontage在 OpenMontage 仓库中.agents/skills/hyperframes-media技能包承载了 TTS 配音、BGM/SFX 音效、语音转写与背景移除等媒体资产能力。本文以其中最关键的环境文档 references/requirements.md 为主体系统讲清凭据如何解析、本地依赖缺什么、模型缓存落在哪里、出问题怎么诊断并结合仓库中SKILL.md、tts.md、bgm.md、transcribe.md、remove-background.md等源码级参考与相关脚本实现给出可直接落地的配置与排障清单。读完你将能独立判断一个 HyperFrames Media 工作流当前会走哪个云引擎、回退到哪个本地引擎以及如何一次性补齐所有运行前提。背景一套媒体技能一条凭据开关hyperframes-media这套技能的核心设计是**一个开关决定全局**整个 TTS / BGM / SFX 的能力分发只取决于一条 HeyGen 凭据是否可解析见 SKILL.md 中All three capabilities degrade on ONE switch的表述。在 OpenMontage 中这套技能是从上游 HyperFrames 项目按版本 vendored 进来的仓库内.agents/skills/hyperframes/PROVENANCE.md记录了来源与再同步流程因此本文出现的npx hyperframes ...CLI 命令即该技能族的标准接口与仓库内脚本如.agents/skills/hyperframes-media/scripts/audio.mjs、heygen-tts.mjs协同工作。先理解能力矩阵才能看懂凭据与依赖为什么是这一切的地基能力有 HeyGen 凭据无凭据本地回退TTS 配音HeyGen Starfish REST自带词级时间戳→ ElevenLabs → Kokoro 本地合成需再接转写拿词级时间戳BGM 背景乐HeyGen 音乐库检索Lyria → MusicGen 本地生成后台异步SFX 音效HeyGen 音效库检索min_score 0.4技能自带的 21 个内置音效文件assets/sfx/凭据与密钥解析优先级一张表读懂谁先谁后所有命令在运行时按先命中先用first match wins的顺序解析凭据。下表是 requirements.md 给出的权威清单Provider解析顺序首个非空即生效使用本地依赖HeyGenTTS BGM/SFX 检索$HEYGEN_API_KEY→$HYPERFRAMES_API_KEY→~/.heygen/credentials与 heygen-cli 共享$HEYGEN_CONFIG_DIR可覆盖目录由hyperframes auth login写入无走 RESTElevenLabsTTS 回退$ELEVENLABS_API_KEYpip install elevenlabsLyriaBGM 回退$GEMINI_API_KEY→$GOOGLE_API_KEYpip install google-genaiKokoroTTS无需密钥永远可用——最终配音兜底pip install kokoro-onnx soundfileMusicGenBGM无需密钥永远可用——最终音乐兜底pip install transformers torch soundfile numpy要点解读HeyGen 凭据三条来源同权环境变量、全局凭据文件、以及见 tts.md脚本还会自动加载项目根目录向上 ≤5 层的.env文件。注意这与常规仅读.env不同——技能明确不鼓励把密钥写进 per-repo.env更推荐一次全局登录。OAuth 与 API Key 的请求头差异OAuth 登录态以Authorization: Bearer发送API Key 以X-Api-Key发送。若唯一的凭据是已过期的 OAuth token脚本会停下并提示运行npx hyperframes auth refresh。零凭据不是死路没有任何 HeyGen 凭据时配音与 BGM 会完整地落到本地引擎Kokoro / MusicGen只是丢失了词级时间戳与检索式音库两个云能力。推荐的登录方式一次浏览器 OAuth全部项目生效hyperframes auth login浏览器 OAuth是官方推荐的配置方式一次登录、每个项目可用、无需 per-repo.env。如果你已有 HeyGen 平台app.heygen.com/settings/api签发的 API Key则用npx hyperframes auth login --api-key该命令会把凭据写入共享的~/.heygen目录与 heygen-cli 共用同一份文件。Preflight生成任何音频前的强制检查点技能规定在生成人声或 BGM之前必须先跑共享的 Preflight 检查并把输出原样转达给用户而不是自行编造缺少密钥的提示也不应主动提议把密钥写进 per-repo.envnpx hyperframes auth status已登录→ 打印账户信息可以继续未登录退出码为 1 是预期行为未登录是正常状态而非错误→ 输出会给出先注册的引导并列出无凭据时配音/BGM 将回退到的本地引擎以及依赖缺失时的pip提示。此时应停下等待用户选择——是登录还是回复 go/local 离线继续——而不是自行替用户决定。需要确定性分支时用 JSON 输出npx hyperframes auth status --json返回{ configured, recommended_action, offline_engines }。自主/非交互模式下例外记录状态后可直接离线继续。这条规则的意义在于没有凭据不等于悄悄用本地引擎的绿灯。哪怕只是一次性的帮我生成一段 BGM / 配音请求也必须先过 Preflight 这一关。模型缓存与系统依赖每类命令都在首次运行时下载各自模型并缓存到~/.cache/hyperframes/下。下表汇总各类任务的实际占用与前提容量数字源自 requirements.md任务本地依赖 / 模型缓存位置关键约束TTSHeyGen无本地模型—需 HeyGen 凭据 PATH 上有ffmpeg把返回的 mp3 转码为.wavTTSElevenLabs同 HeyGen—API Key ffmpegTTSKokoroKokoro-82M约 311 MB 声音文件约 27 MB~/.cache/hyperframes/tts/Python 3.8pip install kokoro-onnx soundfile非英语文本还需系统级espeak-ngBGMLyria无本地模型缓存—$GEMINI_API_KEY或$GOOGLE_API_KEYpip install google-genaiBGMMusicGenfacebook/musicgen-small约 300 MB~/.cache/huggingface/pip install transformers torch soundfileTranscribe 转写Whisper按选择 75 MB – 3.1 GB~/.cache/hyperframes/whisper/内置whisper.cppRemove-background 去背景u2net_human_seg约 168 MB ONNX~/.cache/hyperframes/background-removal/models/推理峰值内存约 1.5 GB依赖缺失导致命令失败时标准处置是运行npx hyperframes doctor它会统一报告本地依赖是否就绪hyperframes auth status与hyperframes doctor都会报告 Kokoro / MusicGen 是否已安装。关键命令与依赖联动速查npx hyperframes tts三级供应商自动降级npx hyperframes tts从环境变量自动探测供应商也可用--provider显式钉死# 自动探测有 HeyGen Key 用 HeyGen其次 ElevenLabs最后 Kokoro npx hyperframes tts Welcome to HyperFrames -o narration.wav # 显式钉住供应商与音色 npx hyperframes tts Hello --provider kokoro npx hyperframes tts Hello --provider heygen --voice heygen-uuid npx hyperframes tts Hello --provider elevenlabs --voice 21m00Tcm4TlvDq8ikWAM # HeyGen 路径一次调用同时拿到词级时间戳省去一轮 Whisper 转写 npx hyperframes tts Hi there --words narration.words.json供应商差异要点tts.md顺序供应商触发条件词级时间戳音频格式1HeyGenStarfish$HEYGEN_API_KEY/~/.heygen/credentials有响应中word_timestamps[]mp3 → ffmpeg 转 wav2ElevenLabs$ELEVENLABS_API_KEY无mp3 → ffmpeg 转 wav3Kokoro-82M始终可用本地兜底无直接 wav一个易踩的坑公开发布的hyperframes ttsCLI 往往是仅本地构建--help只提 Kokoro-82M没有--provider/--words即便设置了$HEYGEN_API_KEY也会悄悄落到 Kokoro。因此引擎的 HeyGen 通道走的是技能自带的独立脚本 scripts/heygen-tts.mjs直连 HeyGen v3 RESTCLI 仅用于 Kokoro 路径。ffmpeg是云 TTS 的硬前提HeyGen / ElevenLabs 返回 mp3CLI 在输出以.wav结尾时默认也是下游ffprobe与 Whisper 所期望的会转码。想让下游免转码就传-o file.mp3。PATH 上缺ffmpeg时云供应商的.wav输出会失败——要么装 ffmpeg要么改用.mp3。npx hyperframes transcribe永远显式传--model语音转写会产出词级时间戳供字幕管线消费。铁律是显式指定--model——CLI 默认值small.en会把非英语音频静默翻译成英语摧毁原始语言transcribe.md 的 Language Rulenpx hyperframes transcribe audio.mp3 --model small.en # 已知英语 npx hyperframes transcribe video.mp4 --model small --language es # 已知西语 npx hyperframes transcribe audio.mp3 --model small # 未知语言自动检测 npx hyperframes transcribe subtitles.srt # 导入既有字幕 npx hyperframes transcribe openai-response.json # 导入 API 结果模型体积与定位与 requirements.md 的缓存表一一对应模型大小定位tiny75 MB快速预览、冒烟测试base142 MB短片、清晰音频small466 MB大多数多语言内容的默认medium1.5 GB带人声的音乐、嘈杂音频large-v33.1 GB生产级质量npx hyperframes remove-background本地 ONNX 模型透明抠像默认走u2net_human_segMIT 协议约 168 MB ONNX缓存于~/.cache/hyperframes/background-removal/models/峰值推理内存约 1.5 GBnpx hyperframes remove-background subject.mp4 -o transparent.webm # 默认 VP9 alpha npx hyperframes remove-background portrait.jpg -o cutout.png # 单图抠像 npx hyperframes remove-background subject.mp4 -o subject.webm \ --background-output plate.webm # 双层一次性输出 npx hyperframes remove-background subject.mp4 -o transparent.webm --device cpu npx hyperframes remove-background --info # 查看已探测的运行设备设备选择遵循autoApple Silicon 用 CoreML、有 CUDA 用 CUDA、否则 CPU强制指定用--device cpu | coreml | cuda。CUDA 需要HYPERFRAMES_CUDA1外加启用 GPU 的onnxruntime-node构建。详见 remove-background.md。回退链路纵深无凭据时本地引擎怎么跑BGM 的三段式回退当 HeyGen 凭据缺失或被显式要求本地生成时BGM 走Lyria → MusicGen两级本地生成bgm.md顺序供应商环境/依赖速度质量1Google Lyria RealTime$GEMINI_API_KEY或$GOOGLE_API_KEYgoogle-genai按需自动安装实时流式≈ 目标时长生产级2MusicGenfacebook/musicgen-smallPythontransformers torch soundfile numpy首跑约 300 MB自动安装CPU 慢Apple MPS / CUDA 快尚可仅 prompt 控制scripts/audio.mjs会**分离式detached**拉起生成进程避免挡住配音工作此时audio_meta.json中bgm_pending: true并写入bgm_pid/bgm_log组装前必须运行scripts/wait-bgm.mjs轮询结果并产出bgm_status.jsonstatus: ready | failed | timeout | disabled。无论哪条路失败BGM 都只是被省略绝不会阻塞人声与 SFX 的渲染。MusicGen 只生成一段 ≤28–30 秒的种子片段再通过 crossfade 循环铺满目标时长或超出时裁短以避免逐段拼接的接缝后端选择以实际能跑起来为准import google.genai成功才用 Lyria否则 MusicGen两者都无法运行时 BGM 直接跳过。Kokoro 的多语言与音色体系Kokoro 是永远可用的本地配音兜底54 个音色。音色 ID 首字母即语言前缀tts.mda美音、b英音、e西语、f法语、h印地语、i意大利语、j日语、p巴西葡语、z普通话。因此npx hyperframes tts La reunión empieza a las nueve --voice ef_dora --provider kokoro npx hyperframes tts Today is a nice day --voice af_heart --provider kokoro非英语的音素化phonemization依赖系统级espeak-ngbrew install espeak-ng/apt-get install espeak-ng——这与 requirements.md 缓存表中非英语需 espeak-ng的约束完全对应。语音速度上Kokoro 与 HeyGen 会尊重--speed0.7–0.8 教程、1.0 自然、1.1–1.2 片头转场、1.5 慎用ElevenLabs 忽略该参数。诊断总纲把缺依赖变成一条命令无论哪条链路报错requirements.md 给出的标准动作是运行npx hyperframes doctor。结合上面所有信息一套完整的排查顺序应当是npx hyperframes auth status --json—— 看凭据状态configured/recommended_action/offline_engines判断本次工作流将走云端还是本地需要本地引擎时对照本文依赖表逐一确认pip install项Kokoro:kokoro-onnx soundfileMusicGen:transformers torch soundfileLyria:google-genai与系统包ffmpeg、非英语还需espeak-ng任何命令因依赖失败直接跑npx hyperframes doctor统一定位首次运行的模型下载只需一次全部落在~/.cache/hyperframes/MusicGen 在~/.cache/huggingface/无需重复配置。从源码结构看本技能的运行时入口与请求/元数据 schema 的完整文档都集中在 scripts/audio.mjs 头部注释中单向一次性的 HeyGen TTS 则可直接用 scripts/heygen-tts.mjs若你只想要更宏观的技能路由视角可回看 SKILL.md 的 Routing 一节它会把你导向本文所属的整组 references。把凭据解析、模型缓存与依赖清单这一层理顺HyperFrames Media 的全部音频与媒体能力就有了可复现、可诊断的运行底座。【免费下载链接】OpenMontageWorlds first open-source, agentic video production system. 12 production pipelines, 100 tools, 700 agent skill and production-knowledge files. Turn your AI coding assistant into a full video production studio.项目地址: https://gitcode.com/GitHub_Trending/op/OpenMontage创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表