ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

让AI记住图片、视频和音频:Mnemosyne多模态记忆完整实战教程

让AI记住图片、视频和音频:Mnemosyne多模态记忆完整实战教程 让AI记住图片、视频和音频Mnemosyne多模态记忆完整实战教程【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyneMnemosyne 是一款零云端的 AI 记忆系统它只依赖 SQLite 和一个纯 Python 库却能让 AI 不仅记住文字还能记住图片、视频和音频。本教程带你从零配置 Mnemosyne 多模态记忆——把一张截图、一段录音、一个视频变成 AI 可以检索的长期记忆数据始终留在你的设备上。为什么只记文字的AI记忆不够用大多数 AI 记忆方案只处理文本你截图问 AI、给它一段会议录音它要么答不上来要么只能听过就算了。Mnemosyne 的多模态记忆要回答的是这类问题那张截图里是哪个深色主题配色方案那段视频里第几分钟提到了数据库迁移我上周录的那段语音里他答应了什么答案藏在项目的设计文档里docs/rfc/0002-modality-providers.md 定义了AI 理解媒体的接口docs/rfc/0003-media-moments.md 定义了文字记到哪里。多模态记忆的核心设计3个关键决策 Mnemosyne 的多模态方案可以用三句话概括这也是它和往数据库里塞二进制文件的方案最大的不同决策含义对用户的价值只记文字不记字节数据库里存的是媒体引用 AI 生成的描述文字隐私友好数据库轻量所有索引内容你都看得懂、可修改描述结果普通记忆每段描述caption、字幕、OCR都是一条标准记忆自动继承召回、遗忘衰减、整理、同步等全部能力默认不开启MNEMOSYNE_MEDIA_*关闭时不发任何网络请求隐私是默认值不是可选项核心实现在 mnemosyne/core/media.py 的remember_media()入口它会把媒体登记为一条资产再生成若干条时刻moment——比如视频的某一帧画面描述、音频的某段转录文字每条时刻都精确标注了位置时间段、页码、图像区域等。快速上手3步开启多模态记忆 ⚡第1步获取 Mnemosynegit clone https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne cd mnemosyne pip install -e .第2步配置理解端点Mnemosyne 只认一种协议OpenAI 兼容接口。所以 Atlas Cloud、OpenRouter、自建的 vLLM甚至本地 LM Studio 都能用换服务商只改环境变量不改代码完整配置说明见 docs/integrations/openai-compatible-vision.mdexport MNEMOSYNE_MODALITY_ENABLED1 # 主开关默认 false export MNEMOSYNE_MODALITY_BASE_URLhttps://你的端点/v1 export MNEMOSYNE_MODALITY_API_KEY你的密钥 export MNEMOSYNE_MODALITY_VISION_MODEL你的视觉模型 # 可选视频帧模型 / 音频转写模型 export MNEMOSYNE_MODALITY_VIDEO_MODEL... export MNEMOSYNE_MODALITY_AUDIO_MODELwhisper-1⚠️新手最容易踩的坑如果你已经运行过 Mnemosyneconfig.yaml里已经写入了这些键的默认值此时再 export 环境变量会被静默忽略。请改用mnemosyne config set命令或执行mnemosyne config migrate一次性导入。详见官方文档。想要完全不出网把端点指向本地 LM Studiohttp://localhost:1234/v1图片和视频理解全程离线。第3步记下第一张图片mnemosyne media ./diagram.png --title 架构图 --jsonCLI 入口在 mnemosyne/cli.py。输出会告诉你资产 ID、理解状态和生成的记忆条数。按类型实战图片、视频、音频、文档怎么做类型处理方式生成的时刻类型额外要求️ 图片发给视觉模型描述整体描述caption、OCR 文字ocr视觉模型 视频最多抽 8 帧发给视觉模型 音轨转文字画面描述shot、字幕transcript带时间戳ffmpeg/ffprobe️ 音频发给转写接口OpenAI 兼容audio/transcriptions带时间戳的转录文本音频模型 文档本地解析不上传按页/章节/字符范围定位的文字片段PDF 需pip install mnemosyne-memory[media]几个值得记住的细节文档永远不出机器。txt、md、docx、pptx、epub 全部本地解析mnemosyne/core/modality_documents.py唯一例外是无文字层的扫描版 PDF会被当图片发给视觉模型。视频理解由 mnemosyne/core/modality_video.py 负责抽帧 音轨转写两种信息合并成带时间戳的时刻所以第 90 秒谁说了 X这种问题才有依据。音频转写走 mnemosyne/core/modality_openai_audio.py超过 25MB 的音频会在本地直接拒绝而不是发出去被拒。每个资产最多保留 12 条时刻MNEMOSYNE_MODALITY_MAX_MOMENTS防止一个视频生成几百条记忆挤爆工作记忆。4种写入方式CLI、MCP工具、Python、Hermes同一个remember_media能力在不同入口都能调用入口用法CLImnemosyne media 路径或URL [--modality image] [--title T] [--hint H]MCP 工具调用mnemosyne_remember_media参数ref加可选的modality、title、hintPythonBeamMemory.remember_media(ref)实现在 mnemosyne/core/beam.pyHermes通过 Mnemosyne provider 暴露的同名工具MCP 工具定义见 mnemosyne/tool_schemas.py。注意工具入口比 CLI 更严格本地文件必须先在MNEMOSYNE_MEDIA_ALLOWED_PATHS白名单目录内防符号链接越权且默认禁止指向内网/本地回环地址的 URL——因为调用方可能是远程模型。召回实战怎么问出我看到过什么这是多模态记忆最爽的部分时刻就是普通记忆所以你不需要学新查询语法。直接问那个架构图里画了什么模块——命中的是当初生成的 caption 记忆。召回结果会附带只读的media增强字段媒体引用、模态、时间区间客户端可以据此深链跳转到视频的具体时间点而召回过程绝不取回原始字节。健康检查mnemosyne doctor会报告孤立的时刻记录资产理解状态有 5 种——pending / ok / partial / unavailable / refused其中unavailable没配置模型只登记了引用是成功而非报错你依然拥有一条我引用过这个文件的可搜索记录。相关设计见 docs/rfc/0004-archive-boundary.md测试覆盖在 tests/test_media_ingest.py 等文件中可以放心跟随主线版本升级。隐私安全清单把心放肚子里 ️默认静默MNEMOSYNE_MODALITY_ENABLED未开启时即使注册了后端也不会发起任何外呼检查逻辑在 mnemosyne/core/modality_backends.py。无环境采集没有文件监听、没有目录扫描只处理你明确点名的文件。字节不落库两张媒体表没有 BLOB 列数据库里只有引用和文字。内联载荷封顶 25MB本地路径白名单 私有 URL 默认拒绝。常见问题 FAQ ❓Q配置了模型状态却是unavailable检查端点连通性和模型是否真的支持图像输入。Mnemosyne 会可选地探测/models接口在模型是纯文本时给出警告但探测失败不影响主流程。Q改了MNEMOSYNE_MODALITY_BASE_URL没生效端点和模型名在客户端构建时只读一次需要重启进程其余参数即时生效。Q想让 AI 按我的口吻描述图片用--hint参数或MNEMOSYNE_MODALITY_PROMPT环境变量覆盖描述提示词。Q能用自己的视觉客户端替换 HTTP 适配器吗可以。协议只有一个describe()方法set_modality_backend一行注册详见官方文档的 Bringing your own backend 一节。写在最后Mnemosyne 的多模态记忆方案证明了最便宜的架构往往最优雅不新建向量表、不往数据库塞二进制、不新增召回通道——让媒体退化成文字整个现有记忆引擎就自动全部生效。三步配置、四种类型全覆盖、数据不出本机这就是零云端 AI 多模态记忆的完整形态。现在就跑起mnemosyne media让 AI 开始记住你看到和听到的一切吧。【免费下载链接】mnemosyneZero-cloud AI memory that works everywhere. SQLite-backed. One pure-Python dependency.项目地址: https://gitcode.com/gh_mirrors/mnemosyne5/mnemosyne创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考
返回列表