
TRIBE v2是什么Meta开源多模态脑响应预测基础模型一文读懂【免费下载链接】tribev2This repository contains the code to train and evaluate TRIBE v2, a multimodal model for brain response prediction项目地址: https://gitcode.com/gh_mirrors/tr/tribev2TRIBE v2是 Meta 开源的一个多模态脑响应预测基础模型brain encoding model输入一段视频、音频或文本它就能预测人脑 fMRI 信号会如何响应。它把 LLaMA 3.2文本、V-JEPA2视频、Wav2Vec-BERT音频三大前沿模型统一到一个 Transformer 中将多模态表征映射到皮层表面fsaverage5 网格约 2 万个顶点是计算神经科学in-silico neuroscience方向的基础模型。本文带你一文读懂TRIBE v2 能做什么、架构原理、如何安装运行推理、以及项目结构与训练流程零基础也能跟上 一、TRIBE v2 能做什么传统 fMRI 脑解码研究往往针对单一模态只预测文字、或只看图像。TRIBE v2 的突破在于统一多模态输入模态特征提取器自动处理流程 视频V-JEPA2 视频模型自动抽取音轨 → 语音转写为带时间戳的词事件 音频Wav2Vec-BERT直接转写为词级事件 文本LLaMA 3.2先合成语音TTS再转写获得词级时间轴核心能力一览预测平均被试的皮层活动输出形状为(n_timesteps, n_vertices)即每个时间步上大脑表面约 2 万个点的 BOLD 活动自动补偿血流动力学延迟预测结果整体向过去偏移 5 秒对齐 fMRI 的 HRF 延迟大脑 3D 可视化内置PlotBrain工具可把预测活动渲染到皮层表面还支持导出动画视频plot_timesteps_mp4。二、工作原理多模态特征如何映射到大脑模型主体是FmriEncoder定义在 tribev2/model.py流程可以概括为三步多模态特征提取文本、视频、音频各自过对应的编码器抽取多层特征后拼接layer_aggregationcat投影与 Transformer 编码每种模态经一个 MLP projector 投影到统一维度hidden256再送入带时间位置编码的 TransformerEncoder映射到皮层网格输出通过池化与时间平滑TemporalSmoothing高斯卷积核对齐到 fMRI 的时间分辨率fsaverage5 皮层网格。 细节fMRI 数据会先通过SurfaceProjector见 tribev2/utils_fmri.py从体素空间投影到皮层表面支持 MNI / fsaverage 两种坐标系。推理入口是 tribev2/demo_utils.py 中的TribeModel类它封装了从原始文件到事件数据框events DataFrame再到预测结果的完整链路。三、快速上手如何运行 TRIBE v2 预测脑响应1. 环境要求Python3.11依赖定义在 pyproject.tomltorch 2.5、transformers、neuralset 等2. 获取代码并安装git clone https://gitcode.com/gh_mirrors/tr/tribev2 cd tribev2 # 仅推理 pip install -e . # 需要大脑可视化 pip install -e .[plotting]3. 三行代码预测大脑活动from tribev2 import TribeModel model TribeModel.from_pretrained(facebook/tribev2, cache_folder./cache) df model.get_events_dataframe(video_pathpath/to/video.mp4) preds, segments model.predict(eventsdf) print(preds.shape) # (n_timesteps, n_vertices)把video_path换成audio_path或text_path即可预测音频/文本对应的脑活动——文本会自动转成语音再转写因此时间轴与真实聆听体验一致。首次运行会从模型仓库下载约 1GB 的预训练权重之后走本地缓存。 完整交互演示含 3D 大脑可视化见官方 demo notebooktribe_demo.ipynb它会演示视频与莎士比亚独白文本两种输入下的皮层活动预测。四、项目结构导读目录/文件作用tribev2/main.py实验流水线Data配置数据集与特征提取器TribeExperiment编排训练/评估tribev2/model.pyFmriEncoderTransformer 多模态 → fMRI 模型tribev2/pl_module.pyPyTorch Lightning 训练模块tribev2/demo_utils.pyTribeModel推理接口与事件数据框工具tribev2/grids/Slurm 网格搜索run_cortical.py皮层与run_subcortical.py皮层下tribev2/plotting/大脑可视化PyVista Nilearn 双后端tribev2/studies/支持的公开数据集定义内置支持的 fMRI 数据集studies/目录内置了多个经典公开数据集覆盖视频与听觉两种范式Algonauts 2025 Challengestudies/algonauts2025.py观看《老友记》7 季 4 部电影的 fMRI 数据Schaefer-1000 分区图TR1.49sBOLD Moments / Lahner 2024studies/lahner2024bold.py10 名被试观看 1000 段 3 秒自然视频测试集含 10 次重复适合信度分析Lebel 2023studies/lebel2023bold.py被动聆听自然口语叙事带词级与音素级标注Wen 2017studies/wen2017.py经典自然语言 fMRI 数据集。跨数据集加载与合并逻辑多研究数据混合训练、被试加权见 tribev2/utils.py。五、如何从零训练 TRIBE v2面向科研用户的训练流程同样开箱即用默认配置见 tribev2/grids/defaults.py# 1. 设置数据与输出路径 export DATAPATH/path/to/studies export SAVEPATH/path/to/output # 2. 本地快速测试 python -m tribev2.grids.test_run # 3. Slurm 集群网格搜索 python -m tribev2.grids.run_cortical python -m tribev2.grids.run_subcortical训练依赖lightning、wandb、torchmetrics通过pip install -e .[training]安装。特征提取器文本/视频/音频的超参数——如 LLaMA 3.2 取用哪几层、V-JEPA2 的 clip 时长——都在defaults.py中集中配置改一处即可跑通整个网格实验。六、常见问题 FAQQ1TRIBE v2 预测的是真实个体的大脑吗目前输出针对平均被试预测落在 fsaverage5 平均皮层网格上。代码中保留了subject_layers被试个性化层接口个体化建模是后续研究方向。Q2为什么预测要偏移 5 秒fMRI 的 BOLD 信号存在约数秒的血流动力学延迟HRF模型按过去 5 秒补偿使看到的画面与测到的脑活动在时间上对齐。Q3授权范围是什么项目采用CC-BY-NC-4.0协议见 LICENSE即非商业用途。用于学术研究请引用论文dAscoli et al.,A foundation model of vision, audition, and language for in-silico neuroscience, arXiv:2605.04326 (2026)七、总结为什么值得关注 TRIBE v2✅统一多模态视频、音频、文本一个模型全搞定 ✅皮层级精度约 2 万顶点的 fsaverage5 表面预测而非粗略的体素块 ✅开箱即用HuggingFace 预训练权重 三行代码推理 3D 可视化 ✅面向科研内置 4 个公开 fMRI 数据集、完整的 Slurm 训练网格 生态完善基于 neuralset/neuraltrain/exca 构建特征缓存与集群调度成熟TRIBE v2 代表了用基础模型做硅基神经科学的新范式——不扫描真人直接预测大脑。对神经影像、脑机接口与认知科学方向的入门者和研究者来说这是一个值得放进工具箱的开源项目 【免费下载链接】tribev2This repository contains the code to train and evaluate TRIBE v2, a multimodal model for brain response prediction项目地址: https://gitcode.com/gh_mirrors/tr/tribev2创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考