
千笔-AIWritePaper · https://www.aiwritepaper.com图书馆员、科研管理人员和研究生经常有一些「很具体、又没人帮忙做」的数据需求给一批 DOI 标出开放获取状态、画出本机构与合作机构的分布、做一份能贴进基金申请书的影响力摘要。OpenAlex 的 API 完全开放、文档齐全这让「用大模型写代码」成为一条现实的路。OurResearch 在 2026 年 1 月 29 日的网络研讨会 Vibe coding with OpenAlex约 57 分钟里OpenAlex CEO Jason Priem 现场开了五个终端边做边讲半小时做出的同行对标可视化、电子表格里的开放获取公式、合作机构 3D 地球、引文网络、个人影响力报告。演示很热闹但对想照做的人更有用的是其中的选型判断用什么界面、怎么下指令、数据怎么取、结果怎么验。本文把讲座内容整理成四层选型终裁每层写清结论和成立前提再给出「能写 / 不能写」清单最后用一个离线的分层验收闸门演示几类最常见的产物错误会怎样被拦下。讲座事实均来自原视频闸门数字来自本机实跑。图自上而下为界面、工作方式、数据、验收四层每层左侧是讲座原话要点中间是结论右侧是成立前提底部为验收闸门对合成 fixture 的实跑结果。目标说明读完你应能独立完成四件事按任务规模在桌面聊天、终端编码智能体和 IDE 插件之间做选择并说出理由。用「计划模式、描述终态、清空上下文、先落 CSV 再做图」四条规则组织一次 vibe coding。区分哪些结论能直接写进报告哪些必须先回到 OpenAlex 原始记录核对。用分层验收闸门检查产物至少覆盖回链、去重、枚举值、时间窗口和断点续跑。适用与边界适合基于 OpenAlex API 的一次性分析开放获取统计、合作网络、机构对标、主题趋势。单页 HTML 仪表盘或 CSV 报表需求能用几段话讲清楚。使用者不写代码或很少写代码但愿意花半小时到一小时来回迭代。不该指望讲座演示的是 Claude Code 等商业工具Jason Priem 明确说这不是对任何产品的背书工具会快速变化他自己预计三个月内会出现更好用的界面。复杂代码库的开发会慢得多他在问答中说得很直接这不是魔法也不会让你不用思考。文献计量指标本身的合理性不在本文范围讲座也提到有些演示并不是文献计量的最佳实践。四层选型终裁层讲座要点原视频终裁结论成立前提界面桌面版接 MCP 有时能做出不错的可视化有时会去操控浏览器或只告诉你怎么做终端编码智能体「强大得多」小表格公式用桌面聊天要写脚本、要落文件的任务用终端或 IDE 编码智能体截至 2026-01-29 的判断工具更新快需要定期重测工作方式计划模式是「你的朋友」描述终态比规定做法好上下文满了会变得不稳定要及时清空先出计划再执行每个子任务新开上下文愿意读计划、给反馈自动放行权限有误删风险数据下载脚本要做断点续跑和进度显示先拿数据存 CSV再做可视化检索词太宽会拉回过多论文两段式脚本取数落 CSV → 页面只读 CSV取数范围要在计划阶段收窄验收让智能体在浏览器里看自己的产物数字意外时回到 OpenAlex 核对近两年机构归属识别有已知问题每个数字可回链 OpenAlex意外值先抽查再下结论知道数据源自身的已知缺陷界面层按任务规模选电子表格那个演示用的是桌面聊天截图、用语音说出需求得到一段 Apps Script拖动公式就给每个 DOI 标出了开放获取状态。他特别提到同一个需求这次生成的写法和前一晚完全不同这就是 vibe coding 的常态。到了要下载数万条记录、生成地图的任务他换成终端里的编码智能体并在问答中说桌面版接 MCP 服务器与编码智能体「非常不同」后者是专门用代码解决问题的。工作方式层计划、终态、清空上下文他的提示词几乎都是用语音说出来的理由是详细的描述往往更好提示要写「我最终想要什么」比如「一个完全自包含的单页 HTML」而不是规定怎么实现。智能体会偷懒3D 地球那一版它为了快只抽样显示部分合作机构他直接用大写强调要显示全部。他的看法是宁可先欠工程再补也别过度设计。数据层两段式与断点续跑合作机构地图的计划里他逐项点赞了三件事断点续跑下载中断后能从上次的位置继续、进度显示否则不知道要等五分钟还是五小时、先输出 CSV 再做可视化。引文网络那个演示暴露了反面检索「altmetrics」拉回的论文远超预期页面每次打开都要重新请求他随即改成先写取数脚本、再基于结果做可视化并把引用关系限定在这个论文簇内部。验收层回链与已知缺陷开放获取仪表盘显示「绿色」占比明显偏高他没有直接相信也没有直接否定而是点回 OpenAlex在 API 里看到那条记录的 oa_status 确实是 green——仪表盘忠实反映了数据源至于数据源本身是否有误是另一个问题。机构趋势演示里他指出 OpenAlex 近两年的机构归属识别存在已知问题数字偏低团队正在优先修复按主题筛选时主题划分得很细数据量不够建议改用更粗的子领域。能写 / 不能写能写不能写为什么「本机构 2025 年论文的开放获取状态分布数据取自 OpenAlex API每条可回链」「绿色开放获取占比高说明本机构开放科学成效显著」意外值需先抽查且只说明数据源的记录「以下引用均通过 OpenAlex API 检索获得」「以下引用由 AI 整理」而不逐条核对讲座问答只让模型「找引用」会编造一部分接 API 并确认真的发了请求才拿到真实记录投稿前仍要逐条核对「合作机构覆盖若干国家按 OpenAlex 机构字段统计」直接粘贴模型生成的影响力段落演示中模型会混入训练语料里的信息前一个任务的人名也会串进下一份报告「近年趋势注近两年机构归属识别存在已知偏差」「近两年发文量明显下降」数据源已知缺陷「按子领域统计」「按细分主题排名」主题过细时样本太少结果不稳讲座问答里还有一个数字值得记住OpenAlex 每天新增约 5 万条记录靠的是传统的采集流程而不是 AI。他的说法是OpenAlex 提供信息模型提供智能两者合在一起才是知识。分层验收闸门离线实跑写这篇时本机直接请求 OpenAlex API 返回了额度提示未带 API key 的请求共享同一网络出口的每日免费额度额度已用完UTC 零点重置官方提示可以免费申请自己的 key。这本身就是一条选型前提批量任务先申请 key再写取数脚本。因此本文的闸门不调用 API而是用合成 fixture 演示W 编号为占位不对应真实论文干净版 40 条故障版在其上注入 5 类错误——两条没有 OpenAlex ID 的「模型想出来的条目」、一条重复、一条非法枚举值、一条超出时间窗口。另模拟 50 页分页下载在第 31 页中断对比有无断点续跑。脚本和 CSV 在_w/openalex/fixture-clean.csv | L3-1 可回链 OpenAlex ID | fail0 | PASS | [] fixture-clean.csv | L3-2 ID 去重 | fail0 | PASS | [] fixture-clean.csv | L3-3 oa_status 枚举 | fail0 | PASS | [] fixture-clean.csv | L3-4 年份窗口 | fail0 | PASS | [] fixture-clean.csv | L4-1 异常占比→抽查清单 | fail0 | PASS | [green0.28, 抽查 5 条] fixture-faulty.csv | L3-1 可回链 OpenAlex ID | fail2 | FAIL | [Altmetrics and policy uptake: a review, Social attention metrics revisited] fixture-faulty.csv | L3-2 ID 去重 | fail1 | FAIL | [https://openalex.org/W9000000003] fixture-faulty.csv | L3-3 oa_status 枚举 | fail1 | FAIL | [open] fixture-faulty.csv | L3-4 年份窗口 | fail1 | FAIL | [2019] fixture-faulty.csv | L4-1 异常占比→抽查清单 | fail0 | PASS | [green0.27, 抽查 5 条] 无 checkpoint| 第1次 CRASH 于第 31 页第2次重新请求 50 页累计请求 81 页需要 50 有 checkpoint| 第1次 CRASH 于第 31 页第2次重新请求 19 页累计请求 50 页需要 50读法两条没有 ID 的条目最危险标题看起来完全像真论文只有「必须能回链 OpenAlex」这一条规则能把它们拦下open不是 OpenAlex 的 oa_status 取值gold、green、hybrid、bronze、diamond、closed通常说明模型自己编了分类年份窗口外的记录说明筛选条件没生效。断点续跑那一组没有 checkpoint 时中断后只能从头来累计请求 81 页多出 31 页的请求在有额度限制的 API 上就是真金白银有 checkpoint 时从第 31 页续跑正好 50 页。验收清单交付前逐项勾选每条记录都有https://openalex.org/W…形式的 ID页面上可点回原记录。ID 无重复枚举字段只出现 API 文档列出的取值。时间窗口、机构 ID 与计划一致并在报告里写明检索日期。意外的数字先抽查 5 条原始记录再决定写不写进结论。涉及近两年机构数据时加注已知偏差。取数脚本有断点续跑和进度显示批量任务使用自己的 API key。总结OpenAlex 上的 vibe coding选型可以一句话终裁小需求用桌面聊天写脚本落文件用编码智能体先计划、说终态、勤清上下文数据两段式并能断点续跑每个数字都能回链意外值先抽查。模型负责写代码OpenAlex 负责事实验收闸门负责把「看起来像数据」的东西挡在报告之外。