
今天是2026年9月23日晚上八点我照例打开后台准备写这篇AI日报。先翻了翻今天的讨论热点发现风向和上个月明显不同一堆人不再追问“哪个模型又刷榜”而是在问“这个东西怎么落地”。AI Agent、本地部署、AI编程提示词、AI短剧、AI测试开发每个关键词背后都有人卡在同一步——学了一堆概念不知道先做哪个。所以今天这篇日报我不打算做成简单的新闻清单而是挑出几个能直接落到工作流的议题讲讲原理、给点实操参考再分享一些我自己踩过的坑。1. 今日焦点DeepSeek开源Agent训练方法为什么说风向变了今天早上最热闹的一件事是DeepSeek公开了一套面向智能体Agent的训练方法。说实话过去一年Agent相关的课程和框架已经够多了但大多在讲“怎么用”这一次公开的是“怎么训”。两者的区别就像你从“怎么点外卖”升级到“怎么做一家外卖店”。1.1 这套方法解决的核心问题Agent训练和普通的对话模型微调完全不是一回事。对话模型要拟合的是人的偏好标注数据相对好收集Agent要完成的任务是“多步操作”比如查资料、调接口、写文件最后得到的奖励信号往往非常稀疏。拿订票举例你让Agent去订一张机票最后结果只有“订到了”和“没订到”两种情况中间几十步操作里到底哪步出了问题模型根本不知道。稀疏奖励导致训练无法收敛这是行业里公认的难点。DeepSeek这次公开的方案本质上是一条更完整的训练管线先构造冷启动数据。用现成模型配合简单规则在受控环境里跑一批简单任务人工筛掉明显失败的轨迹。拒绝采样只保留那些能完整跑通流程的轨迹再做一轮SFT让模型先学会“按成功路径走”。进入强化学习阶段奖励函数切成两路一路是可验证的硬性结果比如文件是否生成、接口是否返回200另一路是软性质量分由一个大模型扮演裁判角色评估中间步骤是否合理。持续迭代。凡是线上跑失败的case回收后重新进入训练集再走一轮SFT和RL。这套流程里的关键不是某一个算法而是“成功轨迹先行 多渠道奖励 失败样本回流”。一句话总结先教会模型怎么走通再让它自己探索。1.2 对普通开发者的价值在哪里我知道大部分读者不会真的去训练一个Agent模型一是算力贵二是没数据。但这次公开的方法论哪怕不做训练也能直接迁移到日常应用里。我举一个自己的工作流对比。以前我搭Agent上来就铺一堆工具调用结果模型经常在中间步骤上迷路最后不得不写一堆超时重试的补丁。后来我把思路改成先把最常见的成功路径做成一个显式的“步骤清单”让Agent严格按照清单走走熟了之后再开放自由探索并在每次失败时把错误日志记录下来定期用于提示词迭代。这个改动让一个内部数据整理Agent的完成率从七成不到提到九成以上。注意任何复杂Agent都不要指望大模型靠“理解自然语言”就能自主完成一个陌生流程。你要做的是先把流程中确定性的部分变成规则和模板再把不确定性的判断交给模型。这大概就是今天最值得关注的新闻。它标志着Agent开发从拼提示词的阶段进入到了用工程手段解决稳定性的阶段。2. AI大模型本地部署配置指南省钱的方案和踩过的坑今天热搜里“AI大模型本地部署配置”又上来了我猜很多人是被API价格波动吓到了。本地部署没有想象中那么高不可攀但也没有营销号说的那么轻描淡写。我给出一套自己能稳定运行的配置方案。2.1 不同量级模型的最低配置参考先给一张我整理过的参考表。这里的“最低内存”指的是量化后跑推理需要的总内存低于这个值会非常卡或者直接跑不起来。模型量级量化精度最低内存典型用途我的体感7BQ4_K_M8-16GB摘要、翻译、文案日常够用长文效果普通14BQ4_K_M16-32GB写代码、中等推理性价比最高的一档32BQ4_K_M32GBAgent、复杂分析接近在线大模型体验70BQ4_K_M64GB高质量创作内存带宽不够时反而更慢如果你只是给个人博客写摘要7B足够如果你想本地跑一个代码助手我建议至少14B起步如果你要做Agent类的应用32B是一个比较务实的门槛再往上你可能需要一台真正的多卡机器。2.2 部署工具怎么选部署工具不需要自己从头造轮子。我的经验是分场景选本地个人使用首选Ollama。安装后一条命令就能把模型拉下来而且自带一个兼容OpenAI格式的接口很多现有代码不用改就能接。需要在局域网内多设备使用或者想要好看的聊天界面可以在Ollama上面套一层Open WebUI。高并发生产环境用vLLM这类推理引擎它对显存管理和吞吐量做了大量优化但配置复杂度也高。再说一下量化它就是把模型的权重从FP16压缩成更低的整数精度比如4bit。压缩后模型体积变小、推理更快但会损失少量精度。Q4_K_M是我用下来比较平衡的档位效果损失在可接受范围内。2.3 本地部署最容易被忽略的三件事第一上下文窗口。很多本地模型默认上下文只有4k或8k你第一次跑长文档会发现模型“突然失忆”。需要在启动参数里显式调大上下文和KV cache但这会增加内存占用。第二服务守护。本地部署跑起来之后如果只是终端里开着一关窗口服务就没了。我后来写了systemd服务或开机脚本让模型服务常驻再配合健康检查自动重启才算真正“部署”成功。第三安全鉴权。一定要给本地接口加访问令牌不要裸奔。我之前图省事在公司局域网里裸跑了一个模型接口结果别人扫到后拿来当免费API用流量跑了一整天才被发现。提醒本地部署不等于彻底免费。硬件成本、电费、维护时间都是真实开销如果只是低频调用在线API反而更划算。3. AI编程提示词怎么写PyCharm插件与Spring AI实测“AI编程提示词”和“PyCharm AI插件”这两条热搜今天热度都不低。我实测过几款主流的代码场景AI工具今天把真正有用的部分讲透避免你把时间花在搞花活上。3.1 大模型写代码的边界到底在哪里先说结论大模型擅长的是“边界清晰、产出可验证”的任务比如写样板代码、补全函数、生成单元测试、写正则、做数据格式转换。它不擅长的是“需求模糊、依赖隐式知识”的大型架构设计。让AI帮你设计微服务拆分方案你得到的大概率是七分像样的通用答案离能落地还有很长距离。我自己实测过几次让AI给一个FileUpload服务写单元测试它连Mock、临时文件清理、异常分支都考虑到了但当我问它“这个老系统该不该把订单模块拆出去”它给出的都是教科书式话术最后还得靠人拍板。所以正确姿势是把大任务切成小任务每段代码都给足上下文最后用测试来锁住质量。3.2 一套能直接用的AI编程提示词模板我在PyCharm的AI插件里测试过下面这个模板效果比随便丢一句话强很多角色你是资深后端工程师 上下文项目使用Python FastAPI SQLAlchemy数据库为PostgreSQL 任务为service/user_service.py中的create_user函数编写单元测试 约束 1. 使用pytest数据库使用事务回滚不持久化真实数据 2. mock外部邮件发送不mock数据库 3. 覆盖正常创建、邮箱重复、参数缺失三种场景 输出只输出可以运行的代码并附2行运行说明这个模板拆开看其实是四个要素角色需要衔接到领域知识上下文决定了回答范围任务必须具体到函数名约束限制了模型的自由发挥。最后一句“只输出可以运行的代码”也非常重要不让它写长篇大论的解释减少无用输出。3.3 Spring AI和Typesafe AI为什么今天同时被提今天热搜里还有Spring AI和Typesafe AI。这两者都是中间件解决的是“Java/Kotlin应用如何接入AI能力”的问题。Spring AI是Spring生态对AI的标准封装把模型调用、提示词模板、向量存储、结构化输出统一成了一套Java API。如果你的项目本来就在Spring里接入成本很低依赖注入和自动配置都符合团队习惯。Typesafe AI则把重心放在类型安全上。它鼓励你用强类型定义输入输出很多事情在编译期就能发现错误而不是等到运行时才暴露。对代码洁癖比较重的团队这种设计确实更友好。我的建议是不要一上来就学框架先把“模型输入→输出→校验”这条链路在一个脚本里跑通理解其中每一步会发生什么再引入框架来规范化。框架解决的是重复劳动但不能替你理解模型行为。4. AI短剧制作、AI建站、AI旅游三个能直接上手的AI应用场景每天都有新工具冒出来但真正能落地到个人项目里的我观察下来是这三个方向最热AI短剧、AI建站、AI旅游规划。今天把它们放在一起讲因为它们的核心思路都一样用AI加速内容生产中的工作量占比最大的环节。4.1 AI短剧制作全过程拆解先说AI短剧。这类视频通常每一集只有3到5分钟胜在节奏快、冲突密集所以制作流程的核心不是“画质多好”而是“剧情能不能留人”。我一般把流程拆成五步剧本让大模型先写分集大纲每一集只定一个核心冲突再把大纲扩成台词。台词要短句、口语化方便后续配音。分镜把每一段戏拆成镜头并生成画面提示词。这里最关键的是保持角色一致我会在提示词里固定角色描述词和种子。画面生成用图像模型生成关键帧再用视频生成模型把关键帧变成3到5秒的片段。如果平台支持优先选可控性强的方案。配音与音乐TTS生成对白再搭配背景乐和音效。AI配音的语速默认偏慢记得手动提升到1.1到1.2倍。剪辑把片段按剧情节奏拼起来。AI短剧的剪辑其实不需要复杂转场快切反而更合适。要特别提醒版权问题。不要用真实人物的肖像去做所谓“数字分身”也不要在商用项目里直接用来源不明的音乐和画面素材。AI生成内容在多数平台都有标识要求我建议在发布前先看一遍平台的内容政策避免辛苦做完传不上去。4.2 不会代码也能AI建站很多人以为建站必须懂代码其实现在最简单的方式是让大模型直接生成一个完整HTML页面要求包含导航、主视觉、产品介绍、联系方式再让它按照你的品牌色调整样式。生成后本地双击就能看再部署到静态托管平台一个个人作品集网站十几分钟就能上线。这里有几个实操小经验第一不要一次提十几个要求大模型处理不了那么多约束分轮次来先有骨架再调细节。第二改样式时让AI给“修改片段”而不是整页重发这样版本不会乱。第三如果你需要表单收集用户信息可以接第三方表单服务不需要自己写后端。我用这个方法帮朋友的小工作室搭过一个作品展示页实测下来最高效的路径是先让AI出一版完整页面然后自己用浏览器开发者工具盯一遍布局发现问题再针对性调提示词。4.3 AI旅游规划的实际体验AI旅游最近的讨论度也很高。我的实测结论让它做“行程框架”很靠谱让它做“具体决策”要小心。比如我让它输出一份三天两晚某城市的行程它能在一个小时内给出时间线、景点间距、交通方式、人均预算这个效率远超人工查攻略。但它推荐的餐厅营业时间、门票价格经常出现过期信息。所以我现在的做法是让AI先出框架和备选方案再用地图和官方渠道做二次核对最后让AI把所有信息汇总成一张表格。这类应用看起来简单其实是标准的RAG场景你需要给模型提供实时资料而不是让它凭记忆回答。如果你自己做一个本地知识库把官网页面的内容喂进去再让模型基于库回答准确率会明显提高。5. 解决AI幻觉的三个手段以及AI测试开发到底做什么每次聊AI应用一定绕不开“AI幻觉”。今天既然测试开发也在热搜上我干脆把这两个话题放一起讲一个解决“模型说瞎话”一个解决“怎么验证AI做的事是对的”。5.1 为什么AI测试开发成了新的岗位方向“AI测试工程师”最近出现在很多JD里。这不是换个名字而是测试工作本身发生了结构变化过去测试人员主要手写用例现在可以通过AI批量生成用例、自动分析失败日志、合成测试数据甚至让AI根据接口文档生成覆盖正常和异常路径的测试代码。我做过一个小试验给一个内部接口写回归测试。之前人工写需要半天现在让AI读接口文档生成pytest用例跑完失败后再把报错喂回去让它自己修两轮迭代后用例全部通过耗时大约是原来的三分之一。当然AI生成的用例不可能完全替代人工设计它更适合做覆盖率和重复劳动的补充。所以如果你想转这个方向别只学“怎么用AI写测试”真正的关键是搭建一条“生成-执行-反馈”的闭环让AI既是测试编写者也是分析者。5.2 解决AI幻觉的几种实操手段幻觉的本质是模型在信息不足时“脑补”。人也会这样当你不知道答案又必须回答时就容易编细节。要缓解核心是给模型足够的信息来源和校验手段引入RAG检索让回答基于资料库而不是记忆回答里附上引用来源。使用结构化输出用JSON Schema限定字段必填项必须有来源不允许模型自由发挥。在业务侧做规则校验日期、金额、编号这些字段用程序二次校验不依赖模型判断。有条件的话用另一个模型做事实核查把不一致的内容标出来人工复核。我目前用得最多的组合是“RAG 结构化输出 规则校验”。RAG保证内容有出处结构化输出保证格式可控规则校验保证关键字段不漂移。三者配合才敢把模型输出接入生产流程。5.3 一套可闭环的Agent工作流长什么样最后讲Agent工作流。热搜里的“AI Agent”不是花架子核心是让模型能调用外部工具、处理多步任务。我建议用最简单的方式理解用户请求进来之后Agent要做意图识别、计划编排、工具调用、结果校验、记忆更新五个环节。以我常用的“周报整理助手”为例它先读取聊天记录用模型做要点提取再调用日历API补上会议时间生成周报草稿最后发给人确认再发布。这套流程里最重要的设计不是模型多聪明而是每个关键动作旁边都留了人工确认点。文件删除、数据修改这类破坏性操作一定要加确认按钮否则模型一旦理解错代价是你承担不起的。我自己用工作流编排平台这类工具来做比如Dify、Coze这类平台。你先别追求全自动先把流程跑顺再逐步剪掉人工环节。6. 热门AI网站汇总与AI应用开发学习路线2026年9月版最后这一节做个资源收藏夹。今天被问到最多的是两个问题有哪些值得用的AI工具学AI应用开发该按什么顺序走6.1 我日常必用的AI工具分组我按使用场景整理了一份精简版清单不追求全追求每天用得上分类典型用途适合人群文档写作润色、改写、邮件起草运营、行政、学生编程开发代码补全、单测生成、重构辅助工程师设计创意配图、Logo概念、海报初稿设计师、自媒体效率工作流RAG知识库、Agent编排、批量文件整理技术开发者学习研究论文解读、知识点问答、脑图生成学生、研究者我不具体推荐某一款软件因为这类工具迭代太快今天好用的明天可能被收购或改版。你可以按需求种类去搜索对应的最新热门工具试下来哪个顺手就用哪个。6.2 AI应用开发学习路线如果你是零基础想入行我的建议是别从微调开始那是最容易劝退自己的路线。务实的顺序是这样学会调用模型API。理解温度、上下文长度、结构化输出这些基础参数然后用脚本写一个自己的问答助手。学习提示词工程。学会给模型设角色、给上下文、定输出格式这是后面所有能力的地基。掌握RAG。理解向量化、文本切块、召回、重排做一个能回答自己文档问题的知识库。进阶Agent。学习工具调用、计划编排、记忆管理做一个能操作API或文件的Agent。最后再考虑微调。当你发现模型知识不够、风格不对、调用成本太高时再用微调解决问题。这条路线每一步都能产出可展示的成果不会学了三个月还看不见东西。相比之下一上来就调模型很可能浪费大量算力却得不到业务价值。6.3 我是怎么做日报的顺手分享一个我自己的方法。因为要持续跟踪AI动态我会把每天看到的文章链接、工具链接、代码片段都存到本地知识库。晚上抽出15分钟按模型、应用、工程、资源四个目录快速分组再挑最重要的写进日报。这个习惯坚持下来以后日报写作压力会小很多知识库也会越来越大。今天这期日报也是从这个知识库里筛出来的。