ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

多媒体与代码:AI Prompting 入门到高阶

多媒体与代码:AI Prompting 入门到高阶 核心主题AI 不只处理文字还能处理图片、视频、声音、音乐、代码甚至帮你做 App 和数据分析。一、学习目标学完这份资料你应该能说出 AI 的多模态输入和输出类型。理解为什么不同输出类型的速度和成本差别很大。掌握“用图片提示 AI”和“让 AI 生成图片”的基本方法。用GOAL—INPUT—OUTPUT框架提示 AI 构建简单应用。知道什么时候该让 AI 写代码、运行代码、画图。认识声音克隆等技术的伦理风险。二、核心框架AI 模型是一个“输入—输出盒子”AI 模型可以理解成一个黑盒输入 → AI 模型 → 输出1. 常见输入类型Text文本Images图片Music音乐Speech语音Video视频Code代码2. 常见输出类型Text文本Images图片Music音乐Speech语音Video视频Code代码3. 关键结论输入类型的差异没有那么大。输出类型的差异很大因为不同输出生成的速度和成本不同。文本输出快且便宜图片、视频、语音等输出更慢、更贵。4. 输出类型成本速查输出类型速度成本交付方式文本几秒低于 1 美分逐块输出可中途停止图片十几秒几美分一次性生成通常不能提前停止视频更慢更贵成本高生成时间长所以多模态提示词虽然和文本提示词原则相似但因为“慢”和“贵”试错成本更高。三、多模态提示词的核心原则PPT 第 10 页总结了几个原则更多上下文更好信息越具体AI 越容易理解你的目标。使用当前最好的模型不同模型能力不同复杂任务要用更强模型。一次生成多个选项尤其是图片、视频、App 方案不要只生成一次。迭代改进不满意就修改提示词再生成。注意成本和速度图片、视频、语音生成比文本贵很多不要无脑反复试。四、模块一AI 能生成哪些多媒体AI 可以生成图片视频声音、语音克隆音乐代码小游戏、小应用PPT 中的例子AI 设计生日蛋糕然后现实中做出来。生成“人缩小到虫子大小”的视频。克隆人的声音。做一个“打字喂猫”的小游戏。生成鬼屋视频、咖啡店猫店长图片等。伦理提醒能力越大责任越大声音克隆可以做好事修复播客中的错误。给游戏角色配逼真声音。也可能做坏事用亲人声音诈骗。伪造电话、语音消息。学习 AI 技术时必须同时考虑合法、合规、道德。五、模块二图像理解——让 AI 看图1. 图像理解能做什么读白板内容判断课程主题。读餐厅小票帮忙算账。读手写日记整理文字。看多张会议照片总结头脑风暴想法。2. 图像理解的限制AI 能读图片里的基本文字。但可能漏掉细节。复杂视觉识别可能出错。重要数字、计算、专业判断要人工核对。PPT 例子健身器械被认错。小票文字写 $27.30但表格算出 $27.78。说明 AI 输出不一定完全正确。3. 图像理解提示技巧图片要清晰。明确告诉 AI 你要提取什么文字、表格、金额、总结。一次可以给多张图片。对关键数字要求 AI 逐步计算或核对。不确定的地方要求 AI 标注“不确定”。4. 图像理解提示词模板请阅读这张图片提取其中的[文字/表格/账单/笔记]。然后完成[总结/计算/分类]。如果信息不清楚请标注“不确定”。重要计算请列出步骤并核对。六、模块三图像生成——让 AI 画图和改图1. 图像生成能做什么生成全新图片。编辑已有图片。修复老照片去反光、去纹理、改比例。生成信息图、漫画、角色图、场景图。2. 图像生成提示词三要素PPT 第 21 页给出一个很好用的框架要素含义例子Setting场景夜晚咖啡馆、木桌、城市街道Character details角色细节聪明橘猫、穿小围裙、煮咖啡Mood/style氛围与风格卡通、温馨、电影感、赛博朋克示例提示词生成一张夜晚咖啡馆的图片。主体是一只聪明的橘猫穿着小围裙在柜台后煮咖啡。风格为卡通、温馨、奇幻。3. 常用图像风格词Cinematic电影感Cyberpunk赛博朋克Watercolor水彩Anime动漫Cartoon卡通Photorealistic照片写实4. 图像生成原理扩散模型简单理解训练时给图片不断加噪声。模型学会从噪声中恢复图片。生成时从随机噪声开始一步步去噪最后得到图片。所以图像生成有两个特点有随机性每次生成可能不同。可能犯错手部畸形、文字乱码、角色不一致。5. 常见图像生成错误手很奇怪。文字拼错、乱码。同一角色前后不一致。细节不合理。6. 图像生成技巧提示词写清楚场景、角色、风格。多生成几张挑最好的。不满意就迭代。检查文字、手、比例、一致性。注意成本图片比文本贵很多。七、模块四用 AI 构建应用1. 三块积木GOAL—INPUT—OUTPUT积木含义提问方式GOAL要创建什么做一个什么 AppINPUT用户提供什么用户点击、输入、上传什么OUTPUTApp 做什么App 显示、计算、生成什么示例做一个烟花模拟器。用户点击屏幕。App 从底部发射烟花并爆炸显示彩色效果。2. App 例子趣味型链式反应游戏烟花模拟器功能型Pomodoro 番茄钟账单计算器穿搭选择器3. 难度分级更容易更困难简单平台游戏多人联网游戏法语单词测验AI 实时法语反馈单机小工具联网、实时、复杂交互建议从简单想法开始。4. App 构建提示词模板请构建一个[GOAL]。用户可以[INPUT]。App 应该[OUTPUT]。请先做一个简单可运行版本再逐步增加功能。八、模块五用 AI 做数据分析1. AI 可以做什么分析个人数据跑步记录、配速、距离、进步。分析销售数据收入、订单、趋势、季节性、促销、异常值。写代码、运行代码、画图。生成年度总结图、信息图。2. AI 的工具箱AI 可以调用工具Web search网络搜索Write file写文件Read files读文件Run code运行代码3. 什么时候需要运行代码适合让 AI 运行代码的情况数据已经存在。需要计算。需要画图。需要找趋势、异常、排名。流程图用户提示 → 用上下文推理 → 使用工具 → 获得更多上下文 → 最终答案4. 什么时候不需要代码问题原因是否需要代码猫为什么盯着墙常识问题不需要直接回答附近高评分健身房位置相关需要搜索鬼屋计划需要综合推理不一定需要代码我的销售趋势计算和绘图需要代码5. 数据分析提示词模板附件是[数据文件]。请分析[目标]找出[趋势/异常/排名/变化最大项]。请用代码完成计算并生成[图表]。最后用简单语言解释结论。九、整份 PPT 的速查表主题一句话记忆多模态AI 可处理文字、图片、音乐、语音、视频、代码输出成本文本最便宜最快图片、视频更慢更贵提示词原则多上下文、用最好模型、多选项、多迭代图像理解能读基本文字但会漏细节重要信息要核对图像生成三要素场景、角色细节、氛围风格扩散模型从噪声逐步去噪生成图片有随机性常见错误手畸形、文字乱码、角色不一致构建 AppGOAL—INPUT—OUTPUT从简单开始数据分析数据存在 需要计算/画图 → 让 AI 运行代码伦理声音克隆可助人也可诈骗要负责任十、常见误区以为 AI 看图百分百准确错。可能漏细节、认错物体、算错数字。忽略图片和视频生成成本图片、视频比文本贵很多不能无限试。提示词太模糊“画一只猫”不如“夜晚咖啡馆里一只橘猫穿围裙煮咖啡卡通温馨风格”。一上来就做复杂 App先从简单版本开始再迭代。不核对 AI 计算重要账单、销售数据、财务数字要检查。滥用声音克隆不能用于诈骗、伪造、侵权。十一、自测题AI 常见的输入类型有哪些为什么说“输出类型的差异比输入类型更大”文本、图片、视频生成在速度和成本上有什么区别图像理解有什么优点和局限图像生成提示词的三要素是什么扩散模型的基本原理是什么图像生成常见错误有哪些用 AI 构建 App 的三块积木是什么什么时候应该让 AI 运行代码声音克隆可能带来哪些伦理风险简要答案文本、图片、音乐、语音、视频、代码。因为不同输出生成速度和成本差异很大。文本最快最便宜图片更慢更贵视频更慢更贵。能读基本文字但会漏细节、可能认错。Setting、Character details、Mood/style。训练时加噪声生成时从噪声逐步去噪。手畸形、文字乱码、角色不一致等。GOAL、INPUT、OUTPUT。数据存在且需要计算或绘图时。可用于修复播客、角色配音也可用于诈骗、伪造亲人声音。十二、一句话总结AI 可以成为你的多媒体助手、代码助手和数据分析助手但提示词的核心始终是给足上下文、明确目标、多迭代、核对结果、注意成本和伦理。
返回列表