ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

寻找懒人提示词

寻找懒人提示词 背景现在我们使用AI解决问题时需要给出大量的提示词还有记住和学会大量的提示词以及提示词模版这对于像我这样比较懒的人根本不适用。所以我准备探索只用记住最简单的一句提示词获得更好效果。当然就一句话大概率是解决不了什么问题的所以应当从AI生成提示词来入手虽然每次问AI要提示词再发给AI让他解决问题总感觉怪怪的就好像是像“你点奶茶店员问你喝什么你说“你推荐一个”。他说“那就珍珠奶茶少糖。”然后你拿着他写的纸条再排队递给他“我要珍珠奶茶少糖。”他才开始做。”我都有点担心codex给我的用户画像说我有病了。但是效果却出奇的好。如何对比效果呢主要是最终的打分token消耗耗时还有调用次数这里有五种方案你们可以猜一下一下几种提示词哪个效果最好还有一个方案是行不通的结果绝对会出乎你的意料1.提示词生成型 口令“按需求生成执行提示词别执行。”流程拿到执行提示词 → 开新对话粘贴它 → AI 执行并生成方案。2.分步方案“按需求生成全阶段提示词包别执行。”流程拿到全阶段提示词→ 开启新的对话粘贴他→完成上一阶段后将这阶段的提示词交给AI直至结束3.提示词工厂型 口令“生成一条按需求定制提示词的提示词。”流程先得到“提示词生成器” → 用它输入需求获得执行提示词 → 再用执行提示词完成任务。 它比方案 1 多一层4.问诊方案“先问关键问题我不懂的部分请自行假设。”5.三轮审查型 口令“先成稿再审查最后按意见重写。”流程明确分三轮发需求根据需求生成完整方案。这里不写初稿的原因是怕AI开始生成比较低质的内容把初稿发回审查此方案列出漏洞、风险和修改建议暂不重写。把审查意见发回按审查意见重写为最终方案保留不确定项。6.基准方案用于对比直接交给AI不提供额外的提示词本次实验使用的是codex-gpt5.6 Terra 推理强度高为了保证不会出现文档复用的情况加了一条限制本次为独立文档生成任务。禁止读取、搜索、参考当前项目目录下任何已有文档文件。请仅根据本次需求生成全新文档输出到指定新文件不得覆盖或合并任何已有文件。解决的问题题目描述假设你加入一个跨学科团队需要评估并设计一套太空光伏电站。目标是在2040年前向地面一处大型城市电网持续提供1GW净功率全年可用率不低于99.9%设计寿命不少于20年。系统需要在太空采集太阳能将能量传输到地面并接入现有电网。具体技术路线不作预设但方案必须面对现实世界中的技术、建设、经济、安全和法规条件。你可以判断目标无法按期实现但需要给出有依据的结论和仍然值得推进的替代目标。作答要求请以系统负责人身份提交一份完整的可行性判断和实施方案使决策团队能够据此决定是否投入、如何推进。你需要自行识别决定成败的关键问题说明主要判断的依据以及如何逐步验证方案。如果认为原目标不可行应清楚说明原因并提出替代路线。消耗对比表格方案token使用量调用次数耗时方案一0.10167分13秒方案二0.465426分1秒方案三方案四0.182845分45秒方案五0.355220分11秒基准方案0.1215分49秒方案三是彻底失败了原因是大模型理解不了这个意思使用时还出现了很大的幻觉1.直接生成的方案文档2.生成可以生成方案文档的提示词文档。除非继续添加说明那就违背了简单的初衷评分使用的提示词Terra-推理强度极高你是一位严格、客观、中立的航天系统工程评审专家同时具备能源、电网、通信、经济、安全与法规背景。 现在有一个题目评估并设计一套太空光伏电站目标是在 2040 年前向地面一处大型城市电网持续提供 1GW 净功率全年可用率不低于 99.9%设计寿命不少于 20 年。系统需在太空采集太阳能将能量传输到地面并接入现有电网。技术路线不作预设但必须面对现实世界中的技术、建设、经济、安全和法规条件。允许判断目标无法按期实现但必须给出有依据的结论和仍然值得推进的替代目标。 下面有 5 个方案。请你只依据方案内容和题目要求进行评分不要因为文字华丽、篇幅长或语气自信而加分。 一、评分维度与权重 目标达成能力20%能否在 2040 年前实现 1GW 净功率、99.9% 可用率、20 年寿命 技术可行性20%关键技术是否成熟是否依赖未经验证的假设 工程与建设可行性15%发射、在轨组装、地面接收、并网等是否可实施 经济可行性15%成本估算是否合理是否具备可接受的投入产出逻辑 安全与风险控制10%空间安全、地面安全、军事/双用途风险、失效模式 法规与治理可行性10%频率协调、轨道资源、责任、跨境许可、监管路径 验证与迭代路径10%是否给出分阶段验证、关键里程碑和退出机制 二、评分规则 每个维度 1–10 分10 分为最优。 必须给出每个维度的得分和一句核心理由。 加权总分保留两位小数。 如果方案信息不足必须指出缺少什么并说明你是按“缺失即扣分”还是“按合理假设补全”处理。 对五个方案使用同一套标准不得中途改变尺度。 如果某个方案实际上承认目标不可行但给出了有依据的替代路线应在“目标达成能力”上如实扣分但在“验证与迭代路径”“经济可行性”“法规与治理可行性”等维度正常评分不要一票否决。 三、输出格式 先给出评分总表 方案 目标达成 技术可行 工程可行 经济可行 安全风险 法规治理 验证迭代 加权总分 排名 然后逐个方案给出 一句话总评 各维度得分及理由 最大优点 最大硬伤 如果要把该方案推进到可决策阶段必须补充的关键信息 最后给出 最终排名 如果只能选一个方案进入下一阶段选哪个为什么 哪个方案最适合作为“原目标不可行时的替代路线” 五个方案共同忽略的关键问题最终评分叫五终的原因是根据初稿生成了新的文档方案目标达成技术可行工程可行经济可行安全风险法规治理验证迭代加权总分排名一26667785.603二26677795.851基准23446674.105四25446564.304五终27558895.802五个方案的字数统计方案去除空白后的字符数含空白字符数一11,68512,497二8,3809,174基准6,0346,305四6,6527,206五终5,1725,504结论若只看产出质量方案二最高若看“质量提升与资源投入的平衡”方案五终更优方案一则是最低成本下的有效改进。方案四投入较多但增益最小不建议作为默认流程。字数与质量没有正相关。方案做法字符数Token调用耗时评分相对基准提升一先生成执行提示词再新对话执行11,6850.10167分13秒5.601.50二生成全阶段提示词包逐阶段执行8,3800.465426分01秒5.851.75四先问关键问题不懂处自行假设6,6520.182845分45秒*4.300.20五终成稿→审查→按意见重写5,1720.355220分11秒5.801.70基准直接交需求6,0340.10215分49秒4.10—*耗时含重试参考价值低于 Token 和调用次数。方案二的方案质量最高工程量化、成本情景、风险台账和阶段退出机制最完整。代价是 Token、调用和时间均显著增加适合高重要性、一次性正式报告。方案五终仅 5,172 字却获得 5.80 分说明“审查后重写”显著提高了内容密度和自我纠错能力。它比方案二少用约 24% Token、少约 22% 时间但评分仅低 0.05 分是最均衡的默认方案。方案一与基准 Token 消耗相同调用次数反而更少却让评分提高 1.50 分但生成文本最长且未达到方案二、五终的结构化审查深度。适合追求速度、仍希望明显优于直接提问的场景。方案四虽然引入澄清问题理论上有助于需求准确性但在本任务中只比基准高 0.20 分却额外消耗 Token、调用和大量时间。原因很可能是“用户不懂则 AI 自行假设”削弱了问诊的价值既增加了交互又没有真正消除关键不确定性。基准方案速度最快、资源最低但出现关键数量级算术错误且工程、经济、可靠性闭合不足。对这种跨学科高风险任务直接生成不够可靠。字数层面也支持同一结论方案一最长却只排第三方案五终最短却排第二。这说明篇幅不是质量代理变量关键在于是否有明确的验证边界、反思/审查环节和可执行的阶段门。建议选择正式、重要、允许较高成本方案二。日常高质量交付的默认流程方案五终。快速且低成本地提升直接生成结果方案一。方案四不建议沿用原样若保留应把“自行假设”改为“仅对不影响结论的缺失项自行假设影响技术路线、成本、许可或安全的缺失项必须列为条件和风险”。这个结果我还是特别出乎我的意料虽然从token的使用量就可以大概猜到了但是不同的提示词效果之间的差距还是很大的。那么我们是否可以将2和5结合起来所以继续改进主要是有两个地方可以进行结合1.审查提示词包给出更好的提示词包在生成一个方案二改提示词2.直接审查现成的方案二生成一个方案二审3.审查修改1生成方案最后再进行效果检查二改提示词审那么直接上最后的数据方案去空白字符数含空白字符数一11,68511,892二8,3808,598四6,6526,979五终5,1725,246基准6,0346,091二改提示词8,1528,532二审7,4547,635二改提示词审9,3479,683方案方法技术评审分Token调用耗时*基准直接生成4.100.10215分49秒一生成执行提示词再执行5.600.10167分13秒二全阶段提示词包逐阶段执行5.850.465426分01秒四问关键问题不懂处自行假设4.300.182845分45秒五终成稿→审查→重写5.800.355220分11秒二改提示词先审查方案二的提示词包再执行6.100.506127分20秒二审直接审查方案二成稿并修改6.100.857551分00秒二改提示词审审查“二改提示词”结果后生成最终稿6.251.059857分04秒方案目标达成技术可行工程可行经济可行安全风险法规治理验证迭代加权总分排名一26667785.606二26677795.854基准23446674.108四25446564.307五终27558895.805二改提示词27668896.10并列 2二审27668896.10并列 2二改提示词审27678896.251核心结论质量最高二改提示词审。它补强了证据等级、热—质量闭合、可靠性边界、许可与退出规则且避免了把情景计算伪装成商业承诺。代价也最大相比“二改提示词”多用 0.55 Token、37 次调用、约 30 分钟只换来 0.15 分提升。因此适合董事会、投资评审、监管沟通等高风险正式材料。方案二系列的最佳效率点二改提示词。相比原方案二资源只小幅增加却从 5.85 提升至 6.10而“二审”取得同样评分却额外消耗更多 Token、调用和时间。就这一次样本而言先改进提示词再执行优于直接审查既有成稿。日常高质量默认流程五终。它以 0.35 Token、52 次调用和约 20 分钟达到 5.80 分和原方案二的 5.85 基本处于同一质量档但资源更少。三轮“成稿—审查—重写”是最容易复用、也最不依赖复杂提示词包的流程。低成本快速方案方案一。与基准 Token 相同、调用更少但技术评分从 4.10 提升到 5.60。它不如审查型流程严谨却是“快速生成可用初稿”的最佳性价比选择。不建议原样采用方案四。问诊本应消除需求不确定性但“我不懂的部分请自行假设”抵消了这一优势既增加交互又没有要求 AI 将关键假设转化为明确的决策门。它仅比基准高 0.20 分收益不匹配资源投入。字数不代表质量。方案一最长却只排中游五终最短却接近方案二二改提示词审并非最长但评分最高。真正影响质量的是是否做到区分事实与假设、审查算术和系统边界、建立可验证的阶段门以及允许停止。建议的选择方式快速形成较可靠初稿方案一。日常正式报告方案五终。复杂工程/投资议题且需全阶段提示词二改提示词。对外提交、重大投资或高安全风险决策二改提示词审。不建议选择二审被二改提示词在本样本中“同分、低资源”压制和原方案四。需要保留的客观限制是这些是单次生成样本技术评分是专家判断而非统计显著性检验例如 5.80、5.85、6.10 之间的小差距不应被理解为稳定的绝对能力差距。但“二审资源显著更高而质量未明显高于二改提示词”“最终审查的边际收益递减”这两个趋势较明确。最终的意见就是想要快速高质就是先生成提示词提示词生成型 口令“按需求生成执行提示词别执行。”质量想要更高就使用提示词包再审查提示词“以最挑剔的反驳者攻击这个提示词并给出修改好的提示词方案”
返回列表