高质量提示词是共同增益项
在两套系统内,高质量提示词都优于一般版。主要提升来自证据纪律、事实/推断/假设区分、缺失信息处理,以及 Target → Action → Validation 的完整输出约束。
用同一组春节集卡任务,对比两套知识工作流,并验证提示词质量与 WeKnora 检索配置对回答质量的影响。
先看结果,再看测试设计与完整证据。
在两套系统内,高质量提示词都优于一般版。主要提升来自证据纪律、事实/推断/假设区分、缺失信息处理,以及 Target → Action → Validation 的完整输出约束。
优势集中在来源定位、指标口径区分和实验工程化细节。第 1 组计划 12 个样本中有 1 个结果缺失,因此结论不能解读为完整的 12/12 横向胜负。
两侧使用的模型、推理档位和 Wiki 生成方式不同,当前结果是“系统 + 模型 + Wiki”的叠加。若要隔离系统效果,需要统一模型、语料、提示词和检索预算后复测。
拉满知识与检索配置时,事实覆盖和口径精度更稳定;温度 0.7 继续作为基线,0.5 可作为偏稳定的备选。激励预算分配题对智能体配置变化不太敏感,但目前样本较少,仍需继续验证。
三道题分别验证端到端迁移、证据可靠性与预算方案的测算自洽。
我们计划在国庆节复用集卡玩法做一档拉新活动。请基于知识库中春节集卡项目的历史资料,输出一份完整增长方案,包含:
1)Target:保守目标、冲刺目标,以及完整的测算过程和关键假设;
2)Action:目标人群圈定、激励机制设计、触达与实现路径;
3)Validation:实验设计(对象/分组/指标/周期/回收标准)、归因方法和 ROI 预估。
请复盘知识库中的春节集卡活动:活动目标是什么、核心机制怎么设计(集卡规则、奖励结构)、关键数据结果如何(参与、裂变、留存、成本相关指标)、复盘中记录了哪些有效做法和哪些问题?请逐条注明数据来自哪份文档。
帮我给下一个集卡活动设计激励预算的分配方案,直接给出每个环节的预算占比和具体金额。
本次活动预算100万元,日常活动页面日均流量是50万UV,日均主动访问新用户5000人,2000参与活动裂变人邀请人总计能带来8000人,人均4人。
页面只说明设计差异,不展示或提供可复制的提示词原文。
保留系统对照、单变量实验和逐项人工复核结果。
| 提示词 | 实验组 | 系统 | 考题 | 回答文件 | 是否触红线 | 关键优点(事实/结构/迁移) | 关键缺点(编造/遗漏/伪精确) | 备注 |
|---|---|---|---|---|---|---|---|---|
| 好版 | A | WeKnora | Q1 国庆集卡拉新增长方案 | weknora好提示词-国庆集卡拉新增长方案.md | 否 | 六段完整;【事实/推断/假设】三级标注;缺失信息清单完整;保守1-1.5万/冲刺4-5万漏斗可溯;AB实验+归因+ROI三档 | "日活增量峰值61W"实为源文件增量DAU总量(口径小瑕疵);ROI三档0.36/0.96/1.38易读混 | 好版标杆;Q1未把注入的100万当已知,正确列缺失 |
| 好版 | C | Obsidian | Q1 国庆集卡拉新增长方案 | obsidian好提示词-国庆集卡拉新增长方案.md | 否(标杆) | 主指标"增量有效新用户"最严谨;0.76%明确不能等同国庆增量率;A/B/C/D四区+社交污染+MDE样本量+A/A+预设指标注册;全三级标注+路径 | 篇幅极长(约500行);1.8/3万基于假设300万种子UV(已标条件值,非问题) | 红线④(给验证)典范;仅复制方法不照搬数值 |
| 好版 | A | WeKnora | Q2 春节集卡活动复盘 | weknora好提示词-春节集卡活动复盘.md | 否 | 六部分极详尽;口径差异显式标注(75% vs 41%);来源逐条;可迁移经验针对性强 | 篇幅过长;大部门层面目标表未纳入(小遗漏) | ROI三档1.03/0.62/1.02全对上源 |
| 好版 | C | Obsidian | Q2 春节集卡活动复盘 | obsidian好提示词-春节集卡活动复盘.md | 否(标杆) | 9节结论先行;〔F1〕〔A1〕编号溯源;显式区分6组易混淆口径;Continue/Stop/Start框架 | 篇幅长 | 口径处理全场最佳 |
| 好版 | A | WeKnora | Q3 激励预算分配方案 | weknora好提示词-预算分配.md | 否 | 引用春节单/多奖池结构正确;改三层激励逻辑清晰;L1-L4(50/25/15/10%)方案+风险表完整;193万毛利口径正确 | 缺活动周期/个税/设计费是否含在100万里等补充确认项(已列为缺失信息) | A-Q3:历史证据+边界+方案,结构克制;现在参数已给,边界处理合规 |
| 好版 | C | Obsidian | Q3 激励预算分配方案 | obsidian好提示词-预算分配.md | 否 | 100万分8环节围绕"有效新用户结算"(不按分享次数);止损线清晰;引用带line号;两档目标测算+三句话方案 | "人均4人"直接采用未质疑;未引用春节实际预算做对照(B-Q3做了) | 参数已给,评分调整为合规的全信息方案 |
| 一般版 | B | WeKnora | Q1 国庆集卡拉新增长方案 | weknora一般提示词-国庆集卡拉新增长方案.md | 疑似③·需确认 | 漏斗测算完整;护栏+3臂实验(A/B/C)+ROI敏感性+风险止损齐全;引春节真实数据 | 把100万/50万UV/5000/2000→8000列"已确认/用户提供"(标准Q1未给);无三级标注;"邀请者人均1.6人"假设弱 | 与A-Q1对比:A列缺失、B当已知→一般版未防住边界陷阱 |
| 一般版 | D | Obsidian | Q1 国庆集卡拉新增长方案 | obsidian一般提示词-国庆集卡拉新增长方案.md | 疑似③·需确认 | 主指标"有效新增"清晰;列出"8000人中多少有效新增"等真正缺失;三实验完整+扩量/停止标准;引用带line号 | 同样把100万/基线当"前面确认的";比C-Q1缺MDE/样本量/A-A;"人均4人"未质疑 | 一般版Obsidian质量近好版WeKnora→模型/wiki差异记为混杂变量 |
| 一般版 | B | WeKnora | Q2 春节集卡活动复盘 | weknora一般提示词-春节集卡活动复盘.md | 否 | 极详尽;来源齐全(启动/最终/全/量化/敬婷/PRD);分业务导流明细;13问题表带来源 | 篇幅过长;个别子口径(如分业务导流105.7万等)需核对;大部门数据未纳入 | 敬婷119.35万明细引用正确 |
| 一般版 | D | Obsidian | Q2 春节集卡活动复盘 | obsidian一般提示词-春节集卡活动复盘.md | 否 | 结论先行;line号溯源极细;显式标注邀新16% vs 26.7%冲突;早/晚目标不混用 | 比C-Q2略简(无6组混淆口径系统表);一般版无三级标注;可迁移判断较短 | 一般版中溯源最强 |
| 一般版 | B | WeKnora | Q3 激励预算分配方案 | weknora一般提示词-预算分配.md | 否 | 正确引用敬婷"已开支119.35w"(73.2/13.3/14万);L1-L4(35/33/20/12%)推导自春节且内部一致;风险+对照表 | 占比由73.2/119.35折算需注明;「119.35w明细」仅列三项计100.5万,漏设计费18.85万——非编造,表述不严谨 | B-Q3:瓜分61%→33%大幅压降,拉新12%→35%翻三倍,激进但自洽;参数已给,可评合规 |
| 一般版 | D | Obsidian | Q3 激励预算分配方案 | — | 缺文件·未测评 | — | 目录缺 obsidian一般提示词-预算分配.md | 需补跑D-Q3或确认未执行 |
| PK | 哪个更优 | 原因 |
|---|---|---|
| Q1:好版-WeKnora VS 好版-Obsidian | 好版-Obsidian | C-Q1 是标杆:主指标"增量有效新用户"最严谨,含 MDE/A-A/样本量;A-Q1 六段完整但工程化精度稍弱 |
| Q2:好版-WeKnora VS 好版-Obsidian | 好版-Obsidian | C-Q2 标杆:6 组易混淆口径系统表+编号溯源;A-Q2 详尽但无系统化口径表 |
| Q3:好版-WeKnora VS 好版-Obsidian | 好版-Obsidian(略优) | C-Q3 引用带 line 号、止损线清晰;A-Q3 三层激励迁移逻辑更好但溯源较弱 |
| Q1:一般版-WeKnora VS 好版-Obsidian | 好版-Obsidian | C-Q1 标杆 vs B-Q1 边界陷阱(参数当已知/无三级标注/假设弱) |
| Q2:一般版-WeKnora VS 好版-Obsidian | 好版-Obsidian | C-Q2 标杆 vs B-Q2 可迁移判断短板;C-Q2 编号溯源系统化 |
| Q3:一般版-WeKnora VS 好版-Obsidian | 好版-Obsidian | C-Q3 引用 line 号+止损线清晰;B-Q3 119.35W明细漏设计费(表述不严谨)、拉新激励纯现金无万能卡组合 |
| Q1:好版-WeKnora VS 一般版-WeKnora | 好版-WeKnora | A-Q1 三级标注+缺失信息清单+AB实验完整;B-Q1 把 100 万等参数当"已确认"(边界陷阱) |
| Q2:好版-WeKnora VS 一般版-WeKnora | 好版-WeKnora | A-Q2 口径差异显式标注(75% vs 41%);B-Q2 更全但溯源结构化弱、可迁移判断一般 |
| Q3:好版-WeKnora VS 一般版-WeKnora | 好版-WeKnora | A-Q3 三层激励机制创新 vs B-Q3 换权重;A-Q3 结构克制+边界处理更好 |
| Q1:好版-Obsidian VS 一般版-Obsidian | 好版-Obsidian | C-Q1 含 MDE/样本量/A-A 工程化;D-Q1 缺这些细节 |
| Q2:好版-Obsidian VS 一般版-Obsidian | 好版-Obsidian | C-Q2 6 组混淆口径系统表;D-Q2 line 号溯源细但篇幅短、可迁移判断弱 |
| Q3:好版-Obsidian VS 一般版-Obsidian | / | 缺文件 |
- 同系统内,好版对一般版「通杀」:无论 WeKnora 还是 Obsidian,好版提示词在所有题目上都胜过一般版——说明提示词调优对两套系统都有明确收益。
- 同提示词下,Obsidian/Codex 对 WeKnora「全胜」:好版 3:0、一般版 3:0(含 D-Q3 缺文件默认胜),Obsidian 侧胜在溯源精度(带 line 号)、口径区分(6 组混淆口径表)和工程化细节(MDE/样本量/A-A)。
- 但这是「系统+模型+Wiki」三重变量的叠加结果,不是纯系统差异:Codex 侧用了 GPT-5.6 sol(极高推理档),WeKnora 侧是 deepseek-v4-pro,两边 Wiki 生成方式也不同——真要隔离系统差异,需要把模型对齐到同一个端点再比。
说明:本组目标是看 WeKnora 自身旋钮的影响,不需要 Obsidian 做参照。所有测试都在 WeKnora 春节项目智能体上完成,通过只改一个变量、其他拉满,判断每个旋钮的实际价值。
| 思路 | 知识库配置 | 智能体配置 | 问题 | 实验组 | 回答文件 | 是否触红线 | 关键优点(事实/结构/迁移) | 关键缺点(编造/遗漏/伪精确) | 备注 |
|---|---|---|---|---|---|---|---|---|---|
| 库知识配置(智能体配置拉满不动) | 拉满 | 拉满 | Q1 国庆集卡拉新增长方案 | 1 | 实验组1.md | 否 | 六段完整T→A→V;【事实/推断/假设】三级标注清晰;漏斗逐层推导(168.35W→49%→83%→16%→22%→拉新率);AB实验(user_id尾号奇偶分流)+扩量标准明确;ROI三档(保守0.83/冲刺0.97) | 篇幅较长(约420行);"激励出款60%春节"为【推断】;首日冷启动未单列预算 | 拉满+Q1标杆;春节数据回流与适用边界标注完整 |
| 库知识配置(智能体配置拉满不动) | 拉满 | 拉满 | Q2 春节集卡活动复盘 | 2 | 实验组2.md | 否 | 多源溯源(最终版/全量版/启动/量化/敬婷/PRD);6组易混淆口径显式区分(增量DAU 61W vs 507W、1300W vs 5055W、次留75% vs 41%等);三阶段发卡策略完整;研发投入459人天等具体数据 | 篇幅较长;个别口径(如519W vs 5055W)需再核对;矩阵App导流明细略有缺失 | 拉满+Q2完整复盘;与实验组5对比可看出检索粒度影响 |
| 库知识配置(智能体配置拉满不动) | 拉满 | 拉满 | Q3 激励预算分配方案 | 3 | 实验组3.md | 否 | 5环节分配清晰(基础40/邀新28/进阶15/任务10/缓冲7);含个税代扣缓冲;含饼图直观;人均测算可溯(40万÷52.5万=0.76元/人,提现率45%实支约18万) | 假设7天周期未确认;缺业务转化单价数据;缺边界条件显式提示 | 拉满+Q3合规分配;作为拉低对比基准(实验组6) |
| 库知识配置(智能体配置拉满不动) | 拉低 | 拉满 | Q1 国庆集卡拉新增长方案 | 4 | 实验组4.md | 否 | 仍能给完整T→A→V六段;显式列举与春节的差异(节日心智/竞品/流量/周期/防封);明确给出"假设100万预算"等边界条件;含ROI 0.83/0.97 | 数据细节因拉低配置可能模糊;缺"84%流量来自非固定资源位"等关键事实精确引用;扩量数字粗略 | 与实验组1对比可见检索粒度对Q1方案质量的影响 |
| 库知识配置(智能体配置拉满不动) | 拉低 | 拉满 | Q2 春节集卡活动复盘 | 5 | 实验组5.md | 否 | 仍能给完整复盘;核心数字(1300W/9.9W/319W/75%次留等)正确;ROI 1.02明确;问题归类(品牌/发发/矩阵)清晰 | 数据精度不如实验组2;部分口径(如增量DAU的多日累计)表述较简化;缺少具体研发/物料投入数据 | 与实验组2对比可见库知识拉低对Q2复盘数据精度的影响 |
| 库知识配置(智能体配置拉满不动) | 拉低 | 拉满 | Q3 激励预算分配方案 | 6 | 实验组6.md | 否 | 仍能给5环节分配(基础38/邀新28/进阶15/任务11/缓冲8);含个税;人均测算有(38万÷52.5万≈0.72元/人) | 占比与实验组3略有差异(基础38 vs 40,缓冲8 vs 7);缓冲占比略高可能因历史数据召回不全 | 与实验组3对比,占比差异说明分块粒度对历史数据召回精度有影响 |
| 智能体配置(库知识固定拉满,即绑定「春节项目」库) | 拉满 | 拉低 | Q3 激励预算分配方案 | 7 | 实验组7.md | 否 | 列出已知/缺失/假设清晰;6环节分配(集卡50/裂变17/实物10/任务10/首日8/机动5);人均测算可溯(50万÷41万=1.2元/人);阶梯裂变奖励设计 | 仅跑Q3可能掩盖智能体拉低对其他题目的影响;环节设计与春节两阶段绑定创新性弱;5%机动比例偏低 | 智能体拉低+仅Q3;与实验组3对比可看出拉低对Q3影响有限(Q3对智能体配置的依赖低于Q1/Q2) |
| 温度极值(其他全部拉满,提示词用好版) | 日常配置 | 拉满但温度0.1 | Q1 国庆集卡拉新增长方案 | 8 | 实验组8.md | 否 | 低温保守不容易编造;列出已知/缺失/假设清晰;预算分配完整(8环节带个税7%) | 温度0.1下生成可能过于机械缺乏发散;可能漏掉边界情况或创新方案;适应性弱 | 温度极值测试之一;验证"温度过低是否影响方案创造性" |
| 温度极值(其他全部拉满,提示词用好版) | 日常配置 | 拉满但温度0.5 | Q1 国庆集卡拉新增长方案 | 9 | 实验组9.md | 否 | 中等温度下平衡稳定性与创造性;5环节分配(40/28/15/10/7)+首日冷启动8% | 与0.7相比略保守;适应性中等 | 温度极值测试之一;验证"中等温度与默认0.7的差距" |
| 温度极值(其他全部拉满,提示词用好版) | 日常配置 | 拉满但温度1 | Q1 国庆集卡拉新增长方案 | 10 | 实验组10.md | 待评估 | 高温下发散空间大;可能给出更具创意的方案 | 温度1下可能引入编造数据或不稳定内容;需核对所有数字的真实性 | 温度极值测试之一;关注"温度1是否引入事实编造" |
| PK | 哪个更优 | 原因 |
|---|---|---|
| 实验组1 vs 实验组4(库知识拉满 vs 拉低,Q1) | 实验组1(库知识拉满略胜) | 拉满配置下三级标注体系完整、漏斗推导每个数字可溯、AB实验设计带扩量标准;拉低配置(实验组4)虽也能给完整T→A→V六段,但事实精确度下降、扩量数字粗略 |
| 实验组2 vs 实验组5(库知识拉满 vs 拉低,Q2) | 实验组2(库知识拉满胜) | 拉满配置下6组易混淆口径显式区分、研发投入459人天等具体数据齐全;拉低配置(实验组5)核心数字正确但口径精度和细节丢失 |
| 实验组3 vs 实验组6(库知识拉满 vs 拉低,Q3) | 实验组3(库知识拉满略胜) | 拉满配置下基础瓜分40%(拉低38%)、缓冲7%(拉低8%),差异虽小但说明分块粒度影响历史数据召回精度,进而影响分配比例推算 |
| 实验组3 vs 实验组7(智能体配置拉满 vs 拉低,Q3) | 实验组3(智能体拉满略胜) | 智能体拉满的环节设计更系统(40/28/15/10/7);拉低配置(实验组7)的6环节(50/17/10/10/8/5)虽有创意但与历史两阶段绑定过强、机动比例偏低。Q3对智能体配置的依赖度低于Q1/Q2,所以差距相对小 |
| 实验组8 vs 实验组9 vs 实验组10(温度0.1/0.5/1.0,Q1) | 实验组9(温度0.5最稳) | 温度0.1(实验组8)过于机械缺乏发散;温度1(实验组10)有编造风险需复核;温度0.5(实验组9)在稳定性与创造性之间最平衡,作为备用值值得考虑 |
| 温度0.7(拉满默认)vs 温度0.5/1.0 | 温度0.7仍是基线 | 0.5偏保守、1.0偏冒险,0.7在事实稳定性与方案完整性上最优 |