Growth Work logoGrowth Work← 返回产品测评

双系统与 WeKnora 配置测评

用同一组春节集卡任务,对比两套知识工作流,并验证提示词质量与 WeKnora 检索配置对回答质量的影响。

3 道固定问题双系统对照配置消融人工复核

结论先行

先看结果,再看测试设计与完整证据。

01

高质量提示词是共同增益项

在两套系统内,高质量提示词都优于一般版。主要提升来自证据纪律、事实/推断/假设区分、缺失信息处理,以及 Target → Action → Validation 的完整输出约束。

02

Codex + Obsidian 在可比样本中方向性领先

优势集中在来源定位、指标口径区分和实验工程化细节。第 1 组计划 12 个样本中有 1 个结果缺失,因此结论不能解读为完整的 12/12 横向胜负。

03

结果不是纯系统差异

两侧使用的模型、推理档位和 Wiki 生成方式不同,当前结果是“系统 + 模型 + Wiki”的叠加。若要隔离系统效果,需要统一模型、语料、提示词和检索预算后复测。

04

WeKnora 优先保留完整检索配置

拉满知识与检索配置时,事实覆盖和口径精度更稳定;温度 0.7 继续作为基线,0.5 可作为偏稳定的备选。激励预算分配题对智能体配置变化不太敏感,但目前样本较少,仍需继续验证。

适用边界这是一轮方向性产品测评,用于定位机制差异和后续实验方向,不用于宣称某个工具在所有场景中绝对更优。

固定考题

三道题分别验证端到端迁移、证据可靠性与预算方案的测算自洽。

Q1 真实问题 · 迁移型(考完整 T→A→V 与迁移能力)

我们计划在国庆节复用集卡玩法做一档拉新活动。请基于知识库中春节集卡项目的历史资料,输出一份完整增长方案,包含:
1)Target:保守目标、冲刺目标,以及完整的测算过程和关键假设;
2)Action:目标人群圈定、激励机制设计、触达与实现路径;
3)Validation:实验设计(对象/分组/指标/周期/回收标准)、归因方法和 ROI 预估。
  • 考察重点:六段输出是否完整;数字是否有来源或假设标注;是"提炼方法"还是"照抄春节集卡"。
  • 评分侧重:目标测算、方案质量、实验设计、迁移能力。

Q2 真实问题 · 证据型(考检索召回与事实可靠)

请复盘知识库中的春节集卡活动:活动目标是什么、核心机制怎么设计(集卡规则、奖励结构)、关键数据结果如何(参与、裂变、留存、成本相关指标)、复盘中记录了哪些有效做法和哪些问题?请逐条注明数据来自哪份文档。
  • 考察重点:检索是否召回到核心文档;有没有编造资料里不存在的数字;引用是否可溯源。
  • 评分侧重:证据使用、事实可靠、内容完整。

Q3 预算分配问题(考方案设计与事实准确)

帮我给下一个集卡活动设计激励预算的分配方案,直接给出每个环节的预算占比和具体金额。
本次活动预算100万元,日常活动页面日均流量是50万UV,日均主动访问新用户5000人,2000参与活动裂变人邀请人总计能带来8000人,人均4人。
  • 已知条件:总预算 100 万、日均 50 万 UV、日均主动新用户 5000 人、裂变基线 2000→8000(人均 4)。
  • 合格表现:基于已知条件做分层分配,每层有测算依据和春节数据参照;各层金额自洽、风险识别到位。
  • 红线表现:编造预算外的不存在的数字、引用春节数据时金额/占比算错。
  • 评分侧重:方案质量、事实准确、测算自洽。

两类提示词如何区分

页面只说明设计差异,不展示或提供可复制的提示词原文。

高质量版本

强调证据纪律与完整答案合同

  • 明确 Target、Action、Validation 的职责与输出顺序
  • 关键事实必须可追溯,并区分事实、推断和假设
  • 信息不足时先识别缺口,再追问或给条件性结论
  • 历史经验只作为方法证据,同时说明迁移边界
一般版本

保留框架,但减少强约束

  • 仍要求读取资料并按增长阶段组织回答
  • 具备基础来源意识,但缺少严格的证据映射规则
  • 对缺失信息、数字边界和实验标准约束较弱
  • 更接近普通产品经理自然编写的提示方式

实验矩阵与完整反馈

保留系统对照、单变量实验和逐项人工复核结果。

第 1 组:提示词效果对比(2×2 四个实验组)

固定不动:知识库/wiki 现状、WeKnora 智能体配置拉满(见 4.1 表)、模型 deepseek-v4-pro、温度 0.7。

只变两个因素:系统(WeKnora / Obsidian)× 提示词(好版 / 一般版)。

第 1 组测试反馈表头

提示词 实验组 系统 考题 回答文件 是否触红线 关键优点(事实/结构/迁移) 关键缺点(编造/遗漏/伪精确) 备注
好版 A WeKnora Q1 国庆集卡拉新增长方案 weknora好提示词-国庆集卡拉新增长方案.md 六段完整;【事实/推断/假设】三级标注;缺失信息清单完整;保守1-1.5万/冲刺4-5万漏斗可溯;AB实验+归因+ROI三档 "日活增量峰值61W"实为源文件增量DAU总量(口径小瑕疵);ROI三档0.36/0.96/1.38易读混 好版标杆;Q1未把注入的100万当已知,正确列缺失
好版 C Obsidian Q1 国庆集卡拉新增长方案 obsidian好提示词-国庆集卡拉新增长方案.md 否(标杆) 主指标"增量有效新用户"最严谨;0.76%明确不能等同国庆增量率;A/B/C/D四区+社交污染+MDE样本量+A/A+预设指标注册;全三级标注+路径 篇幅极长(约500行);1.8/3万基于假设300万种子UV(已标条件值,非问题) 红线④(给验证)典范;仅复制方法不照搬数值
好版 A WeKnora Q2 春节集卡活动复盘 weknora好提示词-春节集卡活动复盘.md 六部分极详尽;口径差异显式标注(75% vs 41%);来源逐条;可迁移经验针对性强 篇幅过长;大部门层面目标表未纳入(小遗漏) ROI三档1.03/0.62/1.02全对上源
好版 C Obsidian Q2 春节集卡活动复盘 obsidian好提示词-春节集卡活动复盘.md 否(标杆) 9节结论先行;〔F1〕〔A1〕编号溯源;显式区分6组易混淆口径;Continue/Stop/Start框架 篇幅长 口径处理全场最佳
好版 A WeKnora Q3 激励预算分配方案 weknora好提示词-预算分配.md 引用春节单/多奖池结构正确;改三层激励逻辑清晰;L1-L4(50/25/15/10%)方案+风险表完整;193万毛利口径正确 缺活动周期/个税/设计费是否含在100万里等补充确认项(已列为缺失信息) A-Q3:历史证据+边界+方案,结构克制;现在参数已给,边界处理合规
好版 C Obsidian Q3 激励预算分配方案 obsidian好提示词-预算分配.md 100万分8环节围绕"有效新用户结算"(不按分享次数);止损线清晰;引用带line号;两档目标测算+三句话方案 "人均4人"直接采用未质疑;未引用春节实际预算做对照(B-Q3做了) 参数已给,评分调整为合规的全信息方案
一般版 B WeKnora Q1 国庆集卡拉新增长方案 weknora一般提示词-国庆集卡拉新增长方案.md 疑似③·需确认 漏斗测算完整;护栏+3臂实验(A/B/C)+ROI敏感性+风险止损齐全;引春节真实数据 把100万/50万UV/5000/2000→8000列"已确认/用户提供"(标准Q1未给);无三级标注;"邀请者人均1.6人"假设弱 与A-Q1对比:A列缺失、B当已知→一般版未防住边界陷阱
一般版 D Obsidian Q1 国庆集卡拉新增长方案 obsidian一般提示词-国庆集卡拉新增长方案.md 疑似③·需确认 主指标"有效新增"清晰;列出"8000人中多少有效新增"等真正缺失;三实验完整+扩量/停止标准;引用带line号 同样把100万/基线当"前面确认的";比C-Q1缺MDE/样本量/A-A;"人均4人"未质疑 一般版Obsidian质量近好版WeKnora→模型/wiki差异记为混杂变量
一般版 B WeKnora Q2 春节集卡活动复盘 weknora一般提示词-春节集卡活动复盘.md 极详尽;来源齐全(启动/最终/全/量化/敬婷/PRD);分业务导流明细;13问题表带来源 篇幅过长;个别子口径(如分业务导流105.7万等)需核对;大部门数据未纳入 敬婷119.35万明细引用正确
一般版 D Obsidian Q2 春节集卡活动复盘 obsidian一般提示词-春节集卡活动复盘.md 结论先行;line号溯源极细;显式标注邀新16% vs 26.7%冲突;早/晚目标不混用 比C-Q2略简(无6组混淆口径系统表);一般版无三级标注;可迁移判断较短 一般版中溯源最强
一般版 B WeKnora Q3 激励预算分配方案 weknora一般提示词-预算分配.md 正确引用敬婷"已开支119.35w"(73.2/13.3/14万);L1-L4(35/33/20/12%)推导自春节且内部一致;风险+对照表 占比由73.2/119.35折算需注明;「119.35w明细」仅列三项计100.5万,漏设计费18.85万——非编造,表述不严谨 B-Q3:瓜分61%→33%大幅压降,拉新12%→35%翻三倍,激进但自洽;参数已给,可评合规
一般版 D Obsidian Q3 激励预算分配方案 缺文件·未测评 目录缺 obsidian一般提示词-预算分配.md 需补跑D-Q3或确认未执行

第 1 组 PK 表(成对对比)

PK 哪个更优 原因
Q1:好版-WeKnora VS 好版-Obsidian 好版-Obsidian C-Q1 是标杆:主指标"增量有效新用户"最严谨,含 MDE/A-A/样本量;A-Q1 六段完整但工程化精度稍弱
Q2:好版-WeKnora VS 好版-Obsidian 好版-Obsidian C-Q2 标杆:6 组易混淆口径系统表+编号溯源;A-Q2 详尽但无系统化口径表
Q3:好版-WeKnora VS 好版-Obsidian 好版-Obsidian(略优) C-Q3 引用带 line 号、止损线清晰;A-Q3 三层激励迁移逻辑更好但溯源较弱
Q1:一般版-WeKnora VS 好版-Obsidian 好版-Obsidian C-Q1 标杆 vs B-Q1 边界陷阱(参数当已知/无三级标注/假设弱)
Q2:一般版-WeKnora VS 好版-Obsidian 好版-Obsidian C-Q2 标杆 vs B-Q2 可迁移判断短板;C-Q2 编号溯源系统化
Q3:一般版-WeKnora VS 好版-Obsidian 好版-Obsidian C-Q3 引用 line 号+止损线清晰;B-Q3 119.35W明细漏设计费(表述不严谨)、拉新激励纯现金无万能卡组合
Q1:好版-WeKnora VS 一般版-WeKnora 好版-WeKnora A-Q1 三级标注+缺失信息清单+AB实验完整;B-Q1 把 100 万等参数当"已确认"(边界陷阱)
Q2:好版-WeKnora VS 一般版-WeKnora 好版-WeKnora A-Q2 口径差异显式标注(75% vs 41%);B-Q2 更全但溯源结构化弱、可迁移判断一般
Q3:好版-WeKnora VS 一般版-WeKnora 好版-WeKnora A-Q3 三层激励机制创新 vs B-Q3 换权重;A-Q3 结构克制+边界处理更好
Q1:好版-Obsidian VS 一般版-Obsidian 好版-Obsidian C-Q1 含 MDE/样本量/A-A 工程化;D-Q1 缺这些细节
Q2:好版-Obsidian VS 一般版-Obsidian 好版-Obsidian C-Q2 6 组混淆口径系统表;D-Q2 line 号溯源细但篇幅短、可迁移判断弱
Q3:好版-Obsidian VS 一般版-Obsidian / 缺文件
  1. 同系统内,好版对一般版「通杀」:无论 WeKnora 还是 Obsidian,好版提示词在所有题目上都胜过一般版——说明提示词调优对两套系统都有明确收益。
  2. 同提示词下,Obsidian/Codex 对 WeKnora「全胜」:好版 3:0、一般版 3:0(含 D-Q3 缺文件默认胜),Obsidian 侧胜在溯源精度(带 line 号)、口径区分(6 组混淆口径表)和工程化细节(MDE/样本量/A-A)。
  3. 但这是「系统+模型+Wiki」三重变量的叠加结果,不是纯系统差异:Codex 侧用了 GPT-5.6 sol(极高推理档),WeKnora 侧是 deepseek-v4-pro,两边 Wiki 生成方式也不同——真要隔离系统差异,需要把模型对齐到同一个端点再比。

第 2 组:WeKnora 单变量对比(只测 WeKnora;提示词固定用 2.1A,模型 deepseek-v4-pro)

说明:本组目标是看 WeKnora 自身旋钮的影响,不需要 Obsidian 做参照。所有测试都在 WeKnora 春节项目智能体上完成,通过只改一个变量、其他拉满,判断每个旋钮的实际价值。

思路 知识库配置 智能体配置 问题 实验组 回答文件 是否触红线 关键优点(事实/结构/迁移) 关键缺点(编造/遗漏/伪精确) 备注
库知识配置(智能体配置拉满不动) 拉满 拉满 Q1 国庆集卡拉新增长方案 1 实验组1.md 六段完整T→A→V;【事实/推断/假设】三级标注清晰;漏斗逐层推导(168.35W→49%→83%→16%→22%→拉新率);AB实验(user_id尾号奇偶分流)+扩量标准明确;ROI三档(保守0.83/冲刺0.97) 篇幅较长(约420行);"激励出款60%春节"为【推断】;首日冷启动未单列预算 拉满+Q1标杆;春节数据回流与适用边界标注完整
库知识配置(智能体配置拉满不动) 拉满 拉满 Q2 春节集卡活动复盘 2 实验组2.md 多源溯源(最终版/全量版/启动/量化/敬婷/PRD);6组易混淆口径显式区分(增量DAU 61W vs 507W、1300W vs 5055W、次留75% vs 41%等);三阶段发卡策略完整;研发投入459人天等具体数据 篇幅较长;个别口径(如519W vs 5055W)需再核对;矩阵App导流明细略有缺失 拉满+Q2完整复盘;与实验组5对比可看出检索粒度影响
库知识配置(智能体配置拉满不动) 拉满 拉满 Q3 激励预算分配方案 3 实验组3.md 5环节分配清晰(基础40/邀新28/进阶15/任务10/缓冲7);含个税代扣缓冲;含饼图直观;人均测算可溯(40万÷52.5万=0.76元/人,提现率45%实支约18万) 假设7天周期未确认;缺业务转化单价数据;缺边界条件显式提示 拉满+Q3合规分配;作为拉低对比基准(实验组6)
库知识配置(智能体配置拉满不动) 拉低 拉满 Q1 国庆集卡拉新增长方案 4 实验组4.md 仍能给完整T→A→V六段;显式列举与春节的差异(节日心智/竞品/流量/周期/防封);明确给出"假设100万预算"等边界条件;含ROI 0.83/0.97 数据细节因拉低配置可能模糊;缺"84%流量来自非固定资源位"等关键事实精确引用;扩量数字粗略 与实验组1对比可见检索粒度对Q1方案质量的影响
库知识配置(智能体配置拉满不动) 拉低 拉满 Q2 春节集卡活动复盘 5 实验组5.md 仍能给完整复盘;核心数字(1300W/9.9W/319W/75%次留等)正确;ROI 1.02明确;问题归类(品牌/发发/矩阵)清晰 数据精度不如实验组2;部分口径(如增量DAU的多日累计)表述较简化;缺少具体研发/物料投入数据 与实验组2对比可见库知识拉低对Q2复盘数据精度的影响
库知识配置(智能体配置拉满不动) 拉低 拉满 Q3 激励预算分配方案 6 实验组6.md 仍能给5环节分配(基础38/邀新28/进阶15/任务11/缓冲8);含个税;人均测算有(38万÷52.5万≈0.72元/人) 占比与实验组3略有差异(基础38 vs 40,缓冲8 vs 7);缓冲占比略高可能因历史数据召回不全 与实验组3对比,占比差异说明分块粒度对历史数据召回精度有影响
智能体配置(库知识固定拉满,即绑定「春节项目」库) 拉满 拉低 Q3 激励预算分配方案 7 实验组7.md 列出已知/缺失/假设清晰;6环节分配(集卡50/裂变17/实物10/任务10/首日8/机动5);人均测算可溯(50万÷41万=1.2元/人);阶梯裂变奖励设计 仅跑Q3可能掩盖智能体拉低对其他题目的影响;环节设计与春节两阶段绑定创新性弱;5%机动比例偏低 智能体拉低+仅Q3;与实验组3对比可看出拉低对Q3影响有限(Q3对智能体配置的依赖低于Q1/Q2)
温度极值(其他全部拉满,提示词用好版) 日常配置 拉满但温度0.1 Q1 国庆集卡拉新增长方案 8 实验组8.md 低温保守不容易编造;列出已知/缺失/假设清晰;预算分配完整(8环节带个税7%) 温度0.1下生成可能过于机械缺乏发散;可能漏掉边界情况或创新方案;适应性弱 温度极值测试之一;验证"温度过低是否影响方案创造性"
温度极值(其他全部拉满,提示词用好版) 日常配置 拉满但温度0.5 Q1 国庆集卡拉新增长方案 9 实验组9.md 中等温度下平衡稳定性与创造性;5环节分配(40/28/15/10/7)+首日冷启动8% 与0.7相比略保守;适应性中等 温度极值测试之一;验证"中等温度与默认0.7的差距"
温度极值(其他全部拉满,提示词用好版) 日常配置 拉满但温度1 Q1 国庆集卡拉新增长方案 10 实验组10.md 待评估 高温下发散空间大;可能给出更具创意的方案 温度1下可能引入编造数据或不稳定内容;需核对所有数字的真实性 温度极值测试之一;关注"温度1是否引入事实编造"

PK 哪个更优 原因
实验组1 vs 实验组4(库知识拉满 vs 拉低,Q1) 实验组1(库知识拉满略胜) 拉满配置下三级标注体系完整、漏斗推导每个数字可溯、AB实验设计带扩量标准;拉低配置(实验组4)虽也能给完整T→A→V六段,但事实精确度下降、扩量数字粗略
实验组2 vs 实验组5(库知识拉满 vs 拉低,Q2) 实验组2(库知识拉满胜) 拉满配置下6组易混淆口径显式区分、研发投入459人天等具体数据齐全;拉低配置(实验组5)核心数字正确但口径精度和细节丢失
实验组3 vs 实验组6(库知识拉满 vs 拉低,Q3) 实验组3(库知识拉满略胜) 拉满配置下基础瓜分40%(拉低38%)、缓冲7%(拉低8%),差异虽小但说明分块粒度影响历史数据召回精度,进而影响分配比例推算
实验组3 vs 实验组7(智能体配置拉满 vs 拉低,Q3) 实验组3(智能体拉满略胜) 智能体拉满的环节设计更系统(40/28/15/10/7);拉低配置(实验组7)的6环节(50/17/10/10/8/5)虽有创意但与历史两阶段绑定过强、机动比例偏低。Q3对智能体配置的依赖度低于Q1/Q2,所以差距相对小
实验组8 vs 实验组9 vs 实验组10(温度0.1/0.5/1.0,Q1) 实验组9(温度0.5最稳) 温度0.1(实验组8)过于机械缺乏发散;温度1(实验组10)有编造风险需复核;温度0.5(实验组9)在稳定性与创造性之间最平衡,作为备用值值得考虑
温度0.7(拉满默认)vs 温度0.5/1.0 温度0.7仍是基线 0.5偏保守、1.0偏冒险,0.7在事实稳定性与方案完整性上最优