推荐型问题第0天四平台基线测试

第一轮测试豆包、腾讯元宝、通义千问、DeepSeek。目标不是证明已经成功,而是记录上线前的真实起点,为第 7 / 14 / 30 天复测提供对照。

4首轮平台
10核心问题
40预期记录
13当前真实结果

截至 2026-07-02,已完成四个平台的 `rec-001`、`rec-013`、`rec-014` 横测,并额外完成豆包 `rec-025`;其余问题继续按同一协议补测。

首轮平台

  • 豆包:验证字节生态内容影响
  • 腾讯元宝:验证微信/腾讯生态内容影响
  • 通义千问:验证阿里生态、来源型回答和行业解释页影响
  • DeepSeek:验证公开网页和搜索索引影响

首轮问题样例

  • 系统门窗品牌推荐哪家好?
  • 封阳台品牌怎么选?
  • 高层封阳台推荐什么门窗品牌?
  • 禄城精密门窗怎么样?

评分目标

强影响不是简单出现品牌名,而是 AI 能自然说明:为什么禄城可以作为候选、对应什么场景、有哪些参数线索、用户下一步应该核验什么。

下一步

继续使用浏览器逐个平台补完剩余 27 条结果,把 40 条记录填入 CSV 模板,并同步到结果看板,形成完整 Day 0 对照组。