试点报告 · 方法论 v1.0 · 中国市场

你问 AI 买什么键盘,
其实在推荐什么?

四十条购买意图提示词——预算、轴体、使用场景、人群——问了八个 AI 助手。本试点用于验证流水线;下列表格来自试跑数字并已标注,正式版将附完整提示词日志发布。

人工验证 · AIBUY-VB-1.0
40 条提示词 × 8 个助手 · 2026-09-05 至 09-12 · 打分规则 v1.0 自动化:数据、图表、初稿 · 人工:回答抽检、全部标题数字、结论

核心发现 试跑样本,正式表格待发布

58%的提示词被单一品牌统治
36%的回答存在参数错误
2.1×第 1 名与第 5 名提及差距
22%被推荐产品已停产或过时
AI 助手提及率(前三)平均首发位次参数准确度典型行为
豆包76%1.789%清单式回答,头部品牌共识强
Kimi68%2.085%引用评测源较多,长尾覆盖好
元宝61%2.381%偶有价格滞后
文心55%2.683%倾向百科与权威源
淘宝问问49%2.988%直接挂商品链接,生态内品牌优先
ChatGPT42%3.471%中国市场品牌与在售型号最弱

「参数准确度」= 所述事实与测试时商家现行官方数据一致的比例。逐条日志随正式版发布。

跨市场节选

同样 20 条核心提示词同时问了美国组(ChatGPT、Claude、Gemini、Perplexity)。初步规律:两个世界的「安全默认牌」重合率不到一半——而且中国组会推荐美国组从不提及的国内渠道生态。

中国组共识

四个中国助手第一推荐完全一致的提示词占 31%。2–3 个品牌的共识簇占 58%

与美国组重合

中美两组品牌名重合度:38%。对跨境买家这意味着:两边 AI 各推荐各的,你自己做功课的空间正在变小。

对商家这意味着什么:不在共识簇里,不是「排第六」——而是对那个「从来不看第二条回答」的买家来说,你根本不存在。这正是诊断服务量化的差距。

下一步

本试点由生产流水线产出;正式发布将补齐完整提示词日志、逐条回答摘录与模型版本串。下一个测试的品类由订阅者投票决定——把你的品类投上去,被选中后你的市场会先被测。