独立 AI 购物研究 · 中文市场

我们测量
AI 推荐什么。

买东西这件事,正在从搜索框搬进 AI 助手。AIBUY 用同样的 100 条真实购买意图提示词去问豆包、元宝、Kimi、文心、淘宝问问和海外模型,记录每个回答、公开推荐结果——让消费者拿到证据,让商家看到差距。绝不卖排名。

人工验证。每份报告都带一张验证卡:测了多少条提示词 × 几个模型、什么时间测的、哪些部分由人工核对。人工核验的标准,人工复核的结论。
独立 · 方法先行 · 数据公开 · 2026 年创立
「预算 500 元,送程序员男友什么机械键盘?」——同一个问题,问了 8 个 AI
豆包6 个品牌
Kimi5 个品牌
元宝4 个品牌
文心4 个品牌
淘宝问问3 个品牌
ChatGPT3 个品牌
40 条提示词 · 2026年9月 · 完整记录见报告 人工复核 ✔
8AI 助手在测
100+每品类提示词
4公开指标
0付费排名
为什么做这件事

货架搬家了,但没人盘点。

二十年里商家争夺搜索排名。现在你的客户直接问 AI 助手,而助手的答案来自训练数据、第三方榜单和它能爬到的页面。如果 AI 说错了你的参数,或者干脆不提你——没有人会告诉你。我们用数据告诉你。

01

测量

每个品类 100 条真实购买意图提示词——像真实买家那样问——定期跑遍主流 AI 助手,逐条记录回答。

方法论 →
02

对比

提及率、推荐位次、信息准确度、竞品压制比——四个指标全部带证据发布。中美两个市场用同一套方法。

跨市场对比 →
03

信任

我们是审计方,不是货架。AIBUY 榜单上的位置不能买——这份独立,正是数据值得读、服务值得付费的原因。

独立政策 →
人工验证徽章

人工核验的标准,人工复核的结论

一切发布物遵循固定编辑标准;结论、观点和一切以「推荐」名义发布的内容由人写、人核对。每份报告开头都挂这样一张卡:

人工验证 · AIBUY-VB-1.0
测试集100 条提示词 × 8 个助手
时间窗2026-09-05 至 09-12
自动化数据 · 图表 · 初稿
人工结论 · 观点 · 复核
方法论 v1.0 · 附提示词日志
报告

试点:机械键盘,中国市场

完整试点——40 条提示词 × 8 个助手——连同提示词日志和回答摘录正在发布。以下为试跑核心数字:

58%的提示词被单一品牌统治
36%的回答存在参数错误
2.1×第 1 名与第 5 名的提及差距
22%被推荐产品已停产或过时
AI 助手提及率(前三)平均首发位次参数准确度典型行为
豆包76%1.789%清单式回答,头部品牌共识强
Kimi68%2.085%引用评测源较多,长尾覆盖好
元宝61%2.381%偶有价格滞后
文心55%2.683%倾向百科与权威源
淘宝问问49%2.988%直接挂商品链接,生态内品牌优先
ChatGPT42%3.471%中国市场品牌与在售型号最弱

试点试跑数字,用于展示报告形态。正式版表格附完整提示词日志、日期与模型版本。完整报告 →

跨市场项目

同一个问题,中美 AI 的答案差多远?

我们把同样的购买意图分别问给中国模型(豆包、元宝、Kimi、文心、淘宝问问)和美国模型(ChatGPT、Claude、Gemini、Perplexity),每季度发布对比。只有同时在两个市场运营的团队才能做这件事——我们免费、双语、同步发布。

「3000 元送爱喝手冲的女朋友什么礼物?」
中国模型组推荐重叠41%
美国模型组推荐重叠34%
看项目详情 →
商家服务

你的客户问 AI,AI 怎么回答你?

先看整条品类的地图,再谈改什么。品类基准给你赛道——谁在赢、在哪个助手上赢;诊断给你自己的处境;托管帮你一直盯着。我们只做测量、监测与验收,不承接执行。

按季订阅

品类基准

整个品类的 AI 可见度分布,加上你的份额与位次逐季变化和预警。每张表都带口径行(样本量 × 模型数 × 时间窗 × 是否开检索)。公开起价 ¥1,800/月。

看基准样例 →
一次性

Agent Readiness 诊断

针对你的品类:100 条购买意图提示词 × 8 个 AI 助手实测。交付你的「AI 推荐份额」、推荐位次、被说错的参数清单、以及谁在赢你客户的提问——全部带提示词级证据。

交付明细 →
按月

AEO 托管监测

每月复测 + 趋势看板:份额变动、新进入者、新增参数错误预警;以及该做的可见度修复——结构化数据、AI 爬虫放行、在 AI 真正引用的第三方源建立存在感。

服务方式 →
红线(写在明处):AIBUY 的榜单和报告永远不接受付费排名。商家购买的是测量、监测和在自有渠道的可见度建设——绝不是我们自家榜单上的位置。完整政策 →
常见问题

先说结论

品牌可以花钱上榜吗?

不能。报告由我们的诊断与托管服务、以及明确标注的 Newsletter 赞助支撑。榜单位置只由测试数据计算得出,谁也买不动。

你们测哪些 AI?

中国组:豆包、腾讯元宝、Kimi、文心、淘宝问问。美国组:ChatGPT、Claude、Gemini、Perplexity。跨市场项目用同一组提示词问两边。

和带带货链接的测评号有什么区别?

我们公开提示词、原始回答日志和计数规则。你可以不同意我们的结论——但你可以核查我们。联盟链接(如有)一律标注,且不进入打分。

我的品牌可以被测吗?

可以——诊断是一次性交付;每季度我们还为研究路线图上的品类开放少量免费名额。看服务 →