有一家叫Trellner Research的机构做了一次很有意思的测试。他们向Perplexity的AI提问了380个软件品类,从最常见的CRM、项目管理,到很偏门的博物馆藏品管理软件、IVR软件,一共问了760次。每次让AI推荐前五名,然后他们把AI引用的所有网页链接都记录下来。

大部分引用来自小网站
这760次提问,AI一共引用了7534个网页,来自2055个不同的域名。其中将近六成的网站,在全球流量排名里排在10万名开外。还有23.4%的网站,干脆连前100万都进不了。维基百科在整个测试里只被引用了三次。

也就是说,当你问AI“什么CRM好用”的时候,它背后看的网页,很可能不是你知道的那些大站,而是一些你从来没听过的小站,例如你现在读的这个站。

在所有被引用的网站里,排第三的是 guideflow. 这家公司卖的是交互式产品演示工具,跟CRM、项目管理这些品类一点关系都没有。但它被引用了194次,横跨96个品类,排在Gartner前面。

它能被推荐,是因为有个内容营销博客,上面写了两千多篇文章。AI的检索系统抓到了这些文章,就把它们当成了“推荐依据”。

这其实没什么欺诈成分,就是正常写博客。但一个卖演示软件的公司博客,成了AI判断“什么CRM好用”的主要依据之一,这就很怪。

更离谱的是另外三个网站:wifitalents、worldmetrics、gitnux。

这三个站有几个共同点:
都是2023年底到24年初注册的、都用同一对Cloudflare域名服务器、用完全一样的页面模板、每个站的博客都只有六篇文章,而且写的都是另外两个站。

它们的网站地图里各有10万多个页面,加起来215128个“最佳某某软件”页面,全世界的软件品类根本没这么多,明显是机器批量生成的。页面标题直接叫“Facts & Grounding Page”,Grounding是AI领域的词,意思是“检索证据”,普通用户不会这么说。meta描述写的是“机器可读记录”。说白了,这些页面就是写给AI看的。

研究人员还对比了这三个站对同一个品类的推荐。比如问“项目估算软件”,worldmetrics的第一名是Float,gitnux的第一名是Saviom,而且Saviom根本不在worldmetrics的前五名里面。三个站的推荐互相打架。

更搞笑的是这些页面上署名的“专家”,每个站各三个,一共九个人名,但很可能是虚构的。页面上还留着没渲染干净的模板变量,比如“Within the next 26 days”。

AI推荐完软件,还会顺手给你一个官网链接。研究人员检查了这些链接,发现有些已经打不开了。一个叫Dryad的研究数据管理平台,AI给的链接是dryad.co,点进去跳转到一个印尼赌博网站。还有一个叫Monte Carlo的数据质量工具,AI给的链接是montecarlo.com,点进去是摩纳哥蒙特卡洛赌场酒店的官网。链接根本和软件本身八竿子打不着,但是AI还是给你推荐了。

报告的局限
这篇报告的调查方法很老实,作者自己也说了很多“这不能说明什么”的话。比如他们只测了Perplexity,没测ChatGPT、Gemini、Claude;比如他们自己也说,低流量不等于低质量。

但至少能看出来,AI推荐软件时引用的“证据”没有你想的那么靠谱。

我觉得根本原因是,现在有人专门给AI造内容,这些网站本来就不是给人看的。AI抓到它们当成证据,你在另一端看到一份挺专业的推荐列表,却不知道它是怎么来的。

所以下次让AI推荐软件,可以追问一句“依据是什么?”。它给的链接,最好自己点进去看看。

谢谢。


参考来源:Trellner Research, Three sites made 215,128 "best software" pages for AI. Perplexity cites them