AI回答准确率仅21.2%!联合国联手谷歌救场,重构全球公开数据

发布时间:2026-09-18 18:11  浏览量:1

联合国周四宣布了个事:他们正在跟谷歌合作,打算把手里那一大堆全球统计数据,整理成AI系统能直接读取、直接调用的格式。

图源:豆包AI生成

新系统叫UN System Data Commons,说白了就是搭在谷歌开源的Data Commons平台上。

你可以用大白话直接搜各个联合国机构的数据,不用再像以前那样,在老版UNData门户里一层一层翻数据库。

这个新系统还支持模型上下文协议(MCP),一个让AI直接连到外部数据源的标准协议。

为什么非得折腾这一出?

因为现在大家有事儿没事都先问AI,但AI给出的数据靠谱不靠谱,那就另说了。

联合国儿童基金会的首席统计师João Pedro Azevedo在一场线上吹风会上跟记者算了笔账:他们拿六款大模型,针对全球发展指标相关的问题出了超过13.3万条回答,结果平均准确率才21.2%。

被测的名单你可能眼熟:OpenAI的GPT-4o和GPT-4o-mini,Anthropic的Claude Sonnet 4.5和Haiku 4.5,还有谷歌自家的Gemini 2.5 Flash和2.0 Flash。

Azevedo说,大概五分之三的回答根本给不出一个能用的数字,模型都在那儿含糊其辞。

更离谱的是,同一批问题隔两天再问一遍,两次都提供了数字的模型中,只有大约一半的返回了相同的数字。

图源:豆包AI生成

这个测试目前还是联合国儿童基金会的工作论文,正准备投期刊,还没过同行评审。

他们说等论文发出来,方法、代码和数据会一起公开。

联合国儿童基金会今年也发现,越来越多生成式AI助手在往它的数据网站导流。

这个网站本来就挺火,一个月有600多万人次访问,是联合国儿童基金会最受欢迎的网站之一。

光是从ChatGPT回答里点链接过来的,1月1日到9月14日,同比涨了67%。

Azevedo表示,从1月1日到9月14日,用户从ChatGPT回答里点链接进这个网站的次数,比去年同期多了67%。

今年所有访问里,有6.4%是这么点进来的。

联合国儿童基金会估计,如果把各种AI助手都算上,现在大概每10次访问里就有1次是从AI那边过来的。

平台这边进度也不慢。联合国说,已经有26个下属机构加入了这个Data Commons,上线的时候差不多有近20家的数据已经可用。目标是到2027年,把联合国系统80%的统计数据集都搬上来。

联合国统计司的代理司长Shantanu Mukherjee说得挺直白:这次在规模、覆盖范围和灵活性上,跟以前比完全不是一个量级,而且是头一回把这么多联合国机构的数据连到一起。顺便趁这个机会,把数据改成AI能直接上手的格式。

谷歌这边出了 200 万美元,由Google.org提供,主要用于能力建设和技术支持,把平台的核心基础设施搭起来。

但谷歌Data Commons团队的负责人Prem Ramaswami透露:这系统跑在联合国自己管的实例上,以后终归是联合国自己维护、自己运营、自己慢慢做大。

他们全程用的是“先教会几个人、再由这些人去带更多人”的路子,目前联合国团队上手速度已经很快了。

其实谷歌自己2018年就做了Data Commons,想把散在各家的公开数据集归到一个框架里。

图源:豆包AI生成

去年,谷歌又加上了MCP支持,这样AI智能体可以直接去查数、查出处。

这个平台还会记得每个数从哪儿来的,方便AI帮你查出来的东西,你能一路倒回去,追到最原始的联合国数据源。

Azevedo跟记者强调,现在靠AI找信息、读信息的人越来越多,能溯源这件事就变得特别要紧。

不光是查单个数字,谷歌还现场演示了一把:AI通过MCP连上联合国数据之后,能自动把好几个指标拉到一起,生成仪表盘、图表甚至文字分析,用户根本不用自己去翻各种数据集再手动拼。

演示里还举了个例子,让AI去查美国总统艾滋病紧急救援计划在非洲的效果,系统自己挑出HIV感染人数、艾滋病死亡人数、预期寿命这些相关指标,直接做了张信息图出来。

然而,给AI提供权威数据并不一定会让AI给的结论具有权威性。

“因为模型可能会曲解一些微妙的差别,所以引用或发布之前,最好还是有人把把关。”Ramaswami说道。