这可能真的是间谍行为,绝不是空穴来风了!!
本来只是花几十块钱收方言,直到网友看到一句“四连的驻地……”,事情彻底变了。
8月24日19时04分,博主“我就是八爪”突然发出一组截图。
4个月前,这还是一个一天念200句、能拿40元左右的微信方言活动。
4个月后,却已经有网友把相关线索提交到了12339。
中间到底发生了什么?
真正让事情变味的,是一句被参与者截下来的朗读文本:
“四连的驻地就在雄鸡图案的鸡冠上。”
这句话一出来,很多人的第一反应都一样:
等等。
一个训练方言识别的项目,为什么要让普通人念“连队驻地”?
把时间倒回4月10日,当时完全不是这个画风。
部分用户收到“微信团队”的官方邀请,点进小程序以后,系统给一句话,用户用自己的家乡话念出来。
规则甚至很有诱惑力:
3句约1元,20句5元,一天最多100到200句,最高大约40元。
有人录完以后直接晒红包,还有人调侃这波“羊毛”不错。
而项目给出的理由也很顺:
搜集真实方言语音,训练AI。
以后你发一段四川话、潮汕话或者其他地方口音,微信“语音转文字”能听得更准。
如果事情停在这里,几乎没什么悬念。
问题是,到了8月,一些用户发现,系统让他们念的东西越来越怪。
除了“四连的驻地”,媒体后来还核实到另一句:
“这个项目也得到了日本政府的支持。”
网上随后又流传出涉及“空军基地”、地名等内容的截图。
后面这些网传文本不能全部当成已经核实的事实。
但前面两句话,已经足够把气氛彻底改变。
因为正常的训练语料是什么?
微信自己后来列举的例子是:
“你中秋节回家不?”
“附近菜市场在哪里?”
“坐几路公交车?”
一个是买菜问路,一个却突然跑到了“连队驻地”。
反差太大了。
8月24日晚,“我就是八爪”把截图发出来以后,帖子迅速获得数千次转发。
更关键的一张图随之出现:
有人称,已经向12339提交举报。
12339,是国家安全机关举报受理电话。
于是一个4月份还被网友当成“赚几十块红包”的小程序,4个月后,突然被推到了“有没有国家安全风险”的舆论场里。
但紧接着又来了一个反转。
很多人最初看到这些截图,第一感觉是:
这不会是什么来路不明的程序吧?
结果一查,不是。
这个项目本身就是微信发起的。
4月份的公开报道里已经写得很清楚,邀请消息来自“微信团队”,而且采用定向邀请制。
这就让问题从“谁在偷偷收方言”,变成了另一个更具体的问题:
微信自己的项目,为什么会出现这些文本?
一天后,8月25日,微信官方账号“微信小安”回应了。
微信说,小程序里的句子是算法根据**“日常语义和中文文库随机合成”**的。
正常情况下,生成的是家常聊天、买菜、问路。
至于那些匪夷所思的内容,微信用了一个非常口语化的解释:
算法合成有时候“比较蠢”。
随后,微信表示已经重新清理文本库,把这些“不靠谱”的内容剔除了。
它还专门回应了另一个敏感问题。
用户提交的方言数据,微信称已经通过专属授权条款取得“单独同意”,只用于方言识别模型优化等相关服务,不会用于无关用途,也不会提供或披露给第三方。
所以这件事走到这里,不能简单喊一句“间谍实锤”。
目前公开信息只能证明:
有人发现异常文本。
有人因此怀疑。
有人向12339举报。
微信也已经作出解释。
但截至目前,没有权威部门公开认定这个项目属于间谍活动。
可我觉得,真正值得追问的反而留在了微信自己的解释里。
如果训练目标只是让AI听懂各地方言,那么“四连驻地”这种文本,为什么会进入一个面向真实用户的朗读题库?
算法可以随机。
AI也确实会生成离谱内容。
但从算法生成,到进入文本库,再到出现在用户手机上,中间难道没有审核这一关?
这才是整个事件最反常的地方。
4月份,大家盯着的是:
200句话能赚多少钱。
到了8月份,大家盯着的已经变成:
这200句话,到底为什么要让我念。
这件事最终有没有更深层的问题,需要证据和调查说话。
但一个涉及大量真实语音的数据采集项目,既然敢让全国不同口音的人开口,就应该先把一个最基本的问题讲明白:
你让大家念什么,为什么要念,以及这些声音最后会被用到哪里。
