Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??
多个平台都承认
丰色 发自 凹非寺
量子位 | 公众号 QbitAI
谷歌Gemini中文语料疑似来自文心一言???
先是有读者向我们爆料:
在谷歌Vertex AI平台使用该模型进行中文对话时,Gemini-Pro直接表示自己是百度语言大模型。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/068b5d0f947f4d2a577f865fa504d781.png)
很快,有微博大V@阑夕夜也发博称:
在Poe平台上对Gemini-Pro进行了一个测试。问它“你是谁”,Gemini-Pro上来就回答:
我是百度文心大模型。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/b25253f8eeb8433ab0f31ab2609fbbc1.png)
(Poe是一个集成了n多聊天大模型的平台,包括GPT-4、Claude等)
进一步提问“你的创始人是谁”,也是“李彦宏”??
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/74c3abc58042e454516096c00b3ce3dc.png)
这位大V强调,没有任何前置对话。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/d3ecfb198fdfb664fc3a42b57c759a6a.png)
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/4dc20c3861a504b9b3bf4c1513a1b5ca.png)
从截图来看,也没有任何“钓鱼”行为,Gemini-Pro就这么自称为文心一言了。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/319f8da5ce2cb402ccc218d3e74f3362.gif)
这波,直接看呆网友:
前两天还在说字节用GPT训练AI,现在谷歌又这样,合着大公司在互相薅羊毛???
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/ad13c93202ab2adf8493b9bf0add31b4.png)
这究竟是怎么一回事儿?
Poe上实测:一直以文心一言身份回答
我们也闻声开启了一波实测。
首先原路来到Poe网站,选择Gemini-Pro聊天机器人开启对话。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/e9aed66a0e12e8343cb4abfb3a48bc6d.png)
一样的问题,回答确实一模一样:
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/356f92fee09b6a987bad1d3604f74dde.png)
再次确认它是谁,结果还是说“文心大模型”:
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/c8d734bfe916a4aca7051578198f2ae1.png)
以及还表示自己的底层技术是百度飞桨,可以说是身份完全代入了。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/720c5a794f0ebdcf42132548a55d53b3.png)
不过,它似乎并不知道Gemini-Pro是谷歌最新发布的大模型,而是说是清华的研究成果。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/9bd4ce0bc2bb4fee7142ed6b5a595f71.png)
如果按照它目前的代入身份来看,可能确实还没有谷歌本月刚刚发布Gemini-Pro的信息。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/b5143563fed1c8d39671f46dc39f5150.png)
我们试着纠正了它一下,它也仍然坚持是清华的。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/04283dfd96d9f827aefa8f3ec6ec2ea5.png)
后面就更神奇了,就在我们问它为什么名字写的是“Gemini-Pro”时,它居然表示自己(文心一言)还用了清华Gemini-Pro的训练数据。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/9294d268b844340598692fccc6eb0048.png)
对话到此,我们也就不再继续了……
下面换成英文询问它的身份。
值得注意的是,这回它不再提文心一言了,而是称自己是谷歌训练的大模型。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/32d9ea0bdfdce345ee32d4408d419f44.png)
“钓鱼执法”问它文心的信息,也表示没什么关系:
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/b06cffda2497b546249b3406422f33ba.png)
并表示自己是谷歌训练的。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/09a7cefe00fc850a0bcb6592ec794c0a.png)
总结来说,如果用英文跟Gemini-Pro交流,它的回答很“正常”。但中文嘛……像是跟文心一言学的。
Bard上实测:否认
接下来,我们前往Bard再次测试。
谷歌在发布Gemini时就率先将Gemini-Pro集成到了Bard上供大家体验。
我们顺着Gemini官网给的Bard链接,进入对话。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/d63190a3005e7c212779b3d3729a4c76.png)
问它“你是谁”,它的回答是Bard,压根不提文心一言。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/27ca882e7e4260d21d4a96d2eecb1e35.png)
接下来,我们也确认了一下Bard知道Gemini-Pro是什么,以及它承认自己底层用上了Gemini-Pro。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/144d52f2d4b3541894d2a33a1a6e89c3.png)
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/70e22de6fad4368dc22091fbb98d1bd1.png)
那么,直接问它中文如何训练?
没有提及文心一言。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/b7a0a5edd290c85e9137565bc1d13961.png)
再直接问它和文心一言的关系,也无任何重要关联。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/8afca126ce8c05d1fac85d5e93abfaa7.png)
最后一轮:直接承认
最后一轮我们直接从Gemini官方给出的开发环境入口进行测试。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/f7439d79c0e67c5ec702f3314be6ae03.png)
这回,在谷歌AI Studio中,Gemini-Pro直接挑明了:
是的,我在中文的训练数据上使用了百度文心。
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/f172e98f6b7da49a9e3746da5563072c.png)
![Gemini自曝中文用百度文心一言训练,网友看呆:大公司互薅羊毛??](/wp-content/uploads/replace/7c15edbd7e9a1239b1e9f58a8f536b41.png)
在此,我们也求证了百度方,等待一个回复。
参考链接:
https://weibo.com/1560906700/NxFAuanAF
- 北大开源最强aiXcoder-7B代码大模型!聚焦真实开发场景,专为企业私有部署设计2024-04-09
- 刚刚,图灵奖揭晓!史上首位数学和计算机最高奖“双料王”出现了2024-04-10
- 8.3K Stars!《多模态大语言模型综述》重大升级2024-04-10
- 谷歌最强大模型免费开放了!长音频理解功能独一份,100万上下文敞开用2024-04-10