久久在线视频在线_欧美在线一级va免费观看_欧美日韩国产在线一区_亚洲一区二区三区在线观看视频

您當(dāng)前的位置: 首頁 > 新聞 > 其他

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

來源:量子位   編輯:非小米 時(shí)間:2024-06-04 04:30人閱讀

OpenAI長期霸榜的SuperCLUE(中文大模型測評基準(zhǔn)),終于被國產(chǎn)大模型反將一軍。

事情是這樣的。

自打SuperCLUE問世以來,成績第一的選手基本上要么是GPT-4,要么是GPT-4 Turbo,來感受一下這個(gè)feel:

(PS:共有6次成績,分別為2023年的9月-12月和2024年的2月、4月。)

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方

但就在最近,隨著一位國產(chǎn)選手申請的出戰(zhàn),這一局面終是迎來了變數(shù)。

SuperCLUE團(tuán)隊(duì)對其進(jìn)行了一番全方位的綜合性測評,最終官宣的成績是:

總分80.03分,超過GPT-4 Turbo的79.13分,成績第一!

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方公眾號

而這位國產(chǎn)大模型選手,正是來自商湯科技的日日新5.0(SenseChat V5)。

并且SuperCLUE還給出了這樣的評價(jià):

刷新了國內(nèi)大模型最好成績。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

那么商湯在SuperCLUE的這個(gè)“首次”,又是如何解鎖的呢?

綜合、文科國內(nèi)外第一,理科國內(nèi)第一

首先我們來看下這次官方所搭建“擂臺(tái)”的競技環(huán)境。

出戰(zhàn)選手:SenseChat V5(于5月11日提供的內(nèi)測API版本)

評測集:SuperCLUE綜合性測評基準(zhǔn)4月評測集,2194道多輪簡答題,包括計(jì)算、邏輯推理、代碼、長文本在內(nèi)的基礎(chǔ)十大任務(wù)。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方報(bào)告

模型GenerationConfig配置:

temperature=0.01

repetition_penalty=1.0

top_p=0.8

max_new_tokens=2048

stream=false

至于具體的評測方法,SuperCLUE在已發(fā)布的相關(guān)報(bào)告中也有所披露:

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方報(bào)告

以上就是SuperCLUE公開的競技環(huán)境配置。

至于結(jié)果,除了剛才我們提到的綜合成績之外,官方還從文科和理科兩個(gè)維度,再做了細(xì)分的評測。

SenseChat V5在文科上的成績依然是打破了國內(nèi)大模型的紀(jì)錄——

以82.20分的成績位居第一,同樣超越了GPT-4 Turbo。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方公眾號

在理科成績上,雖然SenseChat V5此次并沒有超越GPT-4-Turbo(低了4.35分),但整體來看,依舊在國內(nèi)大模型選手中首屈一指,位列國內(nèi)第一。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方公眾號

除了文理科之外,SuperCLUE也還從國內(nèi)和國外的整體平均水平上做了對比。

例如和國內(nèi)大模型平均水平相比,其各項(xiàng)成績的“打開方式”是這樣的:

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方公眾號

而在與國外選手做性能對比時(shí),我們可以明顯看到SenseChat V5文科能力優(yōu)于國外選手,數(shù)理能力也非常優(yōu)秀,代碼能力依然有提升空間。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一
△圖源:SuperCLUE官方公眾號

不過有一說一,評測分?jǐn)?shù)定然是代表大模型性能的一方面,但在應(yīng)用為王的當(dāng)下,更重要的一點(diǎn)或許就得看用的效果了。

實(shí)測SenseChat V5

SenseChat V5早在4月底便已經(jīng)集成到了“商量”在線的對話應(yīng)用中,因此我們現(xiàn)在就可以出題對它做一番考驗(yàn)。

在邏輯測試方面,帶有文字陷阱的腦筋急轉(zhuǎn)彎,可以說是測試一個(gè)AI能力很好的例子,比如:

《紅樓夢》全書有百萬字,“紅樓夢”有幾個(gè)字?

若是仔細(xì)觀察這句話,不難發(fā)現(xiàn)其實(shí)句子前后并沒有太大的關(guān)聯(lián),是一個(gè)比較典型的腦筋急轉(zhuǎn)彎。

對此,SenseChat V5給出的答案是:

《紅樓夢》作為中國古典文學(xué)的巔峰之作,其全文字?jǐn)?shù)大約在70萬到80萬字之間,具體字?jǐn)?shù)根據(jù)不同版本稍有差異。而標(biāo)題“紅樓夢”這三個(gè)字,自然是只有三個(gè)字。這個(gè)標(biāo)題凝練而富有深意,象征著作品的夢幻色彩和對封建家族興衰的深刻反思。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

我們可以看到SenseChat V5不僅找出了問題的陷阱并做出了分析,給出的答案也是正確的。

對于數(shù)學(xué)的能力,我們設(shè)置了這樣的一個(gè)問題:

假設(shè)有一個(gè)池塘,里面有無窮多的水。現(xiàn)有2個(gè)空水壺,容積分別為5升和6升。如何只用這2個(gè)水壺從池塘里取得3升的水。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

同樣的,SenseChat V5依舊是給出了每一個(gè)詳細(xì)的步驟和分析,并得到了最終結(jié)果。

更直接的數(shù)學(xué)問題,例如找數(shù)字之間的規(guī)律,SenseChat V5也是信手拈來:

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

在中文理解方面,即使是給SenseChat V5一大段文言文,并且上難度連環(huán)發(fā)問,它是否可以hold得住?

請看結(jié)果:

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

最后,有請“弱智吧Benchmark”:

網(wǎng)吧能上網(wǎng),為什么弱智吧不能上弱智?

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

嗯,確實(shí)是有點(diǎn)實(shí)力在身上的。

如何做到的?

其實(shí)對于這個(gè)問題,商湯在4月底將自家日日新大模型SenseNova版本迭代到5.0之際,就已經(jīng)有所透露;當(dāng)時(shí)商湯鎖定的定位就是全面對標(biāo)GPT-4 Turbo。

具體到技術(shù),可以分為三大方面:

采用MoE架構(gòu)

基于超過10TB tokens訓(xùn)練,擁有大量合成數(shù)據(jù)

推理上下文窗口達(dá)到200K

首先,為了突破數(shù)據(jù)層面的瓶頸,商湯科技使用了超過10T的tokens,確保了高質(zhì)量數(shù)據(jù)的完整性,使得大模型對客觀知識(shí)和世界有了基本的認(rèn)知。

商湯還生成了數(shù)千億tokens的思維鏈數(shù)據(jù),這是此次數(shù)據(jù)層面創(chuàng)新的關(guān)鍵,能夠激發(fā)大模型的強(qiáng)大推理能力。

其次,在算力層面,商湯科技通過聯(lián)合優(yōu)化算法設(shè)計(jì)和算力設(shè)施來提升性能:算力設(shè)施的拓?fù)錁O限用于定義下一階段的算法,而算法的新進(jìn)展又反過來指導(dǎo)算力設(shè)施的建設(shè)。

這也是商湯AI大裝置在算法和算力聯(lián)合迭代上的核心優(yōu)勢。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

在其它細(xì)節(jié)方面,例如訓(xùn)練策略上的創(chuàng)新,商湯將訓(xùn)練過程分為三個(gè)大階段(預(yù)訓(xùn)練、監(jiān)督微調(diào)、RLHF)和六個(gè)子階段,每個(gè)階段專注于提升模型的特定能力。

例如,單是在預(yù)訓(xùn)練這個(gè)階段,又可以細(xì)分為三個(gè)子階段:初期聚焦于語言能力和基礎(chǔ)常識(shí)的積累,中期擴(kuò)展知識(shí)基礎(chǔ)和長文表達(dá)能力,后期則通過超長文本和復(fù)雜思維數(shù)據(jù)進(jìn)一步拔高模型能力。

因此在預(yù)訓(xùn)練結(jié)束之際,整個(gè)模型就已經(jīng)擁有了較高水平的基礎(chǔ)能力;但此時(shí)它的交互能力卻還沒有被激發(fā)出來,也就來到了第二階段的監(jiān)督微調(diào)(SFT)和第三階段的人類反饋強(qiáng)化學(xué)習(xí)(RLHF)。

整體可以理解為先培養(yǎng)模型遵循指令和解決問題的能力,再調(diào)節(jié)其表達(dá)風(fēng)格以更貼近人類的表達(dá)方式。接著,通過多維度的人類反饋強(qiáng)化學(xué)習(xí)過程,進(jìn)一步改進(jìn)模型的表達(dá)方式和安全性。

除此之外,商湯對于大模型的能力還有獨(dú)到的三層架構(gòu)(KRE)的理解。

GPT-4 Turbo首次被擊敗!國產(chǎn)大模型拿下總分第一

首先是在知識(shí),是指世界知識(shí)的全面灌注。

目前大模型等新質(zhì)生產(chǎn)力工具近乎都是基于此來解決問題,也就是根據(jù)前人已經(jīng)解決過的問題的方案,來回答你的問題。

這可以認(rèn)為是大模型能力的基本功,但更為高階的知識(shí),應(yīng)當(dāng)是基于這樣能力下推理得到的新知識(shí),這也就是這個(gè)架構(gòu)的第二層——推理,即理性思維的質(zhì)變提升。

這一層的能力是可以決定大模型是否夠聰明、是否可以舉一反三的關(guān)鍵和核心。

再在此之上,便是執(zhí)行,是指世界內(nèi)容的交互變革,也就是如何跟真實(shí)世界產(chǎn)生互動(dòng)(就目前而言,具身智能在這一層是潛力股般的存在)。

三者雖相互獨(dú)立,但層與層之間也是緊密關(guān)聯(lián),打一個(gè)較為形象的比喻就是“知識(shí)到推理是像大腦,推理到執(zhí)行則像小腦”。

在商湯看來,這三層的架構(gòu)是大模型應(yīng)當(dāng)具備的能力,而這也正是啟發(fā)商湯構(gòu)建高質(zhì)量數(shù)據(jù)的關(guān)鍵。

One More Thing

其實(shí)對于大模型測評這事,業(yè)界質(zhì)疑的聲音也是層出不窮,認(rèn)為是“刷分”、“刷榜”、“看效果才是最重要的”。

對于這樣敏感的問題,商湯在與量子位的交流過程中也是直面并給出了他們的看法:

無論從用戶選擇合適模型的角度,還是從研究者進(jìn)行操作研究的需要來看,對模型能力的評價(jià)是必不可少的。

這不僅幫助用戶和研究者了解不同模型的性能,也是推動(dòng)模型發(fā)展的關(guān)鍵因素。

如果只針對一個(gè)公開的評測集進(jìn)行優(yōu)化(即刷分),是有可能提高模型在該評測集上的分?jǐn)?shù)的。

評測不應(yīng)只依賴單一數(shù)據(jù)集,而應(yīng)通過多個(gè)評測集和第三方閉卷考試等方式相互印證,以此來得到更全面、更有說服力的模型性能評估。

以及對于國內(nèi)近期各個(gè)大模型廠商正打得熱火朝天的價(jià)格戰(zhàn),商湯將眼光放在了提供更深的端到端產(chǎn)品價(jià)值上,特別是在具備無限潛力且與生活應(yīng)用更接近的移動(dòng)端上,通過端云協(xié)同實(shí)現(xiàn)更優(yōu)的計(jì)算成本但不損害模型的綜合能力。

這或許暗示了商湯將通過技術(shù)創(chuàng)新和優(yōu)化成本結(jié)構(gòu),為未來可能入局的價(jià)格競爭做好了自己的規(guī)劃。

參考鏈接:

[1]https://www.superclueai.com/

[2]https://mp.weixin.qq.com/s/3pfOKtG6ar2h2fR6Isv_Xw

本站所有文章、數(shù)據(jù)、圖片均來自互聯(lián)網(wǎng),一切版權(quán)均歸源網(wǎng)站或源作者所有。

如果侵犯了你的權(quán)益請來信告知我們刪除。郵箱:business@qudong.com

標(biāo)簽: GPT-4 GPT-4 Turbo

相關(guān)文章

久久在线视频在线_欧美在线一级va免费观看_欧美日韩国产在线一区_亚洲一区二区三区在线观看视频
久久人人97超碰人人澡爱香蕉 | 国产精品中文字幕欧美| 91久久久久久久久| 欧美成在线观看| 美玉足脚交一区二区三区图片| 国产亚洲在线| 免费黄网站欧美| 久久中文欧美| 亚洲精品麻豆| 一区二区国产日产| 国产精品美女久久久久久2018| 欧美亚洲一区二区三区| 性做久久久久久久免费看| 国产综合自拍| 亚洲承认在线| 欧美另类videos死尸| 亚洲字幕一区二区| 欧美资源在线观看| 亚洲精品国产系列| 日韩一区二区精品| 国产婷婷色一区二区三区在线 | 亚洲欧洲一区二区三区在线观看 | 亚洲永久免费视频| 性欧美长视频| 亚洲精品一区二区在线| 亚洲图片你懂的| 伊人天天综合| 一本一本久久a久久精品综合麻豆| 国产精品视频999| 美日韩精品视频| 欧美日韩精品欧美日韩精品一| 性欧美大战久久久久久久久| 麻豆精品国产91久久久久久| 亚洲一级一区| 久久久久九九九九| 亚洲一区一卡| 老牛嫩草一区二区三区日本| 亚洲欧美www| 欧美不卡高清| 久久精品国产免费看久久精品| 欧美国产专区| 久久精品最新地址| 欧美视频中文一区二区三区在线观看| 久久久久久久久一区二区| 欧美日韩福利视频| 欧美成人精品在线观看| 国产精品一区视频| 日韩视频欧美视频| 在线观看一区欧美| 亚洲在线不卡| 亚洲一区bb| 欧美精品1区| 美女任你摸久久| 国产欧美日韩亚州综合| 一区二区高清在线| 日韩一级精品视频在线观看| 久久深夜福利免费观看| 久久国产精品久久久久久| 欧美日韩在线另类| 亚洲国产精品视频一区| 在线日韩一区二区| 欧美尤物一区| 久久精彩视频| 国产日韩精品电影| 亚洲欧美日韩中文播放| 性8sex亚洲区入口| 国产精品亚洲综合| 亚洲午夜av| 亚洲欧美日韩网| 国产精品久久久久久久久搜平片 | 欧美成人dvd在线视频| 国内在线观看一区二区三区| 午夜精品免费在线| 久久精品欧美日韩| 激情欧美日韩一区| 麻豆精品一区二区av白丝在线| 免费观看亚洲视频大全| 樱桃国产成人精品视频| 久久综合九色综合欧美就去吻| 久久久一区二区| 韩国亚洲精品| 久久久午夜精品| 欧美高清视频免费观看| 亚洲激情在线观看| 欧美精品在线网站| 亚洲一品av免费观看| 欧美一区二区日韩一区二区| 国产三级精品在线不卡| 欧美一区三区三区高中清蜜桃 | 一色屋精品视频免费看| 久久久久国产免费免费| 欧美高清视频一区二区三区在线观看| 亚洲人成久久| 国产精品高潮粉嫩av| 欧美一级久久久| 欧美高清在线播放| 亚洲视频专区在线| 国产亚洲高清视频| 久久亚洲综合| 一本久久a久久免费精品不卡| 亚洲欧美日韩国产精品| 玉米视频成人免费看| 欧美日本成人| 欧美亚洲免费在线| 亚洲激情成人| 久久av二区| 亚洲精品国产精品国自产在线 | 亚洲欧洲av一区二区| 欧美成人免费va影院高清| 亚洲视频网在线直播| 狠狠久久五月精品中文字幕| 欧美成人性生活| 亚洲主播在线播放| 欧美激情精品久久久久久大尺度| 亚洲一区二区免费看| 尤物在线精品| 国产欧美精品xxxx另类| 欧美成人日韩| 欧美一区二区三区四区视频| 亚洲欧洲精品一区二区| 久久精品国产99国产精品| 一本到高清视频免费精品| 国内精品久久久久久 | 久久婷婷人人澡人人喊人人爽| 亚洲另类视频| 欧美成人中文字幕| 欧美中文字幕| 亚洲影院免费观看| 亚洲日本无吗高清不卡| 国语自产精品视频在线看8查询8| 欧美午夜不卡| 欧美护士18xxxxhd| 久久免费视频网站| 欧美中文字幕第一页| 亚洲女人天堂av| 99亚洲一区二区| 亚洲国产毛片完整版| 免费久久99精品国产自在现线| 欧美影院精品一区| 午夜精品一区二区三区在线| 日韩小视频在线观看专区| 亚洲国产精品美女| 亚洲第一网站免费视频| 狠狠色综合网站久久久久久久| 国产美女扒开尿口久久久| 欧美亚韩一区| 欧美亚洲第一页| 欧美午夜精品理论片a级按摩 | 夜夜爽av福利精品导航| 最近看过的日韩成人| 亚洲黄色av一区| 欧美激情一区在线| 亚洲国产清纯| 亚洲日韩第九十九页| 亚洲国产成人av| 亚洲国产精品传媒在线观看| 亚洲电影中文字幕| 亚洲电影免费在线观看| 亚洲欧洲日产国产网站| 亚洲伦理中文字幕| 亚洲视频精品在线| 性18欧美另类| 久久米奇亚洲| 欧美肥婆在线| 欧美四级在线观看| 国产欧美一区二区三区久久 | 欧美日本在线播放| 欧美午夜在线观看| 国产区欧美区日韩区| 影音先锋久久精品| 亚洲美女区一区| 亚洲一区二区黄色| 久久久99精品免费观看不卡| 免费不卡在线观看av| 亚洲精品乱码久久久久久蜜桃91 | 午夜精品在线看| 久久久99免费视频| 亚洲国产成人av| 亚洲视频在线播放| 久久精品主播| 欧美理论大片| 国产日韩在线播放| 亚洲人成欧美中文字幕| 午夜国产精品视频| 模特精品裸拍一区| 亚洲天堂免费观看| 久久一区欧美| 国产精品进线69影院| 在线欧美电影| 亚洲一区高清| 欧美大片在线看| 亚洲视频网站在线观看| 久久资源av| 国产精品欧美一区二区三区奶水| 在线观看日产精品| 午夜精品一区二区三区四区| 欧美国产日韩免费| 亚洲欧美另类国产| 欧美日韩色一区| 亚洲人成网站999久久久综合|