日韩AV片无码一区二区不卡电影_HEYZO无码综合国产精品_国产精品无码a∨精品_韩日美无码精品无码

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一

2024-05-22 17:13:24 335觀看

OpenAI長期霸榜的SuperCLUE(中文大模型測評基準),終于被國產大模型反將一軍。Orf驛資訊

事情是這樣的。Orf驛資訊

自打SuperCLUE問世以來,成績第一的選手基本上要么是GPT-4,要么是GPT-4 Turbo,來感受一下這個feel:Orf驛資訊

(PS:共有6次成績,分別為2023年的9月-12月和2024年的2月、4月。)Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方Orf驛資訊

但就在近,隨著一位國產選手申請的出戰,這一局面終是迎來了變數。Orf驛資訊

SuperCLUE團隊對其進行了一番全方位的綜合性測評,終官宣的成績是:Orf驛資訊

總分80.03分,超過GPT-4 Turbo的79.13分,成績第一!Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方公眾號Orf驛資訊

而這位國產大模型選手,正是來自商湯科技的日日新5.0(SenseChat V5)。Orf驛資訊

并且SuperCLUE還給出了這樣的評價:Orf驛資訊

刷新了國內大模型好成績。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

那么商湯在SuperCLUE的這個“首次”,又是如何解鎖的呢?Orf驛資訊

綜合、文科國內外第一,理科國內第一Orf驛資訊

首先我們來看下這次官方所搭建“擂臺”的競技環境。Orf驛資訊

出戰選手:SenseChat V5(于5月11日提供的內測API版本)Orf驛資訊

評測集:SuperCLUE綜合性測評基準4月評測集,2194道多輪簡答題,包括計算、邏輯推理、代碼、長文本在內的基礎十大任務。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方報告Orf驛資訊

模型GenerationConfig配置:Orf驛資訊

temperature=0.01Orf驛資訊

repetition_penalty=1.0Orf驛資訊

top_p=0.8Orf驛資訊

max_new_tokens=2048Orf驛資訊

stream=falseOrf驛資訊

至于具體的評測方法,SuperCLUE在已發布的相關報告中也有所披露:Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方報告Orf驛資訊

以上就是SuperCLUE公開的競技環境配置。Orf驛資訊

至于結果,除了剛才我們提到的綜合成績之外,官方還從文科和理科兩個維度,再做了細分的評測。Orf驛資訊

SenseChat V5在文科上的成績依然是打破了國內大模型的紀錄——Orf驛資訊

以82.20分的成績位居第一,同樣超越了GPT-4 Turbo。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方公眾號Orf驛資訊

在理科成績上,雖然SenseChat V5此次并沒有超越GPT-4-Turbo(低了4.35分),但整體來看,依舊在國內大模型選手中首屈一指,位列國內第一。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方公眾號Orf驛資訊

除了文理科之外,SuperCLUE也還從國內和國外的整體平均水平上做了對比。Orf驛資訊

例如和國內大模型平均水平相比,其各項成績的“打開方式”是這樣的:Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方公眾號Orf驛資訊

而在與國外選手做性能對比時,我們可以明顯看到SenseChat V5文科能力優于國外選手,數理能力也非常優秀,代碼能力依然有提升空間。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊
△圖源:SuperCLUE官方公眾號Orf驛資訊

不過有一說一,評測分數定然是代表大模型性能的一方面,但在應用為王的當下,更重要的一點或許就得看用的效果了。Orf驛資訊

實測SenseChat V5Orf驛資訊

SenseChat V5早在4月底便已經集成到了“商量”在線的對話應用中,因此我們現在就可以出題對它做一番考驗。Orf驛資訊

在邏輯測試方面,帶有文字陷阱的腦筋急轉彎,可以說是測試一個AI能力很好的例子,比如:Orf驛資訊

《紅樓夢》全書有百萬字,“紅樓夢”有幾個字?Orf驛資訊

若是仔細觀察這句話,不難發現其實句子前后并沒有太大的關聯,是一個比較典型的腦筋急轉彎。Orf驛資訊

對此,SenseChat V5給出的答案是:Orf驛資訊

《紅樓夢》作為中國古典文學的巔峰之作,其全文字數大約在70萬到80萬字之間,具體字數根據不同版本稍有差異。而標題“紅樓夢”這三個字,自然是只有三個字。這個標題凝練而富有深意,象征著作品的夢幻色彩和對封建家族興衰的深刻反思。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

我們可以看到SenseChat V5不僅找出了問題的陷阱并做出了分析,給出的答案也是正確的。Orf驛資訊

對于數學的能力,我們設置了這樣的一個問題:Orf驛資訊

假設有一個池塘,里面有無窮多的水。現有2個空水壺,容積分別為5升和6升。如何只用這2個水壺從池塘里取得3升的水。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

同樣的,SenseChat V5依舊是給出了每一個詳細的步驟和分析,并得到了終結果。Orf驛資訊

更直接的數學問題,例如找數字之間的規律,SenseChat V5也是信手拈來:Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

在中文理解方面,即使是給SenseChat V5一大段文言文,并且上難度連環發問,它是否可以hold得住?Orf驛資訊

請看結果:Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

后,有請“弱智吧Benchmark”:Orf驛資訊

網吧能上網,為什么弱智吧不能上弱智?Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

嗯,確實是有點實力在身上的。Orf驛資訊

如何做到的?Orf驛資訊

其實對于這個問題,商湯在4月底將自家日日新大模型SenseNova版本迭代到5.0之際,就已經有所透露;當時商湯鎖定的定位就是全面對標GPT-4 Turbo。Orf驛資訊

具體到技術,可以分為三大方面:Orf驛資訊

采用MoE架構Orf驛資訊

基于超過10TB tokens訓練,擁有大量合成數據Orf驛資訊

推理上下文窗口達到200KOrf驛資訊

首先,為了突破數據層面的瓶頸,商湯科技使用了超過10T的tokens,確保了高質量數據的完整性,使得大模型對客觀知識和世界有了基本的認知。Orf驛資訊

商湯還生成了數千億tokens的思維鏈數據,這是此次數據層面創新的關鍵,能夠激發大模型的強大推理能力。Orf驛資訊

其次,在算力層面,商湯科技通過聯合優化算法設計和算力設施來提升性能:算力設施的拓撲極限用于定義下一階段的算法,而算法的新進展又反過來指導算力設施的建設。Orf驛資訊

這也是商湯AI大裝置在算法和算力聯合迭代上的核心優勢。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

在其它細節方面,例如訓練策略上的創新,商湯將訓練過程分為三個大階段(預訓練、監督微調、RLHF)和六個子階段,每個階段專注于提升模型的特定能力。Orf驛資訊

例如,單是在預訓練這個階段,又可以細分為三個子階段:初期聚焦于語言能力和基礎常識的積累,中期擴展知識基礎和長文表達能力,后期則通過超長文本和復雜思維數據進一步拔高模型能力。Orf驛資訊

因此在預訓練結束之際,整個模型就已經擁有了較高水平的基礎能力;但此時它的交互能力卻還沒有被激發出來,也就來到了第二階段的監督微調(SFT)和第三階段的人類反饋強化學習(RLHF)。Orf驛資訊

整體可以理解為先培養模型遵循指令和解決問題的能力,再調節其表達風格以更貼近人類的表達方式。接著,通過多維度的人類反饋強化學習過程,進一步改進模型的表達方式和安全性。Orf驛資訊

除此之外,商湯對于大模型的能力還有獨到的三層架構(KRE)的理解。Orf驛資訊

GPT-4 Turbo首次被擊敗!國產大模型拿下總分第一Orf驛資訊

首先是在知識,是指世界知識的全面灌注。Orf驛資訊

目前大模型等新質生產力工具近乎都是基于此來解決問題,也就是根據前人已經解決過的問題的方案,來回答你的問題。Orf驛資訊

這可以認為是大模型能力的基本功,但更為高階的知識,應當是基于這樣能力下推理得到的新知識,這也就是這個架構的第二層——推理,即理性思維的質變提升。Orf驛資訊

這一層的能力是可以決定大模型是否夠聰明、是否可以舉一反三的關鍵和核心。Orf驛資訊

再在此之上,便是執行,是指世界內容的交互變革,也就是如何跟真實世界產生互動(就目前而言,具身智能在這一層是潛力股般的存在)。Orf驛資訊

三者雖相互獨立,但層與層之間也是緊密關聯,打一個較為形象的比喻就是“知識到推理是像大腦,推理到執行則像小腦”。Orf驛資訊

在商湯看來,這三層的架構是大模型應當具備的能力,而這也正是啟發商湯構建高質量數據的關鍵。Orf驛資訊

One More ThingOrf驛資訊

其實對于大模型測評這事,業界質疑的聲音也是層出不窮,認為是“刷分”、“刷榜”、“看效果才是重要的”。Orf驛資訊

對于這樣敏感的問題,商湯在與量子位的交流過程中也是直面并給出了他們的看法:Orf驛資訊

無論從用戶選擇合適模型的角度,還是從研究者進行操作研究的需要來看,對模型能力的評價是必不可少的。Orf驛資訊

這不僅幫助用戶和研究者了解不同模型的性能,也是推動模型發展的關鍵因素。Orf驛資訊

如果只針對一個公開的評測集進行優化(即刷分),是有可能提高模型在該評測集上的分數的。Orf驛資訊

評測不應只依賴單一數據集,而應通過多個評測集和第三方閉卷考試等方式相互印證,以此來得到更全面、更有說服力的模型性能評估。Orf驛資訊

以及對于國內近期各個大模型廠商正打得熱火朝天的價格戰,商湯將眼光放在了提供更深的端到端產品價值上,特別是在具備無限潛力且與生活應用更接近的移動端上,通過端云協同實現更優的計算成本但不損害模型的綜合能力。Orf驛資訊

這或許暗示了商湯將通過技術創新和優化成本結構,為未來可能入局的價格競爭做好了自己的規劃。Orf驛資訊

參考鏈接:Orf驛資訊

[1]https://www.superclueai.com/Orf驛資訊

[2]https://mp.weixin.qq.com/s/3pfOKtG6ar2h2fR6Isv_XwOrf驛資訊

本文鏈接:http://m.bbbearmall.com/news-129578.htmlGPT-4 Turbo首次被擊敗!國產大模型拿下總分第一

標簽:
聲明:本網頁內容旨在傳播知識,若有侵權等問題請及時與本網聯系,我們將在第一時間刪除處理。郵件:2376512515@qq.com。天上從來不會掉餡餅,請大家時刻謹防詐騙
日韩AV片无码一区二区不卡电影_HEYZO无码综合国产精品_国产精品无码a∨精品_韩日美无码精品无码

    999在线免费视频| 日本免费在线视频观看| 欧美性受xxxx黒人xyx性爽| 肉色超薄丝袜脚交| 国产爆乳无码一区二区麻豆| 五月婷婷丁香综合网| 韩日视频在线观看| 亚洲娇小娇小娇小| 337p粉嫩大胆噜噜噜鲁| 可以免费看的黄色网址| 成年网站在线播放| 亚欧无线一线二线三线区别| 日韩最新中文字幕| 一区二区xxx| 青青草原av在线播放| 妺妺窝人体色www看人体| 中文字幕在线观看日| 久久综合久久色| 欧美 日韩 亚洲 一区| 日本黄xxxxxxxxx100| www.久久久久久久久久久| 日韩欧美在线免费观看视频| 国产欧美日韩网站| av 日韩 人妻 黑人 综合 无码| 一路向西2在线观看| 成年人视频观看| 青青青青草视频| 99中文字幕在线观看| 天天色综合社区| 黄色免费网址大全| 欧美一级黄色片视频| 波多野结衣乳巨码无在线| 91动漫在线看| 日本精品免费视频| 蜜臀一区二区三区精品免费视频 | 可以看污的网站| 成年人视频在线免费| 青青青免费在线| 草b视频在线观看| 国产免费一区二区视频| 国产毛片久久久久久国产毛片| 路边理发店露脸熟妇泻火| 2025韩国大尺度电影| 欧美成人一区二区在线观看| 久久视频这里有精品| 成年人视频网站免费| 成人在线观看毛片| 日韩一级特黄毛片| 国产黄色激情视频| 精品无码国产一区二区三区av| 中文字幕超清在线免费观看| 免费观看黄色的网站| 国产一级片91| 国产成人在线小视频| 成人免费在线网| 欧美日韩国产精品激情在线播放| 中国丰满人妻videoshd| 亚洲 中文字幕 日韩 无码| 88av.com| 中文字幕色网站| 影音先锋男人的网站| 日本a在线天堂| 五十路熟女丰满大屁股| av免费在线播放网站| 中文字幕国内自拍| 操人视频免费看| 中文精品无码中文字幕无码专区 | 欧美爱爱视频免费看| 免费日韩视频在线观看| 亚洲男人天堂色| 999久久久精品视频| 韩国无码av片在线观看网站| 极品美女扒开粉嫩小泬| 欧在线一二三四区| 最新天堂在线视频| 在线观看成人免费| 亚洲第一狼人区| 亚洲乱码国产一区三区| 婷婷激情四射五月天| 中文字幕日韩综合| 免费的av在线| 各处沟厕大尺度偷拍女厕嘘嘘| 超碰在线97免费| 日韩不卡视频一区二区| 久久人人爽人人爽人人av| 成人午夜视频免费在线观看| 欧美少妇性生活视频| 青青草原国产免费| 丰满少妇久久久| 国产九九热视频| 国产在线视频在线| 看欧美ab黄色大片视频免费| 久久久国产精华液999999 | 一本之道在线视频| www.av91| www.这里只有精品| 国产女教师bbwbbwbbw| www.天天射.com| 国产情侣第一页| 国产福利在线免费| 黄色国产一级视频| 激情图片中文字幕| 久久精品国产精品亚洲色婷婷| 中文字幕1234区| 欧美一区二区中文字幕| 亚洲天堂伊人网| 欧美日韩中文在线视频| 久久天天东北熟女毛茸茸| 不卡影院一区二区| 欧美大黑帍在线播放| 欧美激情第3页| 久久精品.com| 黄色一级片黄色| 亚洲天堂网站在线| 人人爽人人av| 蜜桃传媒一区二区三区| 在线播放av中文字幕| 超碰网在线观看| 拔插拔插海外华人免费| 亚洲精品在线网址| 91香蕉视频导航| 精品国产一二三四区| 国产精品88久久久久久妇女 | 99视频精品全部免费看| www.欧美日本| 蜜桃传媒一区二区三区| 国产美女视频免费| 黄色小视频免费网站| 欧美激情 国产精品| 波多野结衣与黑人| 国内av一区二区| 日韩av在线中文| 亚洲中文字幕久久精品无码喷水 | 精品亚洲视频在线| 北条麻妃视频在线| 亚洲 欧美 日韩 国产综合 在线| 免费观看国产视频在线| 国内国产精品天干天干| 婷婷六月天在线| 成年网站在线免费观看| 国产毛片视频网站| www.av毛片| 妞干网在线观看视频| 男人天堂手机在线视频| 免费在线精品视频| 成人免费看片视频在线观看| 香蕉视频xxxx| 国产精品igao网网址不卡| 在线免费看污网站| 欧美丝袜在线观看| 国产精品嫩草影院8vv8| 欧美特黄aaa| 国产永久免费网站| 国产乱码一区二区三区四区| 久久99爱视频| 97超碰人人爽| www.cao超碰| 日本一二三四区视频| 日韩av加勒比| 少妇高潮流白浆| 99亚洲国产精品| 福利在线一区二区| 免费av手机在线观看| 波多野结衣乳巨码无在线| 久久精品国产精品亚洲色婷婷| 黄在线观看网站| 激情综合网俺也去| 日本中文字幕二区| 日本福利视频导航| 六月婷婷激情综合| 久久视频这里有精品| 亚洲人成色77777| 久久撸在线视频| 特级西西444www| 黄色一级片国产| 国产资源在线视频| 激情五月亚洲色图| 久热在线视频观看| 国产又粗又长又爽视频| 日韩av在线播放不卡| 97在线免费公开视频| mm131亚洲精品| 国产农村妇女精品久久| 777久久精品一区二区三区无码| 日韩五码在线观看| 免费男同深夜夜行网站| 亚洲人视频在线| 国产又粗又长又爽视频| 久久无码高潮喷水| 亚洲xxx在线观看| 日韩国产成人无码av毛片| 女性隐私黄www网站视频| 中文字幕成人免费视频| 400部精品国偷自产在线观看| 777精品久无码人妻蜜桃| 久久久久久三级| 浴室偷拍美女洗澡456在线| 日韩avxxx| 999热精品视频| av7777777|