国产98在线 | 传媒麻豆,久久―日本道色综合久久,久久久精品久久久久久久久久久,国产成人精品免费久久久久,五月综合色婷婷影院在线观看,久久久亚洲精品视频

  • 虎科技 - 領(lǐng)先的互聯(lián)網(wǎng)科技媒體

通義千問開源數(shù)學(xué)模型Qwen2-Math,數(shù)學(xué)能力超越GPT-4o

   時(shí)間:2024-08-09 12:01

8月9日消息,阿里通義團(tuán)隊(duì)開源新一代數(shù)學(xué)模型Qwen2-Math,包含1.5B、7B、72B三個(gè)參數(shù)的基礎(chǔ)模型和指令微調(diào)模型。Qwen2-Math基于通義千問開源大語言模型Qwen2研發(fā),旗艦?zāi)P? Qwen2-Math-72B-Instruct在權(quán)威測(cè)評(píng)集MATH上的得分超越GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro、Llama-3.1-405B等,以84%的準(zhǔn)確率處理了代數(shù)、幾何、計(jì)數(shù)與概率、數(shù)論等多種數(shù)學(xué)問題,成為最先進(jìn)的數(shù)學(xué)專項(xiàng)模型。

注:在MATH基準(zhǔn)測(cè)評(píng)中,通義千問數(shù)學(xué)模型的旗艦款Qwen2-Math-72B-Instruct取得了84%的準(zhǔn)確率,超過GPT-4o、Claude-3.5-Sonnet、Gemini-1.5-Pro 和 Llama-3.1-405B等開閉源模型。

Qwen2-Math 基礎(chǔ)模型使用 Qwen2大語言模型進(jìn)行初始化,并在精心設(shè)計(jì)的數(shù)學(xué)專用語料庫上進(jìn)行預(yù)訓(xùn)練,訓(xùn)練數(shù)據(jù)包含大規(guī)模高質(zhì)量的數(shù)學(xué)網(wǎng)絡(luò)文本、書籍、代碼、考試題目,以及由 Qwen2 模型合成的數(shù)學(xué)預(yù)訓(xùn)練數(shù)據(jù)。所有預(yù)訓(xùn)練和微調(diào)數(shù)據(jù)集都進(jìn)行了去污染處理。

隨后,研發(fā)團(tuán)隊(duì)訓(xùn)練了指令微調(diào)版本模型:基于Qwen2-Math-72B 訓(xùn)練一個(gè)數(shù)學(xué)專用的獎(jiǎng)勵(lì)模型;接著,將密集的獎(jiǎng)勵(lì)信號(hào)與指示模型是否正確回答問題的二元信號(hào)結(jié)合,用作學(xué)習(xí)標(biāo)簽,再通過拒絕采樣構(gòu)建監(jiān)督微調(diào)(SFT)數(shù)據(jù);最后在SFT模型基礎(chǔ)上使用 GRPO 方法優(yōu)化模型。

據(jù)悉,Qwen2-Math系列模型目前主要支持英文,通義團(tuán)隊(duì)很快就將推出中英雙語版本,多語言版本也在開發(fā)中。

通義團(tuán)隊(duì)在多個(gè)中英文數(shù)學(xué)基準(zhǔn)測(cè)評(píng)集對(duì)指令微調(diào)模型作了性能評(píng)估,除了 GSM8K 和 MATH等常見的測(cè)評(píng)基準(zhǔn) ,還引入了更具挑戰(zhàn)性的考試競(jìng)賽類測(cè)試,如奧林匹克級(jí)別的基準(zhǔn)測(cè)評(píng)OlympiadBench、大學(xué)數(shù)學(xué)級(jí)別的基準(zhǔn)測(cè)評(píng)CollegeMath、高考(GaoKao)、美國數(shù)學(xué)邀請(qǐng)賽(AIME)2024 賽題、美國數(shù)學(xué)競(jìng)賽( AMC)2023賽題,中文測(cè)評(píng)則有CMATH測(cè)評(píng)集、2024年中國高考和中考數(shù)學(xué)題。最終,Qwen2-Math-72B-Instruct表現(xiàn)優(yōu)異,在十大測(cè)評(píng)中都獲得了遠(yuǎn)超其他開源數(shù)學(xué)模型的成績。

注:研發(fā)團(tuán)隊(duì)在greedy和RM@8 的條件下對(duì)模型作了測(cè)評(píng),表中為每款Qwen2-Math-72B-Instruct模型列出了三個(gè)得分結(jié)果,分別是第1次回答得分(無下標(biāo)數(shù)字)、8次回答中出現(xiàn)最多次數(shù)的答案的得分,8次回答中reward model所選答案的得分。

“大模型能不能做數(shù)學(xué)題”,不僅是社交平臺(tái)的熱門話題,也是業(yè)界非常關(guān)注的研究課題。處理高級(jí)數(shù)學(xué)問題,需要模型具備復(fù)雜多步邏輯推理能力。通義團(tuán)隊(duì)在技術(shù)博客中表示,希望通過開源“為科學(xué)界解決高級(jí)數(shù)學(xué)問題做出貢獻(xiàn)”,未來將持續(xù)增強(qiáng)模型數(shù)學(xué)能力。

附:Qwen2-Math解題示例

Qwen2-Math解題示例
 
 
更多>同類內(nèi)容
推薦圖文
推薦內(nèi)容
點(diǎn)擊排行
 
智快科技微信賬號(hào)
ITBear微信賬號(hào)

微信掃一掃
加微信拉群
電動(dòng)汽車群
科技數(shù)碼群

主站蜘蛛池模板: 久久精品久久久 | 亚洲自拍偷拍网 | 一区二区免费在线观看 | 久久精品国产亚洲a不卡 | 亚洲综合无码一区二区 | 羞羞视频在线观看免费 | 欧美一区二区三区久久综 | 在线视频精品视频 | a级日本 | 国产手机在线观看视频 | 五月综合激情视频在线观看 | 激情网站视频 | 国产乱视频网站 | 在线免费视频一区二区 | 性生活视频网站 | 第一区免费在线观看 | 亚洲精品不卡久久久久久 | 欧美乱码| 亚洲一区在线观看视频 | 伊人网2021 | 成人久久久久 | 亚洲高清中文字幕精品不卡 | 国产精品久久久久久久人热 | 亚洲综合激情六月婷婷在线观看 | 丁香五色月 | 国产欧美一区二区精品性色 | 久久两性视频 | 亚洲精品99久久久久中文字幕 | 欧美性色黄大片www 欧美黄色性视频 | 亚洲区 欧美区 | 国产福利一区二区精品视频 | 能看毛片的网站 | 亚洲天堂网在线观看视频 | 一区二区三区电影 | 综合 欧美 亚洲日本 | 亚洲精品蜜桃久久久久久 | 在线视频一区二区三区三区不卡 | 久久久久久久九九九九 | 黄色资源在线 | 亚洲高清视频在线播放 | 亚洲午夜精品国产电影在线观看 |