上海發(fā)布“書生·浦語”大模型:評測表現(xiàn)優(yōu)秀

2023-06-07 14:55:20


(相關(guān)資料圖)

“書生·浦語”聯(lián)合團(tuán)隊選取了20余項評測對其進(jìn)行檢驗,其中包含全球最具影響力的四個綜合性考試評測集,對“書生·浦語”、清華大學(xué)的GLM-130B、Meta的LLaMA-65B、OpenAI的ChatGPT和GPT-4進(jìn)行了全面測試。

6月7日,上海人工智能實(shí)驗室(上海AI實(shí)驗室)、商湯科技聯(lián)合香港中文大學(xué)、復(fù)旦大學(xué)及上海交通大學(xué)發(fā)布千億級參數(shù)大語言模型“書生·浦語”(InternLM),具有1040億參數(shù),在多項中文考試中取得超越ChatGPT的成績,在數(shù)學(xué)考試中成績明顯領(lǐng)先于谷歌、Meta的大模型。

“書生·浦語”聯(lián)合團(tuán)隊選取了20余項評測對其進(jìn)行檢驗,其中包含全球最具影響力的四個綜合性考試評測集:由伯克利加州大學(xué)等高校構(gòu)建的多任務(wù)考試評測集MMLU;微軟研究院推出的學(xué)科考試評測集AGIEval(含中國高考、司法考試及美國SAT、LSAT、GRE 和 GMAT等),AGIEval的19個評測大項中有9個大項是中國高考,通常也列為一個重要的評測子集AGIEval(GK);由上海交通大學(xué)、清華大學(xué)和愛丁堡大學(xué)合作構(gòu)建的面向中文語言模型的綜合性考試評測集C-Eval;以及由復(fù)旦大學(xué)研究團(tuán)隊構(gòu)建的高考題目評測集Gaokao。

實(shí)驗室聯(lián)合團(tuán)隊對“書生·浦語”、清華大學(xué)的GLM-130B、Meta的LLaMA-65B、OpenAI的ChatGPT和GPT-4進(jìn)行了全面測試,針對上述四個評測集的成績對比如下(滿分100分)。

標(biāo)簽:

關(guān)閉
新聞速遞