11月28日消息,今天,阿里云通義團(tuán)隊(duì)宣布推出并同步開(kāi)源了全新的AI推理模型——QwQ-32B-Preview。
評(píng)測(cè)顯示,預(yù)覽版本的QwQ(Qwen with Questions)在科學(xué)推理能力上展現(xiàn)出研究生水平,尤其在數(shù)學(xué)和編程領(lǐng)域表現(xiàn)卓越,其整體推理能力可與OpenAI的o1相媲美。
據(jù)介紹,QwQ是通義千問(wèn)Qwen大模型最新推出的實(shí)驗(yàn)性研究模型,也是阿里云首個(gè)開(kāi)源的AI推理模型。
阿里云通義千問(wèn)團(tuán)隊(duì)研究發(fā)現(xiàn),當(dāng)模型有足夠的時(shí)間思考、質(zhì)疑和反思時(shí),其對(duì)數(shù)學(xué)和編程的理解就會(huì)深化,基于此QwQ取得了解決復(fù)雜問(wèn)題的突破性進(jìn)展。
在衡量科學(xué)問(wèn)題解決能力的GPQA評(píng)測(cè)集中,QwQ達(dá)到了65.2%的準(zhǔn)確率,顯示出其研究生水平的科學(xué)推理能力;在AIME評(píng)測(cè)中,QwQ以50%的勝率證明了其解決數(shù)學(xué)問(wèn)題的能力。
在MATH-500評(píng)測(cè)中,QwQ以90.6%的高分超越了o1-preview和o1-mini。在評(píng)估高難度代碼生成的LiveCodeBench評(píng)測(cè)中,QwQ答對(duì)了一半的題目,在編程競(jìng)賽題場(chǎng)景中也有出色表現(xiàn)。
不僅如此,QwQ在面對(duì)復(fù)雜問(wèn)題時(shí),能夠進(jìn)行深度自省,質(zhì)疑自身假設(shè),并通過(guò)深思熟慮的自我對(duì)話,仔細(xì)審視其推理過(guò)程的每一步。
例如,在解決經(jīng)典智力題“猜牌問(wèn)題”時(shí),QwQ通過(guò)梳理對(duì)話和推演,像個(gè)擅長(zhǎng)思考的人一樣,并最終得出正確答案。
目前,QwQ-32B-Preview已在魔搭社區(qū)和HuggingFace等平臺(tái)上開(kāi)源,發(fā)布短短幾小時(shí),引起全球開(kāi)發(fā)者熱情體驗(yàn)。
有開(kāi)發(fā)者認(rèn)為該模型“是完全沒(méi)有預(yù)料到的瘋狂的躍進(jìn)”、“今年開(kāi)源領(lǐng)域最重大的突破”、“讓中國(guó)在開(kāi)源大模型和AI推理上占據(jù)先機(jī)”。
不過(guò)通義團(tuán)隊(duì)也表示,雖然QwQ展現(xiàn)了強(qiáng)大的分析能力,但其仍是個(gè)供研究的實(shí)驗(yàn)型模型,存在不同語(yǔ)言的混合使用、偶有不恰當(dāng)偏見(jiàn)、對(duì)專(zhuān)業(yè)領(lǐng)域問(wèn)題不了解等局限,未來(lái)隨著研究深入模型迭代,這些問(wèn)題將逐步得到解決。