
文章核心總結(jié)與創(chuàng)新點(diǎn)主要內(nèi)容該研究以2026年韓國(guó)CSAT數(shù)學(xué)考試為基準(zhǔn),在完全無(wú)數(shù)據(jù)泄露的環(huán)境下評(píng)估了24款主流大語(yǔ)言模型(LLMs)的數(shù)學(xué)推理能力??荚嚬?6道題(22道必考題+24道選考題),涵蓋概率統(tǒng)計(jì)、微積分、幾何等核心領(lǐng)域,研究團(tuán)隊(duì)在考試公開(kāi)后2小時(shí)內(nèi)完成題目數(shù)字化,避免數(shù)據(jù)被模型訓(xùn)練收錄。通過(guò)多輸入模態(tài)(純文本、純圖像、文本+圖形)、多提示語(yǔ)言(韓語(yǔ)、英語(yǔ))及不同推理強(qiáng)度的組合測(cè)試,發(fā)現(xiàn)GPT-5系列部分模型實(shí)現(xiàn)滿分,Grok 4、Qwen 3 235B等模型得分超97分,小參數(shù)模型gpt-oss20B以95.7分展現(xiàn)高性?xún)r(jià)比;微積分是模型最弱領(lǐng)域,4分難題表現(xiàn)顯著下滑,純文本輸入效果優(yōu)于圖像輸入,推理強(qiáng)度提升雖能提高成績(jī)但會(huì)大幅增加成本與耗時(shí)。創(chuàng)新點(diǎn)構(gòu)建完全無(wú)泄露的評(píng)估環(huán)境:依托CSAT考試的高保密性,考試公開(kāi)后快速數(shù)字化題目,從根源上避免數(shù)據(jù)泄露影響,確保評(píng)估結(jié)果真實(shí)反映模型推理能力。標(biāo)準(zhǔn)化數(shù)字化流程:將面向人類(lèi)的考試材料轉(zhuǎn)化為L(zhǎng)LM可直接使用的評(píng)估數(shù)據(jù),統(tǒng)一文本(Markdown+LaTeX)、圖像提取及元數(shù)據(jù)格式,保障評(píng)估一致性。多維實(shí)用評(píng)估視角:突破單一準(zhǔn)確率指標(biāo),整合性能、成本、耗時(shí)三大維度,提出時(shí)間效率、成本效率及聯(lián)合效率評(píng)分,為實(shí)際應(yīng)用場(chǎng)景提供參考。譯文(Markdown格式)Abstract本研究利用2026年韓國(guó)大學(xué)學(xué)術(shù)能力測(cè)