大语言模型在牙科入学考试中的表现评估：潜力与局限探索

首页今日动态人才市场新技术专栏中国科学人云展台
BioHot
云讲堂直播会展中心特价专栏技术快讯免费试用

生物通官微
陪你抓住生命科技
跳动的脉搏

生物通首页 > 今日动态 > 正文

《Health Data Science》：Benchmarking of Large Language Models for the Dental Admission Test

【字体：大中小】 时间：2025年04月03日 来源：Health Data Science

编辑推荐：

　　为探究大语言模型（LLMs）在牙科入学考试（DAT）备考中的适用性，研究人员评估 16 种 LLMs 回答 DAT 样本问题的能力。结果显示不同模型表现各异，在文本任务和图像任务上各有优劣。该研究为 LLMs 在牙科教育中的应用提供重要参考。

免费索取人源化小鼠模型助力遗传病基因治疗研究资料

濠电姷鏁搁崑鐐哄垂閸洖绠插ù锝呭濞存牠鏌曟繛褍妫楀皬闂備焦鏋奸弲娑㈠疮娴兼潙鐓樼€广儱顦伴悡鏇㈡煙娴煎瓨娑ф鐐瘁缚缁辨帡鎮╅崫鍕優缂備浇椴哥敮妤€顕ラ崟顓涘亾閿濆簼绨藉ù鐘虫綑椤啴濡堕崱妤冾儌闂佸摜濮甸悧鐘荤嵁閸℃稑绀冩い鏃囧亹椤︽澘顪冮妶鍛婵☆偅鐩畷鎰版倷閻戞ǚ鎷洪梺闈╁瘜閸欌偓婵＄偓鎮傞弻娑樷枎韫囨洜顔婂┑鈥冲级閸旀洟鍩為幋鐘亾閿濆骸浜滃ù鐘虫そ濮婅櫣绱掑Ο鑽ゅ弳闂佸湱鈷堥崑濠囧春濞戙垹鍐€妞ゆ挾鍟块幏鍝勵渻閵堝棗濮х紒韫矙瀹曨偄煤椤忓懐鍘遍梺鎸庣箓鐎氼剙鐣甸崱妯诲弿濠电姴鍊归崑銉р偓瑙勬礋娴滆泛顕ｉ幘顔藉亹闁告瑥顦伴悵锕傛⒒娴ｅ憡鎯堟い锔诲亰瀵彃饪伴崼鐔蜂画閻熸粍妫冮獮鍡樼瑹閳ь剟鐛幒鎳虫棃鍩€椤掆偓铻炴慨妞诲亾闁哄本鐩俊鐑藉閳╁啰褰囬柣鐔哥矋濠㈡ê岣块敓鐘茶摕闁靛ǹ鍎Σ鍫熶繆椤栨氨浠㈡い蹇ｅ幖椤啴濡堕崒娑欐闂佹悶鍎洪悡鍫濐潖閸ф鈷戦梺顐ゅ仜閼活垱鏅堕幘顔界厵鐎规洖娲ら弸鎴炵箾閻撳海绠诲┑鈩冩倐閺佸倿鏌ㄩ姘濡炪倖娲嶉崑鎾绘煛鐏炲墽鈽夐摶锝夋煟閹惧啿顒㈤柣搴ㄧ畺濮婃椽宕崟闈涘壈闂佸摜鍠愰幐鍐差嚕椤愩埄鍚嬮柛娑卞灡濞堟洟姊洪崨濠傚闁稿骸鍟块埢鎾诲蓟閵夛腹鎷虹紓鍌欑劍閿氬┑顔碱樀閺岀喖鎼归锝呯３閻庤娲滈弫濠氥€佸璺虹劦妞ゆ帒瀚弸浣衡偓骞垮劚椤︿即寮查幖浣圭叆闁绘洖鍊圭€氾拷闂傚倷娴囧畷鍨叏閹惰姤鈷旂€广儱顦崹鍌炴煢濡尨绱氶柨婵嗩槸缁€鍕叏濠垫挾顔嘓ot缂傚倸鍊搁崐宄邦渻閹烘梻鐭氶柛顐ｆ礀閸ㄥ倻鐥鐐村櫡濞存粌缍婇弻娑㈠Ψ椤旂厧顫╅梺绋胯閸旀垿寮婚敐澶婃闁圭ǹ楠搁弳鍫ユ⒑鐠囨彃鍤遍柟鍑ゆ嫹

　　在当今数字化时代，教育领域正经历着前所未有的变革，大语言模型（Large Language Models，LLMs）的出现为教育带来了新的可能性。它们被广泛应用于各个领域，在医疗教育方面，也展现出了如个性化学习、互动辅导等多种应用潜力。然而，在像牙科入学考试（Dental Admission Test，DAT）这样重要的高风险考试中，LLMs 的表现究竟如何，其能力边界在哪里，一直是教育者、学生和相关研究人员极为关注的问题。

DAT 作为众多牙科院校评估申请者的关键指标，其成绩与学生入学后的表现密切相关。但以往对于 LLMs 在 DAT 评估中的研究较少，这使得人们难以确定如何在 DAT 备考中有效利用 LLMs。为了解决这一问题，来自未知研究机构的研究人员开展了一项关于 “Benchmarking of Large Language Models for the Dental Admission Test” 的研究，该研究成果发表在《Health Data Science》杂志上。

免费领取人源化小鼠模型构建和应用手册濠电姷顣藉Σ鍛村磻閸曨剚鍎熸繝濠傜墕缁狀垶鏌ㄩ悤鍌涘 闂傚倸鍊风粈渚€骞夐敓鐘冲仭闂侇剙绉寸粻顖炴煥閻曞倹瀚�

在这项研究中，研究人员主要采用了以下关键技术方法：首先，从美国牙科协会获取公开的 DAT 样本测试题，该测试题包含自然科学（Natural Sciences，NS）、感知能力（Perceptual Ability，PA）、阅读理解（Reading Comprehension，RC）和定量推理（Quantitative Reasoning，QR）四个部分，共 247 道选择题。然后，研究人员选用了 16 种 LLMs 进行测试，包括通用模型（如 GPT - 3.5、GPT - 4 等）、领域特定微调模型（如 DentalGPT、MedGPT 等）和开源模型（如 Llama2 系列、Llama3 系列）。对于文本类问题，直接让模型回答；对于图像类问题，因部分模型无法直接处理，研究人员将图像截图后转发给具备图像处理能力的模型。最后，研究人员通过定量分析计算模型答题的正确率，还邀请两位牙科或口腔健康相关学科的专家，采用分层随机抽样的方式选取 50 道题的模型回答进行定性的主题分析。

研究结果如下：

婵犲痉鏉库偓妤佹叏閻戣棄纾绘繛鎴欏灪閸婅埖绻濋棃娑卞剰缂佺姷鍠栭弻銊╂偆閸屾稑顏� 赛默飞全新液相色谱有啥不一样？答卷有礼

16 种 LLMs 的测试表现：在文本类问题上，常用的 LLMs 如 GPT - 4o、GPT - 3.5、Bard、Claude 和 GPT - o1 在 NS 和 RC 部分表现出色，准确率普遍超过 80%。其中，GPT - 4o 在所有文本类部分表现最佳，NS、RC 和 QR 部分的准确率分别达到 100%、100% 和 95%；GPT - o1 在 NS 和 RC 部分也取得了满分的好成绩，QR 部分准确率为 95%。开源模型 Llama3 - 70B 表现也较为突出，NS 部分准确率为 89%，RC 部分达到 100%。而领域特定微调模型如 DentalGPT、MedGPT 和 BioGPT 在 NS 部分表现尚可，但在 RC 和 QR 部分表现较弱。在图像类问题上，所有模型表现都较为有限。例如，在 PA 部分，GPT - 4o、Bard、Claude 和 GPT - o1 的准确率分别仅为 24%、19%、36% 和 21%，领域特定微调模型的表现也不理想，开源的 Llama 系列模型因架构限制未参与此类测试。
16 种 LLMs 在模型生成文本方面的表现：专家通过主题分析，确定了 LLMs 回答问题时出现错误的七个主题，包括批判性思维、逐步分析、知识转化为正确答案、复杂问题理解、幻觉、不必要的复杂性和排除过程。研究发现，LLMs 在回答需要批判性思维和逐步分析的基础科学问题时表现较差，面对复杂问题时容易误解并给出错误答案，甚至会产生幻觉。例如，在化学酸碱反应问题中，模型未能正确运用批判性思维判断水在反应中的角色；在数学年龄计算问题中，模型虽然步骤正确，但后续计算错误。
LLMs 在 DAT 备考中的潜力与局限：从布鲁姆分类法（Bloom’s Taxonomy）的角度来看，LLMs 在理解和回答文本类问题，尤其是涉及 RC 和事实性知识方面有一定潜力，可以用于解释和强化概念、提供练习题和针对性反馈，为学生创造更个性化的学习体验。然而，LLMs 在解决 QR 和 PA 问题上存在明显局限，它们在处理需要批判性思维、逻辑推理和逐步分析的问题时表现不佳，且存在产生错误信息和不必要复杂性的情况，这可能会误导学生。

研究结论和讨论部分指出，LLMs 在强化事实性知识和支持个性化学习方面具有一定潜力，但在需要高阶认知技能的任务中存在显著风险。不同类型的模型在性能上存在差异，商业模型在文本任务中表现突出，微调的领域特定模型和开源模型各有优劣。同时，研究还发现 LLMs 在视觉空间推理任务中存在普遍困难，这为未来模型的改进指明了方向。未来可通过针对性的微调、整合多模态能力、减少幻觉以及利用生物医学知识图谱（Biomedical Knowledge Graphs，BKGs）和检索增强生成（Retrieval - Augmented Generation，RAG）系统等方法提升 LLMs 在教育领域的应用效果。此外，还需要开展纵向研究，评估基于 LLMs 的工具对学习者长期学习成果的影响。

这项研究的重要意义在于，它为 LLMs 在 DAT 备考中的应用提供了全面而深入的评估，让人们清晰地认识到 LLMs 的优势与不足。这不仅有助于教育者、学生和相关机构在 DAT 备考中合理使用 LLMs，也为后续研究人员改进和优化 LLMs 提供了重要的参考依据，推动了 LLMs 在医疗教育领域的进一步发展。

濠电姷鏁搁崑鐐哄垂閸洖绠伴柟闂寸贰閺佸嫰鏌涢锝囪穿鐟滅増甯掗悙濠囨煃鐟欏嫬鍔ゅù婊堢畺閺岋綁鎮㈤悡搴濆枈濠碘剝褰冨﹢閬嶅焵椤掑喚娼愰柟绋挎憸閳ь剚绋堥弲婵嬪焵椤掑嫭娑ч柕鍫熸倐瀵偊宕掗悙鏉戔偓閿嬨亜閹哄秶鍔嶉柣锕€閰ｅ铏规嫚閹绘帩鍔夌紓浣割儐鐢€崇暦濠靛绠虫俊銈傚亾缂佲偓婢舵劖鐓熼柡鍐ㄥ€哥敮鑸垫交濠靛洨绡€闁汇垽娼у瓭濠电偠灏欐繛鈧€规洘鍨块獮姗€骞囨担鐟板厞闁诲氦顫夊ú鏍洪妸鈺傚仼闁惧繐婀辩壕浠嬫煕鐏炲墽鎳呮い锔奸檮娣囧﹪顢曢敐鍥╃厜閻庤娲樺ú鐔笺€侀弮鍫濆窛妞ゆ牭绲剧粊顐︽⒒娴ｇ懓顕滅紒璇插€块幃褔骞樺鍕枔閳ь剨缍嗛崰妤呮偂濞嗘劗绠鹃柤濂割杺閸ゆ瑦顨ラ悙杈捐€块柡灞炬礋瀹曞爼濡搁妷銉︽嚈闁诲孩顔栭崳顕€宕滈悢鑲╁祦鐎广儱顦介弫濠囨煟閿濆懏婀版繛鍫熸倐濮婄粯鎷呴挊澶夋睏闂佺儵鍓濆Λ鍐ㄧ暦瑜版帗鎯炴い鎰剁稻閻濈兘姊虹粔鍡楀濞堟洘銇勯妷銉уⅵ闁哄本鐩獮姗€鎳犻澶嬓滃┑鐐差嚟婵參宕归崼鏇炶摕闁哄洢鍨归獮銏′繆閵堝拑宸ラ柛鎾讳憾閺岋綁濮€閳轰胶浠繝銏㈡嚀濡宓勯梺鍦濠㈡﹢锝為崨瀛樼厽婵炲棗鑻禍鎯р攽閻愯尙婀撮柛濠冩礋濠€渚€姊洪幐搴ｇ畵婵☆偅鐟х划鍫⑩偓锝庡枟閻撳啰鎲稿⿰鍫濈婵﹩鍘鹃埞宥夋煣韫囨凹娼愮€规洘鐓￠弻娑㈠箛閵婏附鐝栧銈傛櫇閸忔﹢寮婚妸銉㈡斀闁糕剝鐟ラ埅闈涒攽閳藉棗鐏犳い鎴濐樀瀵鈽夐姀鐘殿唺闂佺懓顕崕鎰涢敓鐘斥拺閻犲洤寮堕崬澶娾攽椤斿搫鈧鍒掑鑸电劶鐎广儱鎳愰ˇ銊ヮ渻閵堝棙灏靛┑顔惧厴椤㈡瑩骞掑Δ浣叉嫼闁荤姴娲犻埀顒冩珪閻忎線姊洪崨濠冪叆濡ょ姵鎮傞崺銏ゅ箻鐠囪尙顓洪梺鎸庢濡嫬鈻撻妷銉富闁靛牆妫涙晶顒傜磼椤旇偐鐒搁柛鈺傜洴瀵粙顢橀悢鍝勫箞婵犵數鍋涘Λ娆撳礉閺囥垺鍊堕柍鍝勫亞濞堜粙鏌ｉ幇顒€绾ч柛鐘筹耿閺岀喖顢涘姣櫻呪偓娈垮櫘閸ｏ絽鐣烽幒鎳虫梹鎷呯憴鍕絻

10x Genomics闂傚倸鍊风粈渚€骞栭锕€纾归柣鐔煎亰閻斿棙鎱ㄥ璇蹭壕濡ょ姷鍋為悧鐘诲灳閺傝￥鈧帗鍒婇悥鍓坢 HD 闂備浇顕х€涒晠顢欓弽顓炵獥闁圭儤顨呯壕濠氭煙閸撗呭笡闁绘挻娲橀幈銊ノ熼悡搴′粯闂佽绻掓慨鐑藉焵椤掑喚娼愭繛鍙夌矒瀹曚即骞橀懜娈挎綗闂佸湱鍎ら〃鍛寸嵁閵忊剝鍙忔慨妤€妫楁晶顔尖攽椤旂厧鏆ｆ慨濠冩そ瀹曘劍绻濋崒婊呮噯婵犵妲呴崑鍛垝瀹ュ桅闁哄啫鐗嗙粻鐟懊归敐鍥ㄥ殌濞寸姰鍨藉娲箹閻愭彃濮夐梺鍝勬噺缁捇骞冩ィ鍐╃劶鐎广儱妫涢崢閬嶆椤愩垺鎼愭い鎴濇噺閹便劑鍩€椤掆偓閳规垿鎮欑€涙ḿ绋囧┑鈽嗗亝缁挻淇婇悽绋跨疀闁哄鐏濆畵鍡涙⒑缂佹ǘ缂氶柡浣规倐閹剝鎷呴搹鍦紳婵炶揪绲介幉鈥筹耿閻楀牅绻嗛柣鎰煐椤ュ鎽堕悙鐑樼厱鐟滃酣銆冮崨顖滅焼闁糕剝绋掗悡鏇㈡煃閳轰礁鏆堢紓鍌涘哺閺屽秷顧侀柛蹇旂〒閸掓帒鈻庨幘铏€悗骞垮劚椤︿即寮查幖浣圭叆闁绘洖鍊圭€氾拷

婵犵數濮烽弫鎼佸磻濞戞娑欐償閵娿儱鐎梺鍏肩ゴ閺呮粌鐣烽弻銉﹀€甸柨婵嗛娴滅偤鏌嶇紒妯活棃闁诡喗顨婇弫鎰償閳ュ磭顔戠紓鍌欐閼宠泛鈻嶆晶淇皊t闂傚倸鍊风欢姘缚瑜嶈灋婵°倕鎳忛弲婵嬫煥濠靛棙宸濈紒鐘虫煥椤潡鎳滈棃娑橆潓濠碘槅鍋呰摫闁靛洤瀚伴獮妯兼崉鏉炴壆鎹曠紓鍌氬€哥粔宕囨濮樿泛钃熸繛鎴欏灩閸愨偓闂侀潧臎閸愶絾瀚涘┑鐘垫暩閸嬫盯鎮ф繝鍥у偍妞ゃ儳顎怱PR缂傚倸鍊搁崐鐑芥倿閿斿墽鐭欓柟鐑橆殕閸庡孩銇勯弽顐粶闁绘帒鐏氶妵鍕箳閸℃ぞ澹曟俊鐐€х紓姘跺础閹惰棄绠栫憸鏂跨暦椤愶箑唯闁靛牆妫楁刊浼存⒒娓氣偓閳ь剛鍋涢懟顖涙櫠閺夋垟鏀介柍銉﹀墯閸ょ喖鏌嶈閸撱劎绱為崱娑樼婵ǹ娉涘Ч鏌ユ煃閸濆嫭鍣洪柛濠傜仛缁绘盯骞嬮悙鍨櫑婵犳鍠栭崯鎾蓟濞戙垹绫嶉柟鐐綑椤忥拷

闂傚倸鍊风粈渚€骞夐敓鐘偓鍐幢濡炴洖鎼オ浼村川椤撶偟浜伴梻濠庡亜濞诧妇绮欓幒妤€鍚归柛鏇ㄥ灡閻撶喖鏌熼柇锕€澧婚柛銈囧枛閺屾洟宕奸悢绋垮攭濡ょ姷鍋為悧鐘差嚕閸洖绠ｉ柣妯活問閸炲爼姊绘担鍛婂暈闁荤喆鍎辫灋婵犻潧妫ḿ鏍р攽閻樺疇澹橀幆鐔兼⒑闂堟侗妾х紒鑼帶闇夐柣鎴ｅГ閻撶喖鏌ｅΟ澶稿惈闁告柨绉堕幉鎼佸级閸喗娈婚梺璇″枔閸庣敻寮幘缁樻櫢闁跨噦鎷� - 婵犵數濮烽弫鎼佸磿閹寸姴绶ら柦妯侯槺閺嗭附銇勯幒鎴濐仼闁活厽顨婇弻娑㈠焺閸愶紕绱板銈傛櫆閻擄繝寮诲☉銏犵労闁告劖鍎冲В鈧梻浣告贡閸庛倝骞愭ィ鍐︹偓鍛存倻閽樺顔愰柡澶婄墕婢х晫绮旈悽鍛婄厱閹兼番鍨归悘銉╂煃閽樺妯€妤犵偞锕㈤、娑橆潩椤愩埄妫滃┑鐘垫暩閸嬬偤宕归崼鏇炵闁冲搫鍊婚々鍙夌節婵犲倸鏆熼柡鍡畵閺岋綁寮崶顭戜哗缂佺偓鍎抽妶鎼佸蓟濞戙垹鐒洪柛鎰靛幖椤ユ繈姊洪崨濠冣拹閻㈩垽绻濋獮鍐ㄎ旈崨顓熷祶濡炪倖鎸鹃崑妯何ｉ幇鐗堚拺缂備焦岣块埊鏇㈡煟閻旀繂娲ょ粻顖炴倵閿濆骸鏋涚紒鐘崇叀閺岀喐瀵肩€涙ɑ閿梺璇″枙缁舵艾顫忓ú顏勫窛濠电姴鍊婚鍌涚節閳封偓閸曞灚鐤侀悗娈垮枟婵炲﹪骞冮姀銈嗗亗閹艰揪缍嗛崬瑙勪繆閻愵亜鈧牠寮婚妸鈺傚€舵繝闈涚墢閻滅粯绻涢幋娆忕仾闁绘挻鐟╅幃褰掑Ω閵夘喗笑闂佺ǹ锕ら…鐑藉箖閻戣棄顫呴柕鍫濇閸樺崬鈹戦悙鍙夘棡闁挎岸鏌ｈ箛瀣姕闁靛洤瀚伴、鏇㈠閳轰礁澹庨柣搴ゎ潐濞叉粍绻涢埀顒傗偓娈垮枙缁瑩銆侀弽顓ф晝闁挎繂鎳忕拠鐐烘倵濞堝灝鏋熼柟顔煎€垮顐﹀箻缂佹ɑ娅㈤梺璺ㄥ櫐閹凤拷

濠电姷鏁搁崑鐐哄垂閸洖绠伴柟闂寸贰閺佸嫰鏌涢锝囪穿鐟滅増甯掗悙濠冦亜閹哄棗浜鹃弶鈺傜箖缁绘繈鎮介棃娴躲垽鎮楀鐓庢珝闁诡垰鏈幆鏃堝Ω閿旀儳骞橀柣搴ゎ潐濞叉牕煤閵堝棛顩锋繝濠傜墛閻撴洟鏌ｉ幇顒傛憼閻忓骏绠撻弻鐔兼寠婢跺ň鍋撴繝姘劦妞ゆ帒锕︾粔鐢告煕閹炬潙鍝烘い銏℃婵¤埖寰勭€ｎ亙鍖栭梻浣筋潐婢瑰寮插☉娆庣箚闁惧繐婀辩壕濂告煏婵炑冨枤閺嗩參姊洪悷鏉挎Щ闁瑰啿閰ｉ妶顏呭閺夋垹顦ㄩ梺闈浤涢埀顒勫磻閹惧绡€婵﹩鍘鹃崢鎼佹煟鎼搭垳绉甸柛瀣閹便劑宕奸妷锔惧幐閻庡厜鍋撻柍褜鍓熷畷鐗堟償閵娿儳鍘洪梺鍝勫暙閻楀棝宕￠幎鑺ョ厽婵☆垱瀵ч悵顏呮叏閿濆懎顏柡宀嬬稻閹棃濮€閳垛晛顫岄梻浣告啞濮婂湱鏁垾宕囨殾婵犻潧顑嗛崑鍕煟閹惧啿顔傞柕澶嗘櫆閻撱儵鏌ｉ弴鐐测偓鍦偓姘炬嫹