arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2604.19765 2026-04-23 cs.CL cs.AI 62%

Do Hallucination Neurons Generalize? Evidence from Cross-Domain Transfer in LLMs

幻觉神经元能否泛化?来自LLMs跨领域迁移的证据

Snehit Vaddi, Pujith Vaddi

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了LLMs中幻觉神经元在不同知识领域间的泛化能力,发现其在跨领域迁移时性能显著下降,表明幻觉机制具有领域特异性。

Comments 18 pages, 5 models, 6 domains, ACL format. Includes causal intervention analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19754 2026-04-23 cs.AI cs.LG 62%

Exploring Data Augmentation and Resampling Strategies for Transformer-Based Models to Address Class Imbalance in AI Scoring of Scientific Explanations in NGSS Classroom

探索数据增强和重采样策略以解决基于Transformer模型的AI评分中科学解释类不平衡问题

Prudence Djagba, Kevin Haudek, Clare G. C. Franovic, Leonora Kaldaras

机构 * Michigan State University(密歇根州立大学) CREATE for STEM(STEM创新计划) University of Houston(休斯顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了通过数据增强策略提升Transformer模型对科学解释评分的性能,发现GPT生成数据和ALP方法在处理严重类别不平衡时效果显著,优于传统过采样方法。

Comments Published as a conference paper at NARST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08570 2026-04-23 cs.LG cs.AI cs.PL cs.SE quant-ph 62%

QuanBench+: A Unified Multi-Framework Benchmark for LLM-Based Quantum Code Generation

QuanBench+: 一种统一的多框架基准用于基于LLM的量子代码生成

Ali Slim, Haydar Hamieh, Jawad Kotaich, Yehya Ghosn, Mahdi Chehimi, Ammar Mohanna, Hasan Abed Al Kader Hammoud, Bernard Ghanem

机构 * American University of Beirut(贝鲁特美国大学) King Abdullah University of Science and Technology(卡迪夫国王大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuanBench+基准,用于评估LLM在量子代码生成中的多框架性能,通过执行测试和反馈修复机制,展示了不同框架下的代码生成效果及改进。

Comments 24 pages total, 25 figures, 5 tables, including supplementary material. Accepted to the ICLR 2026 Workshop on I Can't Believe It's Not Better

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02368 2026-04-22 cs.AI cs.CL 62%

Xpertbench: Expert Level Tasks with Rubrics-Based Evaluation

Xpertbench:基于评分标准的专家级任务

Xue Liu, Xin Ma, Yuxin Ma, Yongchang Peng, Duo Wang, Zhoufutu Wen, Ge Zhang, Kaiyuan Zhang, Xinyu Chen, Yida Ding, Tianci He, Jiani Hou, Liang Hu, Ziyun Huang, Yongzhe Hui, Jianpeng Jiao, Chennan Ju, Yingru Kong, Yiran Li, Jiashuo Liu, Mengyun Liu, Luyao Ma, Fei Ni, Yiqing Ni, Pengbo Niu, Yueyan Qiu, Yanle Ren, Xinyu Shen, Zilin Shi, Zaiyuan Wang, Wenjie Yue, Chun Zhang, Shiyu Zhang, Xinyi Zhang, Kaiwen Zhao, Zhenwei Zhu, Shanshan Wu, Qi Zhao, Wenhao Huang

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 XpertBench通过精心设计的高保真任务评估LLM在专业领域的能力,揭示了当前AI系统在专家级任务上的性能瓶颈,展示了模型在不同领域中的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21080 2026-04-22 cs.CL cs.AI cs.CY 62%

InsideOut: Measuring and Mitigating Insider-Outsider Bias in Interview Script Generation

InsideOut: 评估和缓解面试脚本生成中的内部-外部偏见

Yixin Wan, Xingrun Chen, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出InsideOut基准,通过文化情境面试脚本生成任务量化LLM的内部-外部偏见,采用三种评估指标,并提出基于代理的MFA框架缓解偏见,实验表明MFA方法显著降低偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18381 2026-04-21 cs.AI cs.LG 62%

Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

在数据较少的情况下:评估RLVR在低数据和计算环境下的有效性

Justin Bauer, Thomas Walshe, Derek Pham, Harit Vishwakarma, Armin Parchami, Frederic Sala, Paroma Varma

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在低数据和计算资源下,RLVR对小型语言模型性能的影响,发现混合复杂度数据集能显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04815 2026-04-21 cs.CL cs.AI 62%

LiveFact: A Dynamic, Time-Aware Benchmark for LLM-Driven Fake News Detection

LiveFact:一种动态、时间感知的LLM驱动虚假新闻检测基准

Cheng Xu, Changhong Jin, Yingjie Niu, Nan Yan, Yuke Mei, Shuhao Guan, Liming Chen, M-Tahar Kechadi

机构 * University College Dublin(都柏林大学) Georgia Institute of Technology(佐治亚理工学院) Dalian University of Technology(大连理工大学) Bebxy(贝比)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 LiveFact引入动态时间感知基准,评估模型在处理演进不完整信息时的推理能力,发现传统静态基准无法检测的推理差距。

Comments ACL 2026 Main; Homepage at https://livefact.bebxy.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17707 2026-04-21 cs.CL cs.AI 62%

Before You Interpret the Profile: Validity Scaling for LLM Metacognitive Self-Report

在解释轮廓之前:大型语言模型元认知自我报告的有效性缩放

Jon-Paul Cacioli

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过有效性缩放框架评估大型语言模型的元认知自我报告,识别出四款模型构造无效,两款模型存在异常,研究揭示了有效性指标与模型性能的关系。

Comments 14 pages, 6 figures. Companion to arXiv:2604.15702

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17585 2026-04-21 cs.CV cs.AI cs.LG 62%

DGSSM: Diffusion guided state-space models for multimodal salient object detection

DGSSM:基于扩散引导的状态空间模型的多模态显著目标检测

Suklav Ghosh, Arijit Sur, Pinaki Mitra

机构 * Dept. of Computer Science and Engineering, Indian Institute of Technology, Guwahati(计算机科学与工程系,印度理工学院,果阿提)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出DGSSM,一种结合扩散模型结构先验和多尺度状态空间编码的多模态显著目标检测框架,通过迭代Mamba扩散细化机制提升边界精度,实验表明其在多个评估指标上优于现有方法。

Comments Accepted at ICPR 2026. Diffusion-guided Mamba framework for multimodal salient object detection. Evaluated on 13 benchmarks (RGB, RGB-D, RGB-T)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17366 2026-04-21 cs.CL cs.AI 62%

ArgBench: Benchmarking LLMs on Computational Argumentation Tasks

ArgBench:对计算论证任务的LLM基准测试

Yamen Ajjour, Carlotta Quensel, Nedim Lipka, Henning Wachsmuth

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学) Adobe Research(Adobe研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ArgBench,首个用于评估LLM在计算论证任务中性能的基准,涵盖33个数据集,评估五种LLM家族在46种任务中的泛化能力,分析少样本示例、推理步骤、模型大小和训练技能对性能的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15815 2026-04-21 cs.CL cs.AI cs.HC 62%

User-Assistant Bias in LLMs

大语言模型中的用户-助手偏见

Xu Pan, Jingxuan Fan, Zidi Xiong, Ely Hahami, Jorin Overwiening, Ziqian Xie

机构 * Harvard University(哈佛大学) University of Texas Health Science Center at Houston(德克萨斯大学健康科学中心休斯顿分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型中因角色标签训练数据不一致导致的用户-助手偏见,通过UserAssist基准测试发现指令微调模型存在强用户偏见,而基础和推理模型接近中性,揭示了角色标签训练的潜在影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17139 2026-04-21 cs.CL cs.AI cs.MA 62%

The Consensus Trap: Rescuing Multi-Agent LLMs from Adversarial Majorities via Token-Level Collaboration

共识陷阱:通过令牌级协作拯救多智能体大语言模型免受对抗性多数的侵害

Jiayuan Liu, Shiyi Du, Weihua Du, Mingyu Guo, Vincent Conitzer

机构 * Carnegie Mellon University(卡内基梅隆大学) Foundations of Cooperative AI Lab (FOCAL)(协作人工智能基础实验室(FOCAL)) Adelaide University(阿德莱德大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出令牌级轮询协作方法,通过共享自回归上下文中的序列生成,解决多智能体系统中对抗性多数导致的响应级聚合失效问题,证明其在多种推理基准上具有鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16995 2026-04-21 cs.CL cs.LG 62%

SPS: Steering Probability Squeezing for Better Exploration in Reinforcement Learning for Large Language Models

SPS:通过引导概率压缩在大型语言模型强化学习中的更好探索

Yifu Huo, Chenglong Wang, Ziming Zhu, Shunjie Xing, Peinan Feng, Tongran Liu, Qiaozhi He, Tianhua Zhou, Xiaojia Chang, Jingbo Zhu, Zhengtao Yu, Tong Xiao

机构 * Northeastern University(东北大学) CAS Key Laboratory of Behavioral Science(中国科学院行为科学重点实验室) Independent Researcher(独立研究员) Kunming University of Science and Technology(昆明理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出SPS方法,结合传统强化学习与逆强化学习,通过引导轨迹分布提升探索能力,改进多样本性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16980 2026-04-21 cs.LG cs.AI 62%

Evaluating Multimodal LLMs for Inpatient Diagnosis: Real-World Performance, Safety, and Cost Across Ten Frontier Models

评估多模态大语言模型在住院诊断中的表现:在十个前沿模型上的真实世界性能、安全性和成本

Bruce A. Bassett, Amy Rouillard, Sitwala Mundia, Michael Cameron Gramanie, Linda Camara, Ziyaad Dangor, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Ismail Kalla, Haroon Saloojee

机构 * School of Computer Science and Applied Mathematics, University of the Witwatersrand(沃斯兰大学计算机科学与应用数学学院) Wits MIND Institute, University of the Witwatersrand(沃斯兰大学Wits MIND研究所) Grai Labs, Cape Town, South Africa(南非开普敦Grai实验室) Faculty of Health Sciences, University of the Witwatersrand(沃斯兰大学健康科学学院) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand(南非医学研究委员会疫苗与传染病分析研究单位,沃斯兰大学健康科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文评估了十个前沿多模态大语言模型在住院诊断中的真实世界性能,发现尽管成本差异大,模型表现紧密聚集,且在安全性和诊断准确性上均优于常规护理。

Comments 17 pages, 11 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16392 2026-04-21 cs.CY cs.AI cs.CL 62%

RoMathExam: A Longitudinal Dataset of Romanian Math Exams (1895-2025) with a Seven-Decade Core (1957-2025)

RoMathExam:一份涵盖罗马尼亚数学考试的纵向数据集(1895-2025)及一个七十年核心(1957-2025)

Luca-Ncolae Cuclea, Sabin-Codrut Badea, Adrian-Marius Dumitran

机构 * University of Bucharest, Faculty of Mathematics and Computer Science(布加勒斯特大学数学与计算机科学学院) Cu Drag si Sport SRL(Cu Drag si Sport公司) Softbinator Technologies(Softbinator技术公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 RoMathExam 数据集包含10592个数学问题,覆盖1895-2025年的罗马尼亚高中数学考试,提供标准化核心和课程对齐标签,用于评估和研究。

Comments AIED 2026, 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16372 2026-04-21 cs.CL cs.AI 62%

CFMS: Towards Explainable and Fine-Grained Chinese Multimodal Sarcasm Detection Benchmark

CFMS:迈向可解释且细粒度的中文多模态讽刺检测基准

Junzhao Zhang, Hsiu-Yuan Huang, Chenming Tang, Yutong Yang, Yunfang Wu

机构 * National Key Laboratory for Multimedia Information Processing(多媒体信息处理国家重点实验室) Peking University School of Computer Science(北京大学计算机科学学院) Peking University School of Software and Microelectronics(北京大学软件与微电子学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CFMS,首个针对中文社交媒体的细粒度多模态讽刺检测数据集,包含2796对高质量图像-文本对,提供三层次标注框架,并提出PGDS方法在关键任务中优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16320 2026-04-21 cs.SE cs.AI cs.LG 62%

How Robustly do LLMs Understand Execution Semantics?

大语言模型如何理解执行语义的鲁棒性?

Claudio Spiess, Prem Devanbu, Earl T. Barr

机构 * University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究通过代码输出预测任务评估大语言模型对代码理解的鲁棒性,发现开源模型在代码变换和输入扰动下表现稳定,而前沿模型GPT-5.2表现出显著的脆弱性,且异常处理能力不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16213 2026-04-21 cs.CV cs.AI cs.CL 62%

M4CXR: Exploring Multi-task Potentials of Multi-modal Large Language Models for Chest X-ray Interpretation

M4CXR:探索多任务潜力的多模态大语言模型在胸部X光解读中的应用

Jonggwon Park, Soobum Kim, Byungmu Yoon, Jihun Hyun, Kyoyun Choi

机构 * DEEPNOID Inc.(DEEPNOID公司)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出M4CXR,一种多模态大语言模型,通过链式推理策略提升胸部X光报告生成的临床准确性,并在视觉问答和视觉 grounding 任务中表现出色。

Journal ref IEEE Transactions on Neural Networks and Learning Systems, vol. 36, no. 10, pp. 17841-17855, Oct. 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16241 2026-04-20 cs.CL cs.AI 62%

BAGEL: Benchmarking Animal Knowledge Expertise in Language Models

BAGEL:语言模型中动物知识专精的基准测试

Jiacheng Shen, Masato Hagiwara, Milad Alizadeh, Ellen Gilsenan-McMahon, Marius Miron, David Robinson, Emmanuel Chemla, Sara Keen, Gagan Narula, Mathieu Laurière, Matthieu Geist, Olivier Pietquin

机构 * Earth Species Project(地球物种项目) NYU Center for Data Science(纽约大学数据科学中心;纽约大学上海) NYU Shanghai(纽约大学上海数据科学中心;纽约大学-复旦大学数学科学研究所) NYU Shanghai Center for Data Science NYU-ECNU Institute of Mathematical Sciences at NYU Shanghai

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 BAGEL基准测试评估语言模型在动物知识方面的专精能力,结合多个来源生成封闭式问题对,涵盖分类学、形态学、栖息地等多个方面,旨在提升语言模型在生物多样性应用中的可靠性。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15859 2026-04-20 cs.LG cs.AI 62%

QuantSightBench: Evaluating LLM Quantitative Forecasting with Prediction Intervals

QuantSightBench:评估LLM定量预测的预测区间

Jeremy Qin, Maksym Andriushchenko

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出QuantSightBench基准,评估LLM在连续量数值预测中的表现,发现现有模型在90%覆盖率目标上普遍不足,且置信度校准随极端值恶化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15607 2026-04-20 cs.CL cs.AI cs.CY cs.HC 62%

Imperfectly Cooperative Human-AI Interactions: Comparing the Impacts of Human and AI Attributes in Simulated and User Studies

不完全合作的人机交互:在模拟和用户研究中比较人类和AI属性的影响

Myke C. Cohen, Mingqian Zheng, Neel Bhandari, Hsien-Te Kao, Xuhui Zhou, Daniel Nguyen, Laura Cassani, Maarten Sap, Svitlana Volkova

机构 * Aptima, Inc.(Aptima公司) Arizona State University(亚利桑那州立大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 研究通过模拟和用户实验比较人类和AI属性在不完全合作场景中的影响,发现AI属性,尤其是透明度,在真实用户研究中更具影响力。

Comments Will be presented at ACL 2026 and published in the Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15411 2026-04-20 cs.LG cs.AI physics.data-an 62%

PRL-Bench: A Comprehensive Benchmark Evaluating LLMs' Capabilities in Frontier Physics Research

PRL-Bench: 一个全面的基准,评估大语言模型在前沿物理研究中的能力

Tingjia Miao, Wenkai Jin, Muhua Zhang, Jinxin Tan, Yuelin Hu, Tu Guo, Jiejun Zhang, Yuhan Wang, Wenbo Li, Yinuo Gao, Shuo Chen, Weiqi Jiang, Yayun Hu, Zixing Lei, Xianghe Pang, Zexi Liu, Yuzhi Zhang, Linfeng Zhang, Kun Chen, Wei Wang, Weinan E, Siheng Chen

机构 * School of Artificial Intelligence(人工智能学院) Zhiyuan College(智远学院) School of Physics and Astronomy(物理天文学院) Tsung-Dao Lee Institute(李政道研究所) State Key Laboratory of Dark Matter Physics(暗物质物理国家重点实验室) Shanghai Innovation Institute(上海创新研究院) Institute of Theoretical Physics(理论物理研究所) Chinese Academy of Sciences(中国科学院) Zhejiang Lab(浙江实验室) SciLand DP Technology(DP技术)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 PRL-Bench通过理论和计算物理的科研导向评估,系统测试大语言模型执行端到端物理研究的能力,揭示当前LLM在真实科研需求中的不足。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15309 2026-04-17 cs.CV cs.AI cs.CL 62%

MM-WebAgent: A Hierarchical Multimodal Web Agent for Webpage Generation

MM-WebAgent:一种用于网页生成的分层多模态网络代理

Yan Li, Zezi Zeng, Yifan Yang, Yuqing Yang, Ning Liao, Weiwei Guo, Lili Qiu, Mingxi Cheng, Qi Dai, Zhendong Wang, Zhengyuan Yang, Xue Yang, Ji Li, Lijuan Wang, Chong Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Xi'an Jiaotong University(西安交通大学) Tongji University(同济大学) Microsoft Corporation(微软公司)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MM-WebAgent,一种分层多模态网页生成框架,通过分层规划和迭代自反思协调AIGC元素生成,提升网页全局布局与视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14922 2026-04-17 cs.LG cs.CL 62%

LongAct: Harnessing Intrinsic Activation Patterns for Long-Context Reinforcement Learning

LongAct:利用内在激活模式促进长上下文强化学习

Bowen Ping, Zijun Chen, Tingfeng Hui, Qize Yu, Chenxuan Li, Junchi Yan, Baobao Chang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出LongAct方法,通过利用长上下文推理中的稀疏结构,改进大语言模型的训练,提升长上下文处理能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14199 2026-04-17 q-fin.CP cs.AI cs.LG 62%

PolyBench: Benchmarking LLM Forecasting and Trading Capabilities on Live Prediction Market Data

PolyBench:基于实时预测市场数据的LLM预测与交易能力基准测试

Pu Cheng, Juncheng Liu, Yunshen Long

机构 * College of Electrical Engineering, Sichuan University(四川大学电气工程学院) School of Economics, Sichuan University(四川大学经济学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PolyBench基准测试,通过实时预测市场数据评估七种先进LLM的预测与交易能力,发现仅两种模型在严格市场状态下实现正收益,揭示了语言流畅性与真实概率推理之间的差距。

Comments 16 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14158 2026-04-17 cs.CL cs.AI 62%

MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios

MemGround:用于大型语言模型在游戏化场景中的长期记忆评估套件

Yihang Ding, Wanke Xia, Yiting Zhao, Jinbo Su, Jialiang Yang, Zhengbo Zhang, Ke Wang, Wenming Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) CASIA

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MemGround通过游戏化交互场景评估LLM的长期记忆能力,提出三级框架和多维指标,揭示先进模型在动态跟踪和复杂推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15946 2026-04-17 cs.LG cs.AI cs.CR 62%

Fall into a Pit, Gain in a Wit: Cognitive-Guided Harmful Meme Detection via Misjudgment Risk Pattern Retrieval

跌入陷阱,获得智慧:通过误判风险模式检索的认知引导有害迷因检测

Wenshuo Wang, Ziyou Jiang, Junjie Wang, Mingyang Li, Jie Huang, Yuekai Huang, Zhiyuan Chang, Feiyan Duan, Qing Wang

机构 * State Key Laboratory of Complex System Modeling and Simulation Technology(复杂系统建模与仿真技术国家重点实验室) Science and Technology on Integrated Information System Laboratory(集成信息系统技术研究所) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出PatMD方法,通过学习并主动缓解潜在误判风险,识别有害迷因的深层误判风险模式,提升多模态大语言模型的检测能力,实验显示在5项有害检测任务中,F1-score和准确率均显著提升。

Comments 14 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05015 2026-04-17 cs.LG cs.AI 62%

SPaCe: Unlocking Sample-Efficient Large Language Models Training With Self-Pace Curriculum Learning

SPaCe:通过自适应课程学习解锁高效大语言模型训练

Dai Do, Manh Nguyen, Svetha Venkatesh, Hung Le

机构 * Deakin Applied AI Initiative, Deakin University, Australia(德金应用人工智能倡议,德金大学,澳大利亚)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 SPaCe通过自适应课程学习框架,优化数据选择与训练时机,提升大语言模型的训练效率,实验表明其在多个推理基准上性能优于现有方法,样本使用减少达100倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14016 2026-04-16 cs.LG cs.AI 62%

MAny: Merge Anything for Multimodal Continual Instruction Tuning

MAny:为多模态连续指令微调合并任何内容

Zijian Gao, Wangwang Jia, Xingxing Zhang, Pengfei Qian, Tao Sun, Bo Ding, Yong Dou, Huaimin Wang, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology(国防科技大学并行与分布式计算国家重点实验室) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Tsinghua University(清华大学计算机科学与技术系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对多模态连续指令微调中感知漂移和推理崩溃问题,提出MAny框架,通过跨模态投影合并和低秩参数合并实现任务知识融合,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13666 2026-04-16 cs.CY cs.AI cs.LG 62%

Automatically Inferring Teachers' Geometric Content Knowledge: A Skills Based Approach

自动推断教师的几何内容知识:基于技能的方法

Ziv Fenigstein, Kobi Gal, Avi Segal, Osama Swidan, Inbal Israel, Hassan Ayoob

机构 * Ben-Gurion University, Israel(本古里安大学,以色列) University of Edinburgh, U.K.(爱丁堡大学,英国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于技能的自动化方法,利用大语言模型对教师的Van Hiele几何推理水平进行分类,通过整合显式技能信息提升分类准确率,为大规模评估教师几何知识提供理论支持。

Comments The work is accepted for publication as a full paper (Main Track) at the 27th International Conference on Artificial Intelligence in Education (AIED 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏