arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-12 至 2026-05-12 共收录 384 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 102 篇

2605.09618 2026-05-12 cs.CL cs.CY 74%

Statistical Scouting Finds Debate-Safe but Not Debate-Useful Cases: A Matched-Ceiling Study of Open-Weight LLM Reasoning Protocols

统计 scouting 找到辩论安全但不实用的案例:开放权重 LLM 推理协议的匹配天花板研究

Julia Hu, Alfred Shen, Kumar Lakshmipathi

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 推理评测 :reasoning(title);分类 cs.CL

AI总结 研究探讨在生成 token 数限制下,不同推理协议的路由头寸及恢复潜力,发现辩论安全性和实用性不一致,需更复杂的信号来优化。

Comments 14 pages, 5 figures. Technical report / preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08815 2026-05-12 cs.LG q-bio.BM q-bio.GN q-bio.QM 74%

MicroFuse: Protein-to-Genome Expert Fusion for Microbial Operon Reasoning

MicroFuse:用于微生物启动子推理的蛋白质到基因组专家融合

Seungik Cho

机构 * Department of Physics and Astronomy, Rice University, Texas, USA(物理与天文学系,里士满大学,德克萨斯州,美国)

专题命中 推理评测 :reasoning(title);分类 cs.LG

AI总结 本文提出MicroFuse框架,通过融合蛋白质结构表示和基因组上下文表示,提升微生物启动子预测的准确性。在OG-Operon100K数据集上,MicroFuse在多个评估指标上表现最优,尤其在生物上模糊的情况中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18256 2026-05-12 cs.LG cs.AI 73%

MolRGen: A Training and Evaluation Setting for De Novo Molecular Generation with Reasonning Models

MolRGen:一种用于从头分子生成的训练和评估设置

Philippe Formont, Maxime Darrin, Ismail Ben Ayed, Pablo Piantanida

机构 * Université Paris-Saclay(巴黎萨克雷大学) ÉTS Montréal(蒙特利尔ÉTS) ILLS – International Laboratory on Learning Systems(学习系统国际实验室) Mila – Quebec AI Institute(魁北克人工智能研究所) Mistral AI LIVIA CNRS, CentraleSupélec(国家科学研究中心,中央超导大学)

专题命中 推理评测 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MolRGen,一种用于训练和评估基于推理的分子生成模型的基准测试平台,通过多目标优化提示结合结合亲和力评分和分子性质,评估从头生成的分子,并引入多样性感知的top-k指标和GRPO算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23511 2026-05-12 eess.AS cs.AI cs.CL cs.SD 73%

MECAT: A Multi-Experts Constructed Benchmark for Fine-Grained Audio Understanding Tasks

MECAT:一个多专家构建的细粒度音频理解任务基准

Yadong Niu, Tianzi Wang, Heinrich Dinkel, Xingwei Sun, Jiahao Zhou, Gang Li, Jizhong Liu, Xunying Liu, Junbo Zhang, Jian Luan

机构 * The Chinese University of Hong Kong, Hong Kong, China(香港中文大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MECAT基准,通过集成专家模型分析与推理模型,提供细粒度音频描述和开放问题对,结合新指标DATE评估模型性能,评估现有音频模型的能力与局限。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08965 2026-05-12 cs.CV 71%

Can MLLMs Reason About Visual Persuasion? Evaluating the Efficacy and Faithfulness of Reasoning

大语言模型能否进行视觉说服推理?评估推理的有效性与忠实性

Naeun Lee, Hyunjong Kim, Sunghwan Choi, Injin Kong, Yohan Jo

机构 * Seoul National University(首尔国立大学)

专题命中 推理评测 :reasoning(title)

AI总结 本文研究大语言模型在视觉说服推理中的有效性与忠实性,提出通过多样化的教师生成推理进行监督微调以提升预测性能,并引入三维忠实性评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10831 2026-05-12 cs.LG cs.AI cs.CE cs.CL 67%

SLIM: Sparse Latent Steering for Interpretable and Property-Directed LLM-Based Molecular Editing

SLIM:稀疏潜在引导用于可解释和属性导向的基于大语言模型的分子编辑

Mingxu Zhang, Yuhan Li, Lujundong Li, Dazhong Shen, Hui Xiong, Ying Sun

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) The 63rd Research Institute, National University of Defense Technology, Nanjing(国防科技大学第六三研究所,南京)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SLIM通过稀疏潜在特征空间提升分子编辑效果,实现属性导向的可解释编辑,实验显示在多个分子属性上提升达42.4个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10530 2026-05-12 cs.IR 67%

Personalized Deep Research: A User-Centric Framework, Dataset, and Hybrid Evaluation for Knowledge Discovery

个性化深度研究:以用户为中心的框架、数据集和混合评估方法用于知识发现

Xiaopeng Li, Wenlin Zhang, Yingyi Zhang, Pengyue Jia, Yejing Wang, Yichao Wang, Yong Liu, Huifeng Guo, Xiangyu Zhao

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出PDR框架,结合用户上下文动态调整检索深度和广度,通过混合评估方法提升检索效用和报告相关性,验证了个性化知识获取的可行性。

Comments Accepted to SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10034 2026-05-12 cs.RO 67%

Beyond Self-Play and Scale: A Behavior Benchmark for Generalization in Autonomous Driving

超越自我博弈与规模:面向自动驾驶泛化的行为基准

Aron Distelzweig, Faris Janjoš, Andreas Look, Anna Rothenhäusler, Daniel Jost, Oliver Scheel, Raghu Rajan, Daphne Cornelisse, Eugene Vinitsky, Joschka Boedecker

机构 * University of Freiburg(弗赖堡大学) Bosch Center for Artificial Intelligence(博世人工智能中心) Coburg University of Applied Sciences(科堡应用科学大学) New York University(纽约大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出BehaviorBench,通过评估、复杂性和行为多样性三个维度,解决自动驾驶大规模强化学习政策在标准化评估中的性能问题,并提出混合规划器提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09844 2026-05-12 cs.AI cs.CL cs.LG 67%

The Metacognitive Probe: Five Behavioural Calibration Diagnostics for LLMs

元认知探测:用于大语言模型的五种行为校准诊断

Rafael C. T. Oliveira

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出元认知探测工具,通过五个维度评估大语言模型的自信行为,揭示模型在特定领域的过度自信问题,展示了Gemini 2.5 Flash在不同任务中的显著差异。

Comments 27 pages, 13 tables. Code, data, prompts, and rubrics released with the paper. OSF deposit pending; DOI in v2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09665 2026-05-12 cs.LG cs.AI cs.CL 67%

Learning Multi-Indicator Weights for Data Selection: A Joint Task-Model Adaptation Framework with Efficient Proxies

学习多指标权重用于数据选择:一种联合任务-模型适应框架与高效代理

Jingze Song, Zihao Chen, Wenqing Chen, Zibin Zheng

机构 * School of Software Engineering, Sun Yat-sen University(中山大学软件学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种联合任务-模型适应框架,通过在紧凑的tiny-validation集上利用上下文学习信号,无需全量微调即可学习多指标权重,提升数据选择效率和性能。

Comments This work has been accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08703 2026-05-12 cs.AI cs.CL cs.CV cs.LG 67%

RewardHarness: Self-Evolving Agentic Post-Training

RewardHarness: 自我进化代理的后训练

Yuxuan Zhang, Penghui Du, Bo Li, Cong Wei, Junwen Miao, Huaisong Zhang, Songcheng Cai, Yubo Wang, Dongfu Jiang, Yuyu Zhang, Ping Nie, Wenhu Chen, Changqian Yu, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Kolors Team, Kuaishou Technology(快手团队) Carnegie Mellon University(卡内基梅隆大学) University of Waterloo(滑铁卢大学) Etude AI Tsinghua University(清华大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RewardHarness通过自我进化代理框架,利用少量人类偏好示例迭代优化工具库,实现高效图像编辑评估,准确率达47.4%,超越GPT-5 5.3个百分点。

Comments Project page: https://rewardharness.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08647 2026-05-12 cs.CL cs.AI cs.LG 67%

AgentCollabBench: Diagnosing When Good Agents Make Bad Collaborators

AgentCollabBench: 评估好代理为何会成为差合作者

Aritra Mazumder, Shubhashis Roy Dipta, Nusrat Jahan Lia, Tanzila Khan, Kainat Raisa Hossain, Nehaa Shri, Shubhrangshu Debsarkar, Humayra Tasnim, Gour Gupal Talukder Shawon, Debjoty Mitra, Sumaiya Ahmed Rani, Al Jami Islam Anik, Al Nafeu Khan

机构 * University of Utah(犹他大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校) University of Dhaka(达卡大学) Vellore Institute of Technology(韦洛雷理工学院) University of Virginia(弗吉尼亚大学) Rajshahi University of Engineering and Technology(拉贾加赫尔工程与技术大学) Shahjalal University of Science and Technology(沙赫jalal科学与技术大学) BRAC University(BRAC大学) Islamic University of Technology(伊斯兰技术大学) Comilla University(科摩拉大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出AgentCollabBench,通过900个经人类验证的任务评估多代理系统中四个行为风险:指令衰减、虚假信念传播、上下文泄露和追踪耐久性,揭示模型在多跳信息生存中的结构问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10889 2026-05-12 cs.LG cs.AI 62%

Unmasking On-Policy Distillation: Where It Helps, Where It Hurts, and Why

揭示在线策略蒸馏:它何时有益,何时有害,以及原因

Mohammadreza Armandpour, Fatih Ilhan, David Harrison, Ajay Jaiswal, Duc N. M Hoang, Fartash Faghri, Yizhe Zhang, Minsik Cho, Mehrdad Farajtabar

机构 * Apple(苹果公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨在线策略蒸馏在不同场景下的有效性,提出基于梯度对齐度的诊断方法,发现蒸馏信号在学生表现不佳时更有效,且最优上下文依赖学生模型能力和任务需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10186 2026-05-12 cs.CL cs.AI 62%

LegalCiteBench: Evaluating Citation Reliability in Legal Language Models

LegalCiteBench: 评估法律语言模型中的引文可靠性

Sijia Chen, Hang Yin, Shunfan Zhou

机构 * Northeastern University(东北大学) Phala

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LegalCiteBench,用于评估法律语言模型在闭书环境下引文恢复、验证和案例匹配的能力,发现即使最强模型在引文检索和完成任务上得分低于7/100,且多数模型存在误导性引文问题。

Comments Preprint. 23 pages including references and appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10171 2026-05-12 cs.CL cs.AI 62%

When Reviews Disagree: Fine-Grained Contradiction Analysis in Scientific Peer Reviews

当评论存在分歧时:科学同行评审中的细粒度矛盾分析

Sandeep Kumar, Yash Kamdar, Abid Hossain, Bharti Kumari, Tanik Saikh, Asif Ekbal

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Computer Engineering, KIIT Deemed to be University, Bhubaneswar, India(比哈尔邦布尔萨大学计算机工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出细粒度的同行评审矛盾分析方法,通过识别矛盾证据跨度并分配矛盾强度评分,改进了现有二元矛盾检测方法,引入RevCI基准和IMPACT框架,并通过TIDE模型实现高效部署。

Comments accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08031 2026-05-12 cs.SD cs.AI cs.LG eess.AS 62%

AU-Harness: An Open-Source Toolkit for Holistic Evaluation of Audio LLMs

AU-Harness:音频大语言模型的开放式工具包

Hoang Nguyen, Sidharth Surapaneni, Akshay Kalkunte, Jash Mehta, Aman Tiwari, Oluwanifemi Bamgbose, Khyati Mahajan, Jash Shah, Shruthan Radhakrishna, Sathwik Tejaswi Madhusudhan, Vikas Yadav, Sai Rajeswar

机构 * ServiceNow University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 AU-Harness通过优化处理流程和并行执行,实现151%的速度提升,提供标准化提示协议和灵活配置,促进音频大语言模型的系统性发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10027 2026-05-12 cs.CL cs.AI 62%

Speech-based Psychological Crisis Assessment using LLMs

基于语音的心理危机评估使用大语言模型

Terumi Chiba, Yang Luo, Ziyun Cui, Yongsheng Tong, Chao Zhang

机构 * Tsinghua University(清华大学) Peking University Huilongguan Clinical Medical School(北京大学回龙guan临床医学院) WHO Collaborating Centre for Research and Training in Suicide Prevention(世界卫生组织自杀预防研究与培训协作中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大语言模型自动分类危机等级,通过引入语音学注入方法和增强推理训练策略,提升热线服务质量。

Comments 5 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09918 2026-05-12 cs.LG cs.AI cs.CY 62%

NaiAD: Initiate Data-Driven Research for LLM Advertising

NaiAD:启动基于数据的研究以进行大语言模型广告

Yihang Zhang, Zimeng Huang, Ren Zhai, Yipeng Kang, Tonghan Wang

机构 * Tsinghua University(清华大学) College of AI(人工智能学院) Department of Literature, Arts and Communication(文学、艺术与传播系) Anhui International Studies University(安徽国际关系大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出NaiAD数据集,用于研究大语言模型广告,包含58999个精心构建的广告嵌入响应与用户查询,通过理论指导的评估指标提升用户体验和商业价值。

Comments 37 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09852 2026-05-12 cs.AI cs.CE cs.CY cs.LG 62%

Fairness of Explanations in Artificial Intelligence (AI): A Unifying Framework, Axioms, and Future Direction toward Responsible AI

人工智能中解释的公平性:统一框架、公理与迈向负责任人工智能的未来方向

Gideon Popoola, John Sheppard

机构 * Montana State University(蒙大拿州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了人工智能中解释公平性的问题,提出统一框架和公理,指出解释过程中的程序性偏见,并提出评估流程以实现公平性审计。

Comments 53 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09661 2026-05-12 cs.CL cs.AI 62%

MedMeta: A Benchmark for LLMs in Synthesizing Meta-Analysis Conclusion from Medical Studies

MedMeta:用于从医学研究中合成元分析结论的LLM基准测试

Huy Hoang Ha, Benoit Favre, Francois Portet

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedMeta基准测试,评估LLM从医学元分析摘要中生成结论的能力,发现检索增强生成方法显著优于纯参数方法,揭示当前RAG系统在识别否定证据方面的缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09348 2026-05-12 cs.CL cs.AI cs.DB cs.MM 62%

HOME-KGQA: A Benchmark Dataset for Multimodal Knowledge Graph Question Answering on Household Daily Activities

HOME-KGQA:一个多模态知识图谱问答基准数据集用于家庭日常活动

Shusaku Egami, Aoi Ohta, Tomoki Tsujimura, Masaki Asada, Tatsuya Ishigaki, Ken Fukuda, Masahiro Hamasaki, Hiroya Takamura

机构 * National Institute of Advanced Industrial Science(国家工业科学与技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出HOME-KGQA基准数据集,用于多模态知识图谱问答,包含多跳自然语言问题和图数据库查询语言,挑战多级时空推理和多模态 grounding。实验表明基于LLM的KGQA方法在该数据集上表现不佳,凸显实际部署中KGQA系统的挑战。

Comments 12 pages, 4 figures, 7 tables, accepted at LREC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09330 2026-05-12 cs.LG cs.AI 62%

The Trap of Trajectory: Towards Understanding and Mitigating Spurious Correlations in Agentic Memory

轨迹的陷阱:朝着理解并缓解代理记忆中的虚假相关性

Luoxi Tang, Rupali Rajendra Vaje, Yuqiao Meng, Sakshi Sunil Narkar, Weicheng Ma, Zeyu Ding, Dazheng Zhang, Zhaohan Xi

机构 * Binghamton University, State University of New York(宾夕法尼亚州立大学) Oakland University(奥克兰大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文研究代理记忆中的虚假相关性问题,通过基准测试揭示记忆在清洁输入下提升推理但放大虚假模式依赖性,并提出CAMEL方法在写入和检索时减少对虚假模式的依赖,同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09272 2026-05-12 cs.AI cs.CL cs.CV 62%

Towards Conversational Medical AI with Eyes, Ears and a Voice

面向有眼睛、耳朵和声音的对话式医疗AI

Meet Shah, Jason Gusdorf, Anil Palepu, Chunjong Park, Jack W. O'Sullivan, Vishnu Ravi, Tim Strother, Pavel Dubov, Aliya Rysbek, Toshiyuki Fukuzawa, Yana Lunts, Jan Freyberg, Michael B. Chang, Aniruddh Raghu, David Stutz, Devora Berlowitz, Eliseo Papa, Taylan Cemgil, JD Velasquez, Jack Chen, Arthur Chen, Doug Fritz, Charlie Taylor, Katya Tregubova, Jing Rong Lim, Richard Green, Sara Mahdavi, Mahvish Nagda, Jihyeon Lee, Craig Schiff, Liviu Panait, Sukhdeep Singh, Valentin Liévin, David G. T. Barrett, Hannah Gladman, Anna Cupani, Francesca Pietra, Uchechi Okereke, Katherine Tong, Clemens Meyer, Erwan Rolland, Mili Sanwalka, Michael D. Howell, Shixiang Shane Gu, Bibo Xu, Euan A. Ashley, S. M. Ali Eslami, Gregory Wayne, Pushmeet Kohli, Vivek Natarajan, Adam Rodman, Alan Karthikesalingam, Ryutaro Tanno

机构 * Google DeepMind(谷歌DeepMind) Google Research(谷歌研究) Beth Israel Deaconess Medical Center, Harvard Medical School(贝塞斯达医院, 哈佛医学院) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AI co-clinician系统,利用音频视频数据实现实时临床决策,通过TelePACES评估标准显示其在管理计划和诊断差异方面接近医生,但在体格检查和疾病特异性推理上仍有不足。

Comments Video examples are available on Youtube: https://youtu.be/y5Vaa_SN1t0, https://youtu.be/dC4icb75vLQ, and https://youtu.be/E7iEvWo-E6c

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08838 2026-05-12 cs.CL cs.AI 62%

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

生成无泄漏的基准以评估鲁棒的RAG

Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) New Jersey Institute of Technology(新泽西理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SeedRG方法,通过半合成方式生成无知识泄漏的RAG评估基准,解决基准老化问题,确保评估的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08462 2026-05-12 cs.CL cs.AI 62%

Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment

基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测

I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan

机构 * Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系) Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系) Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文通过比较原始基准标注与Gemini 2.5 Flash和GPT-5 Mini的推理和跨度预测,评估了摘要任务中上下文幻觉检测的准确性,并发现人类仲裁提高了三重一致性和模型准确性。

Comments Presented at the ROMCIR Workshop at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08437 2026-05-12 cs.CL cs.AI 62%

Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks

Magis-Bench:评估大语言模型在法官级别法律任务上的能力

Ramon Pires, Thales Sales Almeida, Celio Larcher Junior, Giovana Bonás, Hugo Abonizio, Marcos Piau, Roseval Malaquias Junior, Thiago Laitz, Rodrigo Nogueira

机构 * Maritaca AI Jusbrasil Campinas São Paulo Brazil(巴西坎皮纳斯圣保罗)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 Magis-Bench评估大语言模型在法官级别法律任务上的能力,包含74道来自巴西司法职位竞争考试的问题,采用LLM-as-a-judge方法评估23种先进模型,结果显示法官级法律推理和写作仍具挑战性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08220 2026-05-12 cs.AI cs.CE cs.CL cs.CV cs.SE 62%

Spatial Priming Outperforms Semantic Prompting: A Grid-Based Approach to Improving LLM Accuracy on Chart Data Extraction

空间提示优于语义提示:一种基于网格的方法以提高LLM在图表数据提取上的准确性

Andrei Lazarev, Dmitrii Sedov, Alexander Galkin

机构 * Russian Federation(俄罗斯联邦)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 本文通过对比空间提示与语义提示,发现基于网格的提示方法能显著降低图表数据提取误差,优于传统语义引导策略。

Comments his is the version of the article accepted for publication in SUMMA 2025 after peer review. The final, published version is available at IEEE Xplore: https://doi.org/10.1109/SUMMA68668.2025.11302248

Journal ref 2025 7th International Conference on Control Systems, Mathematical Modeling, Automation and Energy Efficiency (SUMMA), Lipetsk, Russian Federation, 2025, pp. 799-804

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08197 2026-05-12 cs.LG cs.AI 62%

ReplaySCM: A Benchmark for Executable Causal Mechanism Induction from Interventions

ReplaySCM:一个用于从干预证据中可执行因果机制归纳的基准

Serafim Batzoglou

机构 * Frontier LLMs(前沿大语言模型) Original, Extra Worlds, and Counterexample Audit (CEx)(原始、额外世界和反例审计)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 ReplaySCM通过不同设置测试模型从有限干预证据中归纳可执行因果机制的能力,评估可执行回放泛化,提升局部前驱模式覆盖率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10833 2026-05-12 cs.CV cs.AI 57%

MMVIAD: Multi-view Multi-task Video Understanding for Industrial Anomaly Detection

MMVIAD:多视角多任务视频理解用于工业异常检测

Xiran Zhao, Jing Jin, Yan Bai, Zhongan Wang, Yifeng Sun, Yihang Lou, Xuanyu Zhu, Tao Feng, Yingna Wu

机构 * ShanghaiTech University(上海科技大学) Tsinghua University(清华大学) Meituan Inc.(美团公司) Peking University(北京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出MMVIAD,首个工业异常检测连续多视角视频数据集及多任务评估基准,通过两阶段训练流程提升模型泛化能力,在四个任务中取得优于GPT-5.4的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10808 2026-05-12 cs.CR cs.AI 57%

Threat Modelling using Domain-Adapted Language Models: Empirical Evaluation and Insights

基于领域适应语言模型的威胁建模:实证评估与洞察

Saba Pourhanifeh, AbdulAziz AbdulGhaffar, Ashraf Matrawy

机构 * Department of Systems(系统部) School of Information Technology(信息技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文通过评估不同规模的领域适应语言模型,探讨了领域适应、模型规模、解码策略和提示技术对STRIDE威胁分类的影响,揭示了当前LLM在结构化威胁建模中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏