arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-05-15 至 2026-05-15 共收录 157 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 17 篇

2605.14406 2026-05-15 cs.LG cs.CV 57%

GeoViSTA: Geospatial Vision-Tabular Transformer for Multimodal Environment Representation

GeoViSTA:用于多模态环境表示的地理视觉-表格变压器

Yuhao Liu, Sadeer Al-Kindi, Ashok Veeraraghavan, Guha Balakrishnan

机构 * Department of Electrical and Computer Engineering, Rice University(理海大学电气与计算机工程系) Center for Cardiovascular Computational and Precision Health, Department of Cardiology, DeBakey Heart and Vascular Center, Houston Methodist(休斯顿方法主义医疗中心心血管计算与精准健康中心、心内科部门、德贝基心脏和血管中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.LG

AI总结 GeoViSTA通过融合栅格影像与表格数据,构建统一的地理嵌入表示,提升对环境、社会和健康问题的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08374 2026-05-15 cs.AI 57%

MemQ: Integrating Q-Learning into Self-Evolving Memory Agents over Provenance DAGs

MemQ:将Q学习整合到基于溯源DAG的自进化记忆代理中

Junwei Liao, Haoting Shi, Ruiwen Zhou, Jiaqian Wang, Shengtao Zhang, Wei Zhang, Ying Wen, Zhiyu Li, Feiyu Xiong, Bo Tang, Weinan Zhang, Muning Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) University of Science and Technology of China(中国科学技术大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 MemQ通过在溯源DAG中传播信用权重,改进记忆Q值的评估,提升多步任务的泛化能力,尤其在产生深层相关溯源链的任务中表现突出。

Comments 22 pages, 11 figures (containing 43 individual image panels total)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07738 2026-05-15 cs.CL 57%

Automated Construction of a Knowledge Graph of Nuclear Fusion Energy for Effective Elicitation and Retrieval of Information

自动化构建核聚变能源知识图谱以实现信息的有效提取与检索

Andrea Loreti, Kesi Chen, Ruby George, Robert Firth, Adriano Agnello, Shinnosuke Tanaka

机构 * UK Atomic Energy Authority, Culham Campus(英国原子能管理局,库尔汉校区) STFC Hartree Centre(STFC哈特里中心) Sci-Tech Daresbury(科技达尔斯伯里) IBM Research(IBM研究院)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出多步骤自动化构建知识图谱的方法,用于组织和表示大型文档语料中的领域知识。通过构建首个核聚变能源知识图谱,验证了自动命名实体识别和实体解析等关键功能,并评估了预训练大语言模型在处理挑战时的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14795 2026-05-15 cs.CV 50%

COAL: Counterfactual and Observation-Enhanced Alignment Learning for Discriminative Referring Multi-Object Tracking

COAL: 基于反事实和观察增强的对齐学习用于判别性参照多目标跟踪

Shukun Jia, Shiyu Hu, Yipei Wang, Ximeng Cheng, Yichao Cao, Xiaobo Lu

机构 * School of Automation, Southeast University, Nanjing, China(东南大学自动化学院,南京,中国) Key Laboratory of Measurement and Control of Complex Systems of Engineering, Ministry of Education, Nanjing, China(工程复杂系统测量与控制国家重点实验室,教育部,南京,中国) School of Physical & Mathematical Sciences, Nanyang Technological University, Singapore(南洋理工大学物理与数学科学学院,新加坡) Big Data Institute, Central South University, Changsha, China(中南大学大数据研究院,长沙,中国)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 COAL通过知识正则化解决RMOT中高判别性需求与稀疏语义监督的矛盾,引入显式语义注入和反事实学习提升多目标跟踪的判别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14628 2026-05-15 cs.HC 50%

SmartWalkCoach: An AI Companion for End-to-End Walking Guidance, Motivation, and Reflection

SmartWalkCoach: 一种面向全程步行引导、激励与反思的AI伴侣

Xianzhe Zhang, Mingxuan Hu, Bufan Xue, Erick Purwanto, Thomas J Selig, Daniel Yonto

专题命中 复杂问题求解 :planning(abstract)

AI总结 本文提出SmartWalkCoach,通过整合地理、陪伴和总结三个轻量级代理,降低步行规划的认知负荷,提升步行过程中的参与度与动机,通过动态干预改善用户感受和体验。

Comments 15 pages, 2 figures, to be presented to ACM IUI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23477 2026-05-15 cs.DB 50%

SEMA-SQL: Beyond Traditional Relational Querying with Large Language Models

SEMA-SQL:超越传统关系查询的大型语言模型

Yin Lin, Tianjing Zeng, Zhongjun Ding, Rong Zhu, Bolin Ding, H. V. Jagadish, Jingren Zhou

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 SEMA-SQL通过结合关系操作与LLM语义推理,自动回答自然语言问题,提升查询能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20206 2026-05-15 cs.CV 50%

RAPO++: Cross-Stage Prompt Optimization for Text-to-Video Generation via Data Alignment and Test-Time Scaling

RAPO++: 通过数据对齐和测试时缩放实现文本到视频生成的跨阶段提示优化

Bingjie Gao, Qianli Ma, Xiaoxue Wu, Shuai Yang, Guanzhou Lan, Haonan Zhao, Jiaxuan Chen, Qingyang Liu, Yu Qiao, Xinyuan Chen, Yaohui Wang, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 RAPO++通过数据对齐和测试时缩放,结合训练数据对齐、测试时迭代缩放和大语言模型微调,提升文本到视频生成效果,无需修改生成基础模型。

Comments arXiv admin note: text overlap with arXiv:2504.11739

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 40 篇

2605.15016 2026-05-15 cs.CL cs.AI 84%

COTCAgent: Preventive Consultation via Probabilistic Chain-of-Thought Completion

COTCAgent:通过概率性思维链完成实现预防性咨询

Zihan Deng, Xiaozhen Zhong, Chuanzhi Xu

机构 * School of Computing and Data Science, The University of Hong Kong(香港大学计算与数据科学学院) Shenzhen Institute for Advanced Study, University of Electronic Science and Technology of China(中国电子科学与技术大学深圳高级研究所) School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)

专题命中 推理评测 :chain-of-thought(title,abstract);reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出COTCAgent框架,通过概率性思维链完成实现纵向电子健康记录的预防性咨询,解决了现有大语言模型在纵向EHR推理中的统计学推理不足和时间序列依赖性捕捉困难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15071 2026-05-15 cs.CV cs.AI cs.CL 81%

On the Cultural Anachronism and Temporal Reasoning in Vision Language Models

关于视觉语言模型中文化错位与时间推理的问题

Mukul Ranjan, Prince Jha, Khushboo Kumari, Zhiqiang Shen

机构 * MBZUAI Inception

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了视觉语言模型在解读历史文物时存在的文化错位问题,通过设计TAB-VLM基准测试集评估模型的时间推理能力,发现现有模型在处理非西方文化文物时存在显著缺陷。

Comments Project Page: https://khushboo0012.github.io/tab-vlm-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03814 2026-05-15 cs.AI cs.LG 81%

Conformal Thinking: Risk Control for Reasoning on a Compute Budget

conformal thinking: 用于计算预算上的推理风险控制

Xi Wang, Anushri Suresh, Alvin Zhang, Rishi More, William Jurayj, Benjamin Van Durme, Mehrdad Farajtabar, Daniel Khashabi, Eric Nalisnick

机构 * Johns Hopkins University, Baltimore, Maryland, USA(约翰霍普金斯大学,巴尔的摩,马里兰州,美国) Apple, USA(苹果公司,美国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种风险控制框架,通过设置上界和下界阈值来优化计算预算,提升推理效率并降低错误率。

Comments ICMl 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21433 2026-05-15 cs.LG cs.AI 81%

ReasonCache: Accelerating Large Reasoning Model Serving through KV Cache Sharing

ReasonCache:通过KV缓存共享加速大型推理模型服务

Kaiwen Chen, Xin Tan, Minchen Yu, Jingzong Li, Hong Xu

机构 * The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hang Seng University of Hong Kong(恒生大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出ReasonCache,通过共享KV缓存提升AI推理系统服务质量,实验显示吞吐量提升89.2%,平均提升40-60%,同时保持更高精度。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14754 2026-05-15 cs.AI 79%

XDomainBench: Diagnosing Reasoning Collapse in High-Dimensional Scientific Knowledge Composition

XDomainBench:诊断高维科学知识组合中的推理崩溃

Gong Zhiren, Tiantong Wu, Jiaming Zhang, Fuyao Zhang, Che Wang, Yurong Hao, Yikun Hou, Foo Ping, Yilei Zhao, Fei Huang, Chau Yuen, Wei Yang Bryan Lim

机构 * Alibaba Group, China(阿里巴巴集团,中国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 XDomainBench通过系统压力测试科学推理,揭示LLM在跨学科知识组合中的推理崩溃问题,发现领域组合导致直接难度增加和轨迹模式引发的误差累积是根本原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14704 2026-05-15 cs.CV cs.AI cs.RO 79%

SceneFunRI: Reasoning the Invisible for Task-Driven Functional Object Localization

SceneFunRI:为任务驱动的功能物体定位推理不可见区域

Posheng Chen, Powen Cheng, Gueter Josmy Faure, Hung-Ting Su, Winston H. Hsu

机构 * National Taiwan University(国立台湾大学) Delta Robotics Innovation Center(Delta机器人创新中心)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 SceneFunRI通过半自动化流程构建了855个实例的基准,要求模型根据任务指令和常识推理推断不可见功能物体的位置,现有模型在推理稳定性上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08888 2026-05-15 cs.CL cs.CV 79%

DocScope: Benchmarking Verifiable Reasoning for Trustworthy Long-Document Understanding

DocScope:可验证推理的可信长文档理解基准测试

Xiang Feng, Jiawei Zhou, Zhangfeng Huang, Kewei Wang, Shanshan Ye, Jinxin Hu, Zulong Chen, Yong Luo, Jing Zhang

机构 * School of Computer Science, National Engineering Research Center for Multimedia Software and Hubei Key Laboratory of Multimedia and Network Communication Engineering, Wuhan University, China(计算机学院,国家多媒体软件工程技术研究中心和湖北多媒体与网络通信工程重点实验室,武汉大学,中国) Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国) Independent Researcher(独立研究者) Department of Machine Learning, Mohamed bin Zayed University of Artificial Intelligence, United Arab Emirates(机器学习系,Mohamed bin Zayed人工智能大学,阿拉伯联合酋长国)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 DocScope通过结构化推理轨迹预测方法评估多模态大语言模型在长文档中的可验证推理能力,发现答案准确度无法替代轨迹级评估,且区域定位仍是薄弱环节。

Comments 50pages, 25 figures, 14 tables;

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07045 2026-05-15 cs.CV cs.AI 79%

VLRS-Bench: A Vision-Language Reasoning Benchmark for Remote Sensing

VLRS-Bench: 一种面向遥感的视觉-语言推理基准

Zhiming Luo, Di Wang, Haonan Guo, Jing Zhang, Bo Du

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出VLRS-Bench,首个专注于复杂遥感推理的基准,包含2000个问题-答案对,涵盖14项任务和八个时间阶段,揭示现有MLLM在遥感任务中的瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03630 2026-05-15 cs.CL 79%

Reasoning Model Is Superior LLM-Judge, Yet Suffers from Biases

推理模型优于LLM-判官,但存在偏见

Hui Huang, Xuanxin Wu, Muyun Yang, Yuki Arase

机构 * Institute of Science Tokyo(东京科学研究院) Harbin Institute of Technology(哈尔滨工业大学) The University of Osaka(大阪大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。

Comments Accepted by ACL 2026 Workshop EvalEval

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05820 2026-05-15 cs.SE cs.AI 79%

From Ranking to Reasoning: Explainable Web API Recommendation via Semantic Reasoning

从排序到推理:通过语义推理实现可解释的Web API推荐

Zishuo Xu, Dezhong Yao, Yao Wan

机构 * School of Software Engineering(软件工程学院) School of Computer Science and Technology(计算机科学与技术学院) Huazhong University of Science and Technology(华中科技大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出WAR-R1框架,结合语义推理与自适应推荐,通过轻量级大语言模型生成API推荐及自然语言解释,提升推荐准确性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14040 2026-05-15 cs.CL 79%

Physics-R1: An Audited Olympiad Corpus and Recipe for Visual Physics Reasoning

Physics-R1: 一个经过审计的奥林匹克语料库及视觉物理推理的配方

Shan Yang

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本文通过审计多模态物理评估流程,揭示了训练-评估污染、翻译漂移和MCQ饱和等三个问题,并提出PhysR1配方,基于Qwen3-VL-8B-Thinking,提升了多个基准测试的性能。

Comments 10 pages, 3 tables. Project page: https://shanyang.me/physics-r1-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12772 2026-05-15 cs.MM cs.CV 78%

JointAVBench: A Benchmark for Joint Audio-Visual Reasoning Evaluation

JointAVBench: 一个用于联合音频视觉推理评估的基准测试

Jianghan Chao, Jianzhang Gao, Wenhui Tan, Yuchong Sun, Ruihua Song, Liyun Ru

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学香樟人工智能学院) Baichuan Inc(百川科技)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出JointAVBench基准测试,旨在评估多模态大语言模型在联合音频视觉推理中的表现,涵盖多模态依赖、多类音频信息和不同场景跨度,通过自动化流程生成问题并评估不同模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14420 2026-05-15 cs.AI 77%

DVMap: Fine-Grained Pluralistic Value Alignment via High-Consensus Demographic-Value Mapping

DVMap:通过高共识人口价值映射实现细粒度多元化价值对齐

Pengyun Zhu, Yuqi Ren, Zhen Wang, Lei Yang, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University, China(天津大学计算机科学与技术学院 TJUNLP 实验室,中国)

专题命中 推理评测 :CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出DVMap框架,通过多维人口约束实现细粒度多元化价值对齐,利用结构化推理机制和群体相对策略优化,提升模型在跨人口、国家和价值测试中的泛化能力。

Comments Accepted to the Main Conference of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11453 2026-05-15 cs.MA cs.AI cs.LG cs.SI math.SP 76%

Predictive Maps of Multi-Agent Reasoning: A Successor-Representation Spectrum for LLM Communication Topologies

多智能体推理的预测地图:一种用于LLM通信拓扑的后继表示谱

Ethan Parks, Dalal Alharthi

机构 * University of Arizona(亚利桑那大学)

专题命中 推理评测 :reasoning(title);分类 cs.AI、cs.LG

AI总结 本文提出基于后继表示谱的结构诊断方法,用于评估多智能体LLM通信拓扑的性能,通过分析谱半径、谱间隙和条件数等指标,预测拓扑在漂移、共识和扰动鲁棒性方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16813 2026-05-15 cs.AI cs.CL cs.DB 73%

PersonalHomeBench: Evaluating Agents in Personalized Smart Homes

PersonalHomeBench:评估智能家庭中的代理系统

Manasa Bharadwaj, Yolanda Liu, InJung Yang, Sungil Kim, Nikhil Verma, KoKeun Kim, Kevin Ferreira, YoungJoon Kim

机构 * LG Toronto AI Lab(LG多伦多人工智能实验室)

专题命中 推理评测 :reasoning(abstract);planning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PersonalHomeBench,用于评估代理在个性化智能家庭中的表现,通过迭代构建家庭状态生成任务,结合工具箱支持真实交互,揭示任务复杂度增加时代理能力下降的问题。

Comments Please use and cite the V3 version of this work, which includes updated correct author ordering and expanded error analysis in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09027 2026-05-15 cs.CL cs.AI cs.LG cs.MA 67%

GAMBIT: A Three-Mode Benchmark for Adversarial Robustness in Multi-Agent LLM Collectives

GAMBIT:多智能体LLM集体中对抗鲁棒性的三模式基准

Alexandre Le Mercier, Chris Develder, Thomas Demeester

机构 * IDLab–T2K, Ghent University–imec(IDLab–T2K,根特大学–imec)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GAMBIT是首个多智能体对抗鲁棒性基准,通过三模式评估和两个独立评分,测试在适应性对抗者下的 impostor 检测器性能,展示了零样本评估的误导性及快速 recalibration 方法的重要性。

Comments 46 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03596 2026-05-15 cs.AI cs.CL cs.DB cs.LG 67%

Workspace-Bench 1.0: Benchmarking AI Agents on Workspace Tasks with Large-Scale File Dependencies

Workspace-Bench 1.0:基于大规模文件依赖的AI代理工作空间基准测试

Zirui Tang, Xuanhe Zhou, Yumou Liu, Linchun Li, Yukai Wu, Weizheng Wang, Hongzhang Huang, Wei Zhou, Jun Zhou, Jiachen Song, Shaoli Yu, Jinqi Wang, Zihang Zhou, Hongyi Zhou, Yuting Lv, Jinyang Li, Jiashuo Liu, Ruoyu Chen, Chunwei Liu, GuoLiang Li, Jihua Kang, Fan Wu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Workspace-Bench 1.0,通过构建包含5个工人配置、74种文件类型和20,476个文件的现实工作空间,评估AI代理在处理大规模文件依赖任务中的能力,发现当前代理在工作空间学习中表现远低于人类水平。

Comments 30 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02398 2026-05-15 cs.AI cs.CL cs.LG 67%

The Compliance Trap: How Structural Constraints Degrade Frontier AI Metacognition Under Adversarial Pressure

合规陷阱:结构约束如何在对抗压力下破坏前沿AI元认知

Rahul Kumar

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了在对抗压力下前沿AI模型元认知崩溃的根本原因,提出SCHEMA评估框架,发现8/11模型在对抗压力下出现严重元认知退化,其原因在于强制性指令而非生存威胁,且Anthropic的Constitutional AI因对齐训练而表现出近乎完美的免疫性。

Comments 9 pages, 2 figures, 3 tables. Code: https://github.com/rkstu/schema-compliance-trap Dataset: https://huggingface.co/datasets/lightmate/schema-compliance-trap

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13016 2026-05-15 cs.CV 67%

SVAG-Bench: A Large-Scale Benchmark for Multi-Instance Spatio-temporal Video Action Grounding

SVAG-Bench:多实例时空视频动作定位的大规模基准

Tanveer Hannan, Shuaicong Wu, Mark Weber, Suprosanna Shit, Jindong Gu, Rajat Koner, Aljoša Ošep, Laura Leal-Taixé, Thomas Seidl

机构 * LMU Munich(慕尼黑大学) MCML Technical University of Munich(慕尼黑技术大学) University of Zurich(苏黎世大学) University of Oxford(牛津大学) Amazon(亚马逊) NVIDIA(英伟达)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14752 2026-05-15 cs.LG cs.AI 62%

Cognitive-Uncertainty Guided Knowledge Distillation for Accurate Classification of Student Misconceptions

认知不确定性引导的知识蒸馏用于准确分类学生误解

Qirui Liu, Hao Chen, Weijie Shi, Jiajie Xu, Jia Zhu

机构 * South China University of Technology(华南理工大学) Tencent Financial Technology(腾讯金融科技) The Hong Kong University of Science and Technology(香港科学与技术大学) Soochow University(苏州大学) Zhejiang Key Laboratory of Intelligent Education Technology and Application, Zhejiang Normal University(浙江省智能教育技术与应用重点实验室,浙江师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种两阶段知识蒸馏框架,通过认知不确定性机制挖掘高价值样本,提升学生误解分类的准确率,实验表明在少量数据下优于现有方法。

Comments ACL 2026 Findings. 10 pages, 5 figures, 19 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14543 2026-05-15 cs.LG cs.AI 62%

RxEval: A Prescription-Level Benchmark for Evaluating LLM Medication Recommendation

RxEval: 一个处方级基准,用于评估LLM药物推荐

Shuhao Chen, Weisen Jiang, Changmiao Wang, Xiaoqing Wu, Xuanren Shi, Yu Zhang, James T. Kwok

机构 * The Hong Kong University of Science and Technology(香港科技大学) Southern University of Science and Technology(南方科技大学) The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学深圳校区) Shenzhen University General Hospital(深圳大学人民医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 RxEval通过多选题评估LLM处方能力,包含1547个问题,涵盖584名患者、18种诊断类别和969种药物,测试16个LLM显示其挑战性和区分性,F1值从45.18到77.10,最佳精确匹配仅46.10%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14120 2026-05-15 cs.LG cs.CL 62%

Mini-JEPA Foundation Model Fleet Enables Agentic Hydrologic Intelligence

Mini-JEPA基础模型舰队实现智能水文智能

Mashrekur Rahman

机构 * Dartmouth Libraries, Dartmouth College(达特茅斯图书馆,达特茅斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出Mini-JEPA基础模型舰队,通过路由代理为特定问题选择传感器,提升水文分析精度,实验显示其在土壤湿度、干旱和降水预测中优于AlphaEarth。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14062 2026-05-15 cs.AI cs.CL 62%

Know When To Fold 'Em: Token-Efficient LLM Synthetic Data Generation via Multi-Stage In-Flight Rejection

知何时该收手:通过多阶段飞行拒绝实现令牌高效的大语言模型合成数据生成

Anjir Ahmed Chowdhury, Syed Zawad, Feng Yan

机构 * Department of Computer Science University of Houston(计算机科学系休斯顿大学) IBM Research(IBM研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MSIFR框架,通过在生成过程中早期检测低质量轨迹以减少令牌浪费,提升合成数据生成效率,实验表明其在多个模型和基准上显著降低令牌消耗并保持准确性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏