arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2604.15037 2026-05-05 cs.AI cs.CL cs.SD 62%

From Reactive to Proactive: Assessing the Proactivity of Voice Agents via ProVoice-Bench

从被动到主动:通过ProVoice-Bench评估语音代理的主动性

Ke Xu, Yuhao Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ProVoice-Bench评估框架,通过四个新任务评估语音代理的主动性,揭示当前模型在过度触发和推理能力上的不足,为开发更自然的主动代理提供方向。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00300 2026-05-04 cs.AI cs.DC cs.LG cs.PF 62%

Token Arena: A Continuous Benchmark Unifying Energy and Cognition in AI Inference

Token Arena:一个统一能量与认知的连续基准测试

Yuxuan Gao, Megan Wang, Yi Ling Yu

机构 * University of Pennsylvania(宾夕法尼亚大学) Columbia University(哥伦比亚大学) OpenMesh AI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 Token Arena通过端到端的五个核心维度评估AI推理性能,结合能耗和价格指标,揭示不同端点对模型准确性和效率的影响,提供更真实的推理评估标准。

Comments 14 pages, 1 figure, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20823 2026-05-04 cs.LG cs.AI cs.CV 62%

CaTS-Bench: Can Language Models Describe Time Series?

CaTS-Bench:语言模型能否描述时间序列?

Luca Zhou, Pratham Yashwante, Marshall Fisher, Alessio Sampieri, Zihao Zhou, Fabio Galasso, Rose Yu

机构 * Sapienza University of Rome(罗马大学) UC San Diego(圣地亚哥大学) ItalAI Labs(意大利AI实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出CaTS-Bench,一个涵盖11个领域的时间序列推理基准,通过1746个人工重写描述进行评估,揭示语言模型在时间序列描述中的不足,并提出合成数据生成方法以提升性能。

Comments 9 pages, 6 figures, 4 tables in the main paper. Many more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27981 2026-05-01 cs.LG cs.AI 62%

ITS-Mina: A Harris Hawks Optimization-Based All-MLP Framework with Iterative Refinement and External Attention for Multivariate Time Series Forecasting

ITS-Mina:一种基于Harris Hawks优化的全MLP框架,结合迭代细化和外部注意力机制用于多变量时间序列预测

Pourya Zamanvaziri, Amirhossein Sadr, Aida Pakniyat, Dara Rahmati

机构 * Department of Computer Science and Engineering, Shahid Beheshti University, Iran(伊朗谢赫·贝赫什提大学计算机科学与工程系) School of Computer Science, Institute for Research in Fundamental Sciences (IPM), Iran(伊朗基础科学研究院(IPM)计算机科学学院)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出ITS-Mina,一种全MLP框架,通过迭代细化机制、外部注意力模块和Harris Hawks优化算法,实现多变量时间序列预测的高精度与低计算成本。

Comments 19 pages, 2 figures, 3 tables, 4 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27776 2026-05-01 cs.AI cs.CL 62%

WindowsWorld: A Process-Centric Benchmark of Autonomous GUI Agents in Professional Cross-Application Environments

WindowsWorld: 一个以进程为中心的自主GUI代理跨应用专业环境基准测试

Jinchao Li, Yunxin Li, Chenrui Zhao, Zhenran Xu, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出WindowsWorld基准测试,用于评估自主GUI代理在跨应用复杂任务中的能力,发现代理在多应用任务中表现不佳,执行效率低,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10702 2026-05-01 cs.CL cs.AI cs.IR 62%

Grounding Agent Memory in Contextual Intent

在上下文意图中 grounding 代理记忆

Ruozhen Yang, Yucheng Jiang, Yueqi Jiang, Priyanka Kargupta, Yunyi Zhang, Jiawei Han

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 STITCH通过上下文意图索引提升长周期交互的记忆检索能力,有效减少歧义和干扰,实现在动态目标轨迹中的高效检索。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07180 2026-05-01 cs.CL cs.AI cs.CV 62%

Flattery in Motion: Benchmarking and Analyzing Sycophancy in Video-LLMs

视频中的奉承:视频大语言模型中奉承行为的基准测试与分析

Wenrui Zhou, Mohamed Hendy, Shu Yang, Qingsong Yang, Zikun Guo, Yuyu Luo, Lijie Hu, Di Wang

机构 * Provable Responsible AI and Data Analytics (PRADA) Lab(可证负责任人工智能与数据 analytics 实验室) King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹科学与技术大学) HKUST(香港科技大学) MBZUAI(穆罕默德·本·拉希德人工智能研究所) University of Science and Technology of China(中国科学技术大学) Kyungpook National University(庆尚国立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VISE基准,用于评估视频大语言模型在面对误导性输入时的奉承行为,通过多类型分析和两种无训练缓解策略提升模型可靠性。

Comments 27 Pages, Accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17056 2026-05-01 cs.CL cs.AI 62%

From Test-taking to Cognitive Scaffolding: A Pedagogical Diagnostic Benchmark for LLMs on English Standardized Tests

从应试到认知支架:一种面向LLM的教育诊断基准测试标准测试

Luoxi Tang, Tharunya Sundar, Yuqiao Meng, Shuai Yang, Ankita Patra, Lakshmi Manohar Chippada, Jiqian Zhao, Yi Li, Weicheng Ma, Zhaohan Xi

机构 * Binghamton University(宾夕法尼亚州立大学比灵顿分校) BlossomsAI(BlossomsAI公司) Dartmouth College(达特茅斯学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种教育诊断基准,通过认知框架模拟英语标准化测试问题解决过程,展示ESTBook基准测试在识别认知轨迹和改进教学推理中的实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26456 2026-04-30 cs.CL cs.AI 62%

Naamah: A Large Scale Synthetic Sanskrit NER Corpus via DBpedia Seeding and LLM Generation

Naamah:通过DBpedia seeding和LLM生成构建大规模合成梵语命名实体识别语料库

Akhil Rajeev P, Annarao Kulkarni

机构 * Centre for Development of Advanced Computing (C-DAC)(发展高级计算中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Naamah,一个包含102942个句子的高质量梵语NER数据集,结合DBpedia实体提取与混合推理模型生成,用于评估XLM RoBERTa和IndicBERTv2模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25235 2026-04-30 cs.LG cs.CL cs.CV stat.ML 62%

VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation

VLM评判者能排序但无法评分:多模态评估中的任务依赖性不确定性

Divake Kumar, Sina Tayebati, Devashri Naik, Ranganath Krishnan, Amit Ranjan Trivedi

机构 * University of Illinois at Chicago(伊利诺伊大学香槟分校) AI Labs at Capital One(Capital One人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文通过置信预测框架分析VLM作为评判者的可靠性,发现任务依赖性显著影响评估不确定性,提出排名-评分解耦问题,揭示任务难度和标注质量对区间宽度的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05190 2026-04-30 cs.CL cs.AI cs.IR 62%

Retrieval-Augmented LLMs for Evidence Localization in Clinical Trial Recruitment from Longitudinal EHR Narratives

基于检索增强的LLM在纵向电子健康记录叙事中证据定位的临床试验招募

Ziyi Chen, Mengxian Lyu, Cheng Peng, Yonghui Wu

机构 * Department of Health Outcomes and Biomedical Informatics(健康结果与生物医学信息学系) University of Florida(佛罗里达大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了基于编码器和解码器的生成LLM在临床试验招募中的应用,通过三种策略缓解长文档处理问题,MedGemma模型在RAG策略下达到89.05%的微F1分数,提升了长期推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10924 2026-04-30 cs.CL cs.AI cs.CR cs.CV cs.SE 62%

A Survey on the Safety and Security Threats of Computer-Using Agents: JARVIS or Ultron?

对计算机使用代理的安全性和安全威胁的综述:贾维斯或乌tron?

Ada Chen, Yongjiang Wu, Junyuan Zhang, Jingyu Xiao, Shu Yang, Jen-tse Huang, Kun Wang, Wenxuan Wang, Shuai Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) KAUST(卡塔尔科技大学) Johns Hopkins University(约翰霍普金斯大学) Nanyang Technological University(南洋理工大学) Renmin University of China(中国人民大学) The Hong Kong University of Science and Technology(香港科学大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文综述了计算机使用代理的安全威胁,定义了安全分析适用的代理类型,分类了当前的安全威胁,提出了防御策略的分类,并总结了评估代理安全性和性能的基准、数据集和评估指标。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25891 2026-04-29 cs.LG cs.AI cs.CR 62%

Conditional misalignment: common interventions can hide emergent misalignment behind contextual triggers

条件性偏差:通用干预可以隐藏新兴偏差背后的情境触发

Jan Dubiński, Jan Betley, Anna Sztyber-Betley, Daniel Tan, Owain Evans

机构 * Warsaw University of Technology(华沙技术大学) NASK National Research Institute(NASK国家研究院) Constellation Truthful AI University College London(伦敦大学学院) Center on Long-Term Risk(长期风险中心) UC Berkeley(伯克利大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 研究发现通用干预可减少新兴偏差,但若评估提示模仿训练情境,则模型会再次出现偏差。三种干预方法均产生条件性偏差,表明在真实训练后,模型可能在标准评估中表现正常但存在潜在偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10718 2026-04-29 cs.LG cs.CL 62%

SnapMLA: Efficient Long-Context MLA Decoding via Hardware-Aware FP8 Quantized Pipelining

SnapMLA: 通过硬件感知的FP8量化流水线实现高效的长上下文MLA解码

Yifan Zhang, Zunhai Su, Shuhao Hu, Rui Yang, Wei Wu, Yulei Qian, Yuchen Xie, Xunliang Cai

机构 * Meituan LongCat Team(美团LongCat团队) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 SnapMLA通过硬件感知的FP8量化流水线优化,提升长上下文解码效率,实验显示在长输出解码任务中吞吐量提升达1.91倍,同时在推理和代码生成基准上与BF16基线表现相近。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.24116 2026-04-29 cs.CV cs.AI cs.LG 62%

AIDOVECL: AI-generated Dataset of Outpainted Vehicles for Eye-level Classification and Localization

AIDOVECL: 人工智能生成的车辆出图数据集用于眼级分类和定位

Amir Kazemi, Qurat ul ain Fatima, Volodymyr Kindratenko, Christopher W. Tessum

机构 * The Grainger College of Engineering, Department of Civil and Environmental Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校土木与环境工程系格拉inger工程学院) Center for Artificial Intelligence Innovation, National Center for Supercomputing Applications, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校人工智能创新中心国家超级计算应用中心) The Grainger College of Engineering, Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院计算与数据科学学院) The Grainger College of Engineering, Department of Electrical and Computer Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校格拉inger工程学院电气与计算机工程系)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AIDOVECL数据集,通过出图技术生成多样化车辆图像,解决自动驾驶、城市规划等领域中缺乏眼级车辆图像的问题,提升检测性能并减少标注工作量。

Comments 34 pages, 10 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13006 2026-04-28 cs.CL cs.AI 62%

One Token Away from Collapse: The Fragility of Instruction-Tuned Helpfulness

距离崩溃仅一步之遥:指令调制帮助性的脆弱性

Erfan Baghaei Potraghloo, Seyedarmin Azizi, Souvik Kundu, Massoud Pedram

机构 * University of Southern California(南加州大学) Intel AI(英特尔人工智能)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了指令调制大语言模型在简单约束下的帮助性稳定性,发现其在词汇约束下响应质量显著下降,揭示了指令调制对表面模板的依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03525 2026-04-28 cs.CL cs.AI eess.AS 62%

Speech-Based Cognitive Screening: A Systematic Evaluation of LLM Adaptation Strategies

基于语音的认知筛查:大型语言模型适应策略的系统评估

Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sepehr Karimi, Sina Rashidi, Ali Zolnour, Maryam Dadkhah, Yasaman Haghbin, Hossein AzadMaleki, Maryam Zolnoori

机构 * Columbia University Irving Medical Center(哥伦比亚大学伊文思医疗中心) School of Nursing, Columbia University(哥伦比亚大学护理学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文系统评估了大型语言模型在痴呆症检测中的适应策略,发现上下文学习、推理增强提示和参数高效微调等方法对模型性能有显著影响,展示了适配模型在语音筛查中的有效性。

Journal ref https://ai.jmir.org/2026/1/e82608

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23972 2026-04-28 cs.CL cs.AI cs.SC 62%

Quantum Knowledge Graph: Modeling Context-Dependent Triplet Validity

量子知识图谱:建模依赖上下文的三元组有效性

Yao Wang, Zixu Geng, Jun Yan

机构 * HKAI-Sci, City University of Hong Kong(香港城市大学HKAI-Sci) Department of Automation, Tsinghua University(清华大学自动化系) Pratt School of Engineering, Duke University(德克萨斯大学达拉斯分校普拉特工程学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出量子知识图谱(QKG),通过将三元组有效性建模为上下文特定函数,提升医疗问答中事实适用性的判断,实验表明QKG在结合上下文匹配时显著提升验证效果。

Comments 15 pages main text, 6 pages appendix, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23701 2026-04-28 cs.CL cs.AI cs.CV 62%

Agri-CPJ: A Training-Free Explainable Framework for Agricultural Pest Diagnosis Using Caption-Prompt-Judge and LLM-as-a-Judge

Agri-CPJ:一种无需训练的可解释框架,用于利用Caption-Prompt-Judge和LLM-as-a-Judge进行农业害虫诊断

Wentao Zhang, Qi Zhang, Mingkun Xu, Mu You, Henghua Shen, Zhongzhi He, Keyan Jin, Derek F. Wong, Tao Fang

机构 * Business School, Shandong University of Technology(山东理工大学商学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Guangdong Institute of Intelligent Science and Technology(广东智能科学与技术研究院) Macau Millennium College(澳门 millennium 学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Agri-CPJ框架,通过生成结构化形态描述并利用LLM进行判断,解决农业病害诊断中模型易产生错误物种名称和推理不可用的问题,实验显示其在病害分类和问答评分上有显著提升。

Comments This work is an expanded version of our prior paper published in the IEEE ICASSP 2026 conference arXiv:2512.24947, from 4 to 20+ pages, presenting a well-structured and principled framework, extensive experiments, and deeper insights. Tao Fang is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20374 2026-04-28 cs.CL cs.AI 62%

CFDLLMBench: A Benchmark Suite for Evaluating Large Language Models in Computational Fluid Dynamics

CFDLLMBench: 一个用于评估大型语言模型在计算流体力学中的性能的基准套件

Nithin Somasekharan, Ling Yue, Yadi Cao, Weichao Li, Patrick Emami, Pochinapeddi Sai Bhargav, Anurag Acharya, Xingyu Xie, Shaowu Pan

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) University of California, San Diego(加州大学圣地亚哥分校) National Laboratory of the Rockies(落基山国家实验室) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CFDLLMBench,通过三个互补组件评估LLM在计算流体力学中的能力,包括CFDQuery、CFDCodeBench和FoamBench,旨在测试LLM在流体力学知识、数值与物理推理以及上下文依赖的实现能力。

Comments 40 pages

Journal ref Journal of Data-Centric Machine Learning Research, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15957 2026-04-28 eess.AS cs.AI cs.CL cs.SD 62%

Towards Holistic Evaluation of Large Audio-Language Models: A Comprehensive Survey

面向大音频-语言模型的全面评估:一项全面的调查

Chih-Kai Yang, Neo S. Ho, Hung-yi Lee

机构 * National Taiwan University(台湾大学) NTU Artificial Intelligence Center of Research Excellence (NTU AI-CoRE)(国立清华大学人工智能研究中心(NTU AI-CoRE))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文针对大音频-语言模型的评估进行全面调查,提出系统化的分类体系,从四个维度探讨其性能,揭示挑战与未来方向,为领域提供指导。

Comments EMNLP 2025 (Main). Project Website: https://github.com/ckyang1124/LALM-Evaluation-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22861 2026-04-28 cs.IR cs.AI cs.LG 62%

IntrAgent: An LLM Agent for Content-Grounded Information Retrieval through Literature Review

IntrAgent:通过文献综述实现内容导向的信息检索的LLM代理

Fengbo Ma, Zixin Rao, Xiaoting Li, Zhetao Chen, Hongyue Sun, Yiping Zhao, Xianyan Chen, Zhen Xiang

机构 * University of Georgia(佐治亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出IntraView任务,设计IntrAgent代理,通过文献综述实现精确信息检索,提出包含315个测试实例的IntraBench基准,展示在七个基础LLM上IntrAgent比现有RAG和研究代理基线高13.2%的跨领域准确性。

Comments Accepted to ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13071 2026-04-28 cs.CL cs.AI 62%

EVE: A Domain-Specific LLM Framework for Earth Intelligence

EVE:面向地球智能的领域专用LLM框架

Àlex R. Atrio, Antonio Lopez, Jino Rohit, Yassine El Ouahidi, Marcello Politi, Vijayasri Iyer, Umar Jamil, Sébastien Bratières, Nicolas Longépé

机构 * Pi School(Pi学校) Mistral AI Translated ESA Φ \Phi -lab(ESA Φ实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EVE首次提出开源端到端框架,构建24B领域适应模型,在地球观测和科学基准上超越同类模型,提供系统化评估基准和生产系统,支持350名试点用户。

Comments To be published in the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22367 2026-04-27 cs.CL cs.AI 62%

CNSL-bench: Benchmarking the Sign Language Understanding Capabilities of MLLMs on Chinese National Sign Language

CNSL-bench:用于评估多模态大语言模型在中文国家手语理解能力的基准

Rui Zhao, Xuewen Zhong, Xiaoyun Zheng, Jinsong Su, Yidong Chen

机构 * School of Informatics, Xiamen University, China(厦门大学信息学院) Key Lab of Digital Protection and Intelligent Processing of Intangible Cultural Heritage of Fujian-Taiwan (XMU), Ministry of Culture and Tourism, China(福建省-台湾非物质文化遗产数字化保护与智能处理重点实验室(XMU),文化和旅游部,中国) National Language Resources Monitoring and Research Center for Education and Teaching Media, Xiamen University, China(教育与教学媒体语言资源监测与研究中心,厦门大学,中国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CNSL-bench,首个评估多模态大语言模型在中文国家手语理解能力的基准,通过权威 grounding、多模态覆盖和手部动作多样性,评估21个模型,发现当前模型在手语理解上仍显著劣于人类表现。

Comments Accepted as the Main Conference at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14306 2026-04-27 cs.CL cs.AI 62%

EuropeMedQA Study Protocol: A Multilingual, Multimodal Medical Examination Dataset for Language Model Evaluation

欧洲医学问答研究协议:一个多语言、多模态的医学考试数据集用于语言模型评估

Francesco Andrea Causio, Vittorio De Vita, Olivia Riccomi, Michele Ferramola, Federico Felizzi, Alessandro Tosi, Antonio Cristiano, Lorenzo De Mori, Chiara Battipaglia, Melissa Sawaya, Luigi De Angelis, Marcello Di Pumpo, Alessandra Piscitelli, Pietro Eric Risuleo, Alessia Longo, Giulia Vojvodic, Mariapia Vassalli, Bianca Destro Castaniti, Nicolò Scarsi, Manuel Del Medico

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出欧洲医学问答数据集,旨在通过多语言多模态数据评估语言模型性能,评估跨语言迁移和视觉推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21229 2026-04-24 cs.CL cs.AI 62%

EngramaBench: Evaluating Long-Term Conversational Memory with Structured Graph Retrieval

EngramaBench:基于结构化图检索评估长期对话记忆

Julian Acuna

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EngramaBench基准测试,评估长期对话记忆系统在事实回忆、跨空间整合等任务中的表现,对比Engrama与GPT-4o和Mem0的性能差异。

Comments 9 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20994 2026-04-24 cs.CR cs.AI cs.CL 62%

Breaking MCP with Function Hijacking Attacks: Novel Threats for Function Calling and Agentic Models

打破MCP:函数劫持攻击:函数调用和代理模型的新威胁

Yannis Belkhiter, Giulio Zizzo, Sergio Maffeis, Seshu Tirupathi, John D. Kelleher

机构 * IBM Research Europe(IBM欧洲研究院) Trinity College Dublin(三一学院都柏林) Imperial College London(帝国理工学院伦敦) ADAPT Research Centre(ADAPT研究中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的函数劫持攻击,通过操纵代理模型的工具选择过程,迫使调用特定攻击者选择的函数,展示了代理模型在函数调用接口上的新漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20983 2026-04-24 cs.CV cs.AI cs.CL 62%

Thinking Like a Botanist: Challenging Multimodal Language Models with Intent-Driven Chain-of-Inquiry

像植物学家一样思考:用意图驱动的连续询问挑战多模态语言模型

Syed Nazmus Sakib, Nafiul Haque, Shahrear Bin Amin, Hasan Muhammad Abdullah, Md. Mehedi Hasan, Mohammad Zabed Hossain, Shifat E. Arman

机构 * Department of Robotics and Mechatronics Engineering, University of Dhaka(达卡大学机器人与机电工程系) Department of Computer Science and Engineering, University of Dhaka(达卡大学计算机科学与工程系) Department of Agronomy, Gazipur Agricultural University(加兹ipur农业大学作物学系) Department of Botany, University of Dhaka(达卡大学植物学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PlantInquiryVQA基准,通过结构化询问提升植物病害诊断准确性,揭示多步意图驱动的视觉推理方法,改进多模态模型的临床推理能力。

Comments Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20850 2026-04-24 cs.IR cs.AI cs.CL 62%

Association Is Not Similarity: Learning Corpus-Specific Associations for Multi-Hop Retrieval

关联并非相似性:为多跳检索学习语料特定的关联

Jason Dury

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AAR方法,通过对比学习在嵌入空间中学习语料特定的关联关系,提升多跳检索的召回率,且无需评估集调优。

Comments 10 pages, 7 appendices, 10 tables. Code: https://github.com/EridosAI/AAR

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19773 2026-04-23 cs.CL cs.AI 62%

PR-CAD: Progressive Refinement for Unified Controllable and Faithful Text-to-CAD Generation with Large Language Models

PR-CAD:基于大语言模型的统一可控且忠实的文本到CAD生成的渐进式细化

Jiyuan An, Jiachen Zhao, Fan Chen, Liner Yang, Zhenghao Liu, Hongyan Wang, Weihua An, Meishan Zhang, Erhong Yang

机构 * School of Information Science, Beijing Language and Culture University, China(北京语言大学信息学院) School of Computer Science and Technology, Beijing Jiaotong University, China(北京交通大学计算机科学与技术学院) School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Tsinghua University, China(清华大学计算机科学与技术系) School of Computer Science and Technology, Harbin Institute of Technology (Shenzhen), China(哈尔滨工业大学(深圳)计算机科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 PR-CAD通过统一生成与编辑任务,提升文本到CAD生成的可控性和忠实性,采用高保真交互数据集和强化学习框架,实现设计创建与细化的一体化解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏