arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-06-01 至 2026-06-01 共收录 163 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 33 篇

2512.00349 2026-06-01 cs.AI 70%

Debate with Images: Detecting Deceptive Behaviors in Multimodal Large Language Models

图像辩论:检测多模态大语言模型中的欺骗行为

Sitong Fang, Shiyi Hou, Kaile Wang, Boyuan Chen, Donghai Hong, Jiayi Zhou, Josef Dai, Yaodong Yang, Jiaming Ji

机构 * Institute of Artificial Intelligence, Peking University(北京大学人工智能研究院)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 本文提出 MM-DeceptionBench 基准和基于图像辩论的多智能体监控框架,系统揭示并量化多模态大语言模型中的欺骗风险,有效提升欺骗行为检测能力。

Comments 39 pages, 16 figures, camera ready version for ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08964 2026-06-01 cs.LG cs.AI cs.CL cs.CY 67%

A Behavioural and Representational Evaluation of Goal-Directedness in Language Model Agents

语言模型智能体中目标导向性的行为与表征评估

Raghu Arghal, Fade Chen, Niall Dalton, Evgenii Kortukov, Calum McNamara, Angelos Nalmpantis, Moksh Nirvaan, Gabriele Sarti, Mario Giulianelli

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) Indiana University, Bloomington(印第安纳大学,布卢明顿) Northeastern University(东北大学) University College London(伦敦大学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出一种结合行为评估与内部表征可解释性分析的目标导向性评估框架,并以LLM智能体在2D网格世界中的导航为例,验证了其行为与表征的一致性。

Comments Proceedings of the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31349 2026-06-01 cs.CL cs.AI cs.CV cs.MM 62%

FBHM: Functional Benchmarking and Steering of VLMs for Hateful Meme Detection

FBHM:用于仇恨模因检测的功能性基准测试与视觉语言模型引导

Paramananda Bhaskar, Naquee Rizwan, Daksh Jogchand, Saurabh Kumar Pandey, Animesh Mukherjee

机构 * Indian Institute of Technology (IIT), Kharagpur(印度理工学院(IIT)卡拉格浦尔) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 针对现有基准无法因果评估视觉语言模型漏洞的问题,提出基于25种修辞功能和10个目标社区构建的FBHM基准,并采用可学习引导向量(LSV)在极低数据量下提升模型性能约30个Macro-F1点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30654 2026-06-01 cs.CL cs.AI cs.HC 62%

EUDAIMONIA: Evaluating Undesirable Dynamics in AI

EUDAIMONIA: 评估AI中的不良动态

Jun Rui Huang, Wang Bill Zhu, Ziyi Liu, Nathanael Fast, Ravi Iyer, Robin Jia

机构 * University of Southern California(南加州大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 提出Social AI Design Code框架,并通过EUDAIMONIA基准测试评估22个最新LLM在社交互动中对用户福祉的符合程度,发现即使最强模型也违反约30%的设计要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30599 2026-06-01 cs.LG cs.CL 62%

AMNESIA: A Large Scale Medical Unlearning Benchmark Suite with Disease-Informed Analysis

AMNESIA: 一个大规模医学遗忘基准套件与疾病知情分析

Saeedeh Davoudi, Reihaneh Iranmanesh, Ophir Frieder, Nazli Goharian

机构 * IR Lab, Computer Science Department, Georgetown University, Washington D.C.(信息检索实验室,计算机科学系,乔治·华盛顿大学,华盛顿特区)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出AMNESIA,首个大规模开源医学遗忘基准,包含70,560个问答对,评估四种遗忘方法,发现个体遗忘会侵蚀同病患者的其他知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30589 2026-06-01 cs.CL cs.AI 62%

ImmigrationQA: A Source-Grounded Dataset and Small-Model Adaptation for U.S. Immigration Law

ImmigrationQA: 一个基于来源的数据集及面向美国移民法的小型模型适配

Nazarii Shportun

机构 * Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文构建了基于来源的问答数据集ImmigrationQA(17,058对,覆盖13个移民子领域),并通过参数高效LoRA微调Llama 3.2 3B Instruct模型,在程序性子领域取得显著提升,但复杂法律推理仍较弱。

Comments 12 pages, 4 tables. Dataset (17,058 QA pairs), fine-tuned model, and code are publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30018 2026-06-01 cs.CL cs.LG 62%

Latent Performance Profiling of Large Language Models

大型语言模型的潜在性能剖析

Tanmoy Chakraborty, Ayan Sengupta, Suparna Bhattacharya, Partha Pratim Chakrabarti, Amlan Chakrabarti, Supratik Chakraborty, Partha Pratim Das, Lipika Dey, Richa Singh, Mayank Vatsa

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(印度理工学院德里分校电子工程系) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(印度理工学院德里分校人工智能学院) Hewlett Packard Enterprise, India(印度惠普企业公司) Department of Computer Science & Engineering, Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校计算机科学与工程系) A.K.Choudhury School of Information Technology, University of Calcutta, India(印度加尔各答大学信息科技学院) Department of Computer Science & Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Department of Computer Science, Ashoka University, India(阿什oka大学计算机科学系) Department of Computer Science & Engineering, Indian Institute of Technology Jodhpur(印度理工学院朱罗普分校计算机科学与工程系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 提出潜在性能剖析(LPP)框架,通过隐藏激活和输出分布提取任务无关的诊断指标,揭示模型内在特性,补充传统基准评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12440 2026-06-01 cs.CL cs.AI 62%

MedFact: Benchmarking the Fact-Checking Capabilities of Large Language Models on Chinese Medical Texts

MedFact:大型语言模型在中文医学文本上的事实核查能力基准测试

Jiayi He, Yangmin Huang, Qianyun Du, Xiangying Zhou, Zhiyang He, Jiaxue Hu, Xiaodong Tao, Lixian Lai

机构 * Xunfei Healthcare Technology Co., Ltd.(讯飞医疗科技有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 为评估LLM在中文医学文本中的事实核查能力,构建了包含2116个专家标注实例的MedFact基准,涵盖13个专科、8种错误类型等,并发现模型在错误定位上表现不足,存在“过度批评”现象。

Comments Accepted to The Fifth Workshop on Generation, Evaluation, and Metrics (GEM) at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02060 2026-06-01 cs.AI cs.LG 62%

ReTabAD: A Benchmark for Restoring Semantic Context in Tabular Anomaly Detection

ReTabAD: 恢复表格异常检测中语义上下文的基准

Sanghyu Yoon, Dongmin Kim, Suhee Yoon, Ye Seul Sim, Seungdong Yoa, Hye-Seung Cho, Soonyoung Lee, Hankook Lee, Woohyung Lim

机构 * LG AI Research, Seoul, South Korea(LG人工智能研究实验室,首尔,韩国) Sungkyunkwan University, Suwon, South Korea(成均馆大学,水原,韩国)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 针对现有表格异常检测基准缺乏语义上下文的问题,提出ReTabAD基准,通过丰富结构化文本元数据并集成零样本LLM框架,验证了语义上下文能提升检测性能和可解释性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31478 2026-06-01 cs.SE cs.CL cs.SY eess.SY 57%

Knowledge Boundary Probing and Demand-Guided Intervention for LLM-Based Power System Code Generation

知识边界探测与需求引导干预:面向基于LLM的电力系统代码生成

Hui Wu, Xiaoyang Wang, Zhong Fan

机构 * Department of Engineering, University of Exeter(工程系,埃克塞特大学) Department of Computer Science, University of Exeter(计算机科学系,埃克塞特大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对LLM在电力系统代码生成中因API知识边界错误导致失败的问题,提出PowerCodeBench基准、L0-L3文档驱动探测和边界感知干预方法,显著提升模型准确率。

Comments 43 pages, 12 figures, includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30459 2026-06-01 cs.CL 57%

Can LLM Teams Play What? Where? When?

LLM 团队能玩“什么?哪里?何时?”吗?

Anastasia Kotelnikova, Viktor Byzov, Maria Dolzhenkova, Evgeny Kotelnikov

机构 * Vyatka State University(维yatka国立大学) European University at St. Petersburg(圣彼得堡欧洲大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究基于团队的交互策略(投票、静默团队、健谈团队)能否提升大语言模型在“什么?哪里?何时?”问答游戏中的表现,实验表明团队策略优于单模型基线,准确率最高提升20个百分点,最佳团队达到44.23%,接近人类水平。

Comments Accepted for Dialogue-2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30394 2026-06-01 cs.SE cs.AI 57%

CodeGolf Bench: A Multi-Language Benchmark for Evaluating Concise Code Generation Capabilities of Large Language Models

CodeGolf Bench:评估大型语言模型简洁代码生成能力的多语言基准

Vedant Padwal

机构 * Independent(独立)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出CodeGolf Bench基准,基于代码高尔夫竞赛,在60种编程语言中评估LLM生成简洁高效代码的能力,实验表明推理模型显著优于非推理模型。

Comments 12 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28646 2026-06-01 cs.CR cs.CL 57%

MaskClaw: Edge-Side Personalized Privacy Arbitration for GUI Agents with Behavior-Driven Skill Evolution

MaskClaw: GUI代理的边端个性化隐私仲裁与行为驱动技能进化

Yanqiu Zhao, Dongying Zheng, Kaibo Huang, Yukun Wei, Zhongliang Yang, Linna Zhou

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出MaskClaw,一种在边端进行隐私仲裁的GUI代理框架,通过本地视觉证据提取、策略记忆检索和沙箱门控的技能进化,在截图离开信任环境前决定允许、遮蔽或询问,解决了静态PII检测和云端推理的隐私边界问题。

Comments Preprint. Submitted to EMNLP 2026. 21 pages, including appendices; 5 figures Under review. Yanqiu Zhao and Dongying Zheng contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16922 2026-06-01 cs.AI 57%

ClimAgent: LLM as Agents for Autonomous Open-ended Climate Science Analysis

ClimAgent:基于大语言模型的自主开放式气候科学分析智能体

Hao Wang, Jindong Han, Wei Fan, Hao Liu

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出ClimAgent框架,通过统一工具使用环境和严格推理协议,实现端到端建模与分析,在ClimaBench基准上相比原始LLM方案提升40.21%。

Comments It was submitted without the full consent of all co-authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08721 2026-06-01 cs.AR cs.LG cs.SE 57%

KernelCraft: Benchmarking for Agentic Close-to-Metal Kernel Generation on Emerging Hardware

KernelCraft: 面向新兴硬件的近底层内核生成的智能体基准测试

Jiayi Nie, Haoran Wu, Yao Lai, Zeyu Cao, Cheng Zhang, Binglei Lou, Erwei Wang, Jianyi Cheng, Timothy M. Jones, Robert Mullins, Rika Antonova, Yiren Zhao

机构 * Department of Computer Science and Technology, University of Cambridge, Cambridge, United Kingdom(计算机科学与技术系,剑桥大学,剑桥,英国) Department of Electrical and Electronic Engineering, Imperial College London, London, United Kingdom(电气与电子工程系,伦敦帝国理工学院,伦敦,英国) School of Informatics, University of Edinburgh, Edinburgh, United Kingdom(信息学院,爱丁堡大学,爱丁堡,英国)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出KernelCraft基准,通过函数调用和反馈驱动的工作流评估LLM智能体为新兴加速器生成和优化底层内核的能力,在多个任务上验证其能快速生成正确且高效的内核。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.10441 2026-06-01 cs.CL 57%

Goldfish: Monolingual Language Models for 350 Languages

Goldfish: 面向350种语言的单语语言模型

Tyler A. Chang, Catherine Arnett, Zhuowen Tu, Benjamin K. Bergen

机构 * Department of Cognitive Science(认知科学系) Department of Linguistics(语言学系) Department of Computer Science(计算机科学系) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 针对低资源语言,发现大型多语言模型在基本语法生成上不如双元模型,而小规模单语模型在困惑度和语法性基准上表现更优,并发布了覆盖350种语言的1000多个单语模型套件Goldfish。

Comments LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22971 2026-06-01 cs.AI 57%

SPM-Bench: Benchmarking Large Language Models for Scanning Probe Microscopy

SPM-Bench:面向扫描探针显微镜的大型语言模型基准测试

Peiyao Xiao, Xiaogang Li, Xinyi Gao, Chengliang Xu, Ben Wang, Zichao Chen, Zeyu Wang, Lin Qu, Bing Zhao, Hu Wei

机构 * Alibaba Group(阿里巴巴集团)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出SPM-Bench,一个全自动数据合成管道和严格评估指标(SIP-F1),用于测试LLMs在扫描探针显微镜领域的推理能力,并首次量化模型“个性”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13812 2026-06-01 cs.DB cs.AI cs.MA 57%

DTBench: A Synthetic Benchmark for Document-to-Table Extraction

DTBench:文档到表格提取的合成基准

Yuxiang Guo, Zhuoran Du, Nan Tang, Kezheng Tang, Congcong Ge, Yunjun Gao

机构 * Zhejiang University(浙江大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science(香港科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出DTBench合成基准,通过反向Table2Doc范式和多智能体合成流程生成文档,系统评估LLM在文档到表格提取中的多种能力。

Comments KDD26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04031 2026-06-01 cs.LG 57%

The Illusion of Generalization in Tabular Language Models

表格语言模型中的泛化错觉

Aditya Gorla, Ratish Puduppully

机构 * University of California, Los Angeles, USA(加州大学洛杉矶分校) IT University of Copenhagen, Denmark(哥本哈根IT大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 通过系统评估Tabula-8B在165个数据集上的表现,发现其声称的泛化能力主要源于评估伪影(如数据污染和格式熟悉度),而非真正的表格推理。

Journal ref In Proc. 43th International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-06-01 cs.CV 50%

The Regularizing Power of Language-Training Deepfake Detectors

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31066 2026-06-01 cs.RO 50%

Can Aerial VLA Models Cooperate? Evaluating Closed-Loop Air-Ground Coordination with CARLA-Air

空中VLA模型能协作吗?基于CARLA-Air的闭环空地协调评估

Tianle Zeng, Yanci Wen, Xueang Yu, Hong Zhang

机构 * Southern University of Science and Technology(南方科技大学) Fudan University(复旦大学)

专题命中 推理评测 :planning(abstract)

AI总结 本文通过构建CARLA-Air仿真环境,评估空中视觉-语言-动作模型在空地协作任务中的表现,发现当前模型难以将单智能体能力转化为稳定协作行为,并指出零样本协作需要伙伴状态显式感知、低延迟动作协调和团队目标对齐三个关键组件。

Comments Code at https://github.com/louiszengCN/CarlaAir

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 22 篇

2605.30832 2026-06-01 cs.AI 92%

SLAT: Segment-Level Adaptive Trimming for Efficient CoT Reasoning

SLAT:面向高效CoT推理的段级自适应修剪

Jian Yao, Xiongcai Luo, Ran Cheng, Kay Chen Tan

机构 * Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能学院,香港理工大学) The Hong Kong Polytechnic University-Daya Bay Technology and Innovation Research Institute, Huizhou,Guangdong Province, China(香港理工大学大亚湾科技与创新研究院,广东惠州市) The Hong Kong Polytechnic University Shenzhen Research Institute, Shenzhen, China(香港理工大学深圳研究院,深圳)

专题命中 其他推理 :CoT(title,title_cn);reasoning(title,abstract);chain-of-thought(abstract);分类 cs.AI

AI总结 提出段级自适应修剪框架SLAT,通过强化学习选择性抑制低边际效用的高概率冗余段,在保持准确率的同时将推理长度减少50%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30641 2026-06-01 cs.CL cs.AI 91%

COFT: Counterfactual-Conformal Decoding for Fair Chain-of-Thought Reasoning in Large Language Models

COFT: 用于大语言模型中公平思维链推理的反事实-保形解码

Arya Fayyazi, Mehdi Kamal, Massoud Pedram

机构 * Department of Electrical and Computer Engineering, University of Southern California, Los Angeles, California, USA(电气与计算机工程系,南加州大学,洛杉矶,加利福尼亚州,美国)

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出COFT,一种无需训练的解码方法,通过反事实提示和保形校准在解码时实现token级公平性控制,显著减少思维链生成中的社会偏见,同时保持任务效用和语言质量。

Comments Proceeding of ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31096 2026-06-01 cs.CV 87%

iVGR: Internalizing Visually Grounded Reasoning for MLLMs with Reinforcement Learning

iVGR: 通过强化学习将视觉基础推理内化到多模态大语言模型中

Chang-Bin Zhang, Yujie Zhong, Qiang Zhang, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Independent Researcher(独立研究者) University of Science and Technology of China(中国科学技术大学)

专题命中 其他推理 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract)

AI总结 提出iVGR框架,利用强化学习和双流训练策略将视觉定位能力内化到文本推理中,避免显式视觉基础在推理时的干扰,提升细粒度感知性能。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30934 2026-06-01 cs.CL cs.AI 81%

Do Large Language Models Encode Institutional Experience? Evidence from Cross-Linguistic Moral Reasoning Under Ambiguity

大型语言模型是否编码了制度经验?来自跨语言模糊道德推理的证据

Nattavudh Powdthavee

机构 * Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过跨语言道德困境实验,研究大型语言模型在模糊情境下是否通过语言编码制度经验,发现隐含制度线索会放大跨语言道德分歧,而明确框架则抑制这种差异。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30632 2026-06-01 cs.HC cs.AI cs.LG 81%

Rationalize: Shared Semantic Reasoning for Human-AI Alignment

Rationalize: 人机对齐的共享语义推理

Aritra Dasgupta, Naga Datha Saikiran Battula, Avina Nakarmi, Sohom Sen, Subhodeep Ghosh, Xun Song

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI、cs.LG

AI总结 提出Rationalize角色对框架,通过共享推理空间中的互补角色对(如探索者-引导者)实现人类与AI在数据驱动意义建构中的语义对齐,并设计元素级和角色特定的对齐评估方法。

Comments Accepted by ACM CHI 2026 BiAlign Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30391 2026-06-01 cs.MA cs.AI cs.CL 81%

Social Reasoning in Machines: Investigating Collective Truth-Seeking Dynamics in Large Language Model Debate

机器中的社会推理:探究大语言模型辩论中的集体求真动态

Tom Pecher

机构 * Department of Computer Science University of Bath(计算机科学系英国巴斯大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 通过多智能体辩论模拟论证推理理论,证明大语言模型集体辩论能显著提升基于问卷的求真任务性能,并提出利用辩论动态测量模型内在属性的新基准方法。

Comments Master's thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17101 2026-06-01 cs.CL cs.AI 81%

SEMA-RAG: A Self-Evolving Multi-Agent Retrieval-Augmented Generation Framework for Medical Reasoning

SEMA-RAG: 面向医学推理的自演化多智能体检索增强生成框架

Yongfeng Huang, Ruiying Chen, James Cheng

机构 * CSE, The Chinese University of Hong Kong(香港中文大学计算机科学与工程系) Wuhan University of Technology(武汉理工大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 针对医学问答中单轮静态检索与临床推理多阶段过程不匹配的问题,提出SEMA-RAG框架,通过任务解耦和动态多轮探索,由三个专业智能体分别负责临床解释、自演化检索和证据裁决,在多个基准上平均提升准确率6.46个百分点。

Comments Accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.05846 2026-06-01 cs.CL cs.AI 81%

EMCEE: Improving Multilingual Capability of LLMs via Bridging Knowledge and Reasoning with Extracted Synthetic Multilingual Context

EMCEE:通过提取合成多语言上下文桥接知识与推理以提升大语言模型的多语言能力

Hamin Koo, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 提出EMCEE框架,通过从LLM自身提取并融合语言特定知识,结合推理输出,显著提升多语言任务性能,尤其在低资源语言上平均提升31.7%。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20478 2026-06-01 cs.CV 78%

Video-MTR: Reinforced Multi-Turn Reasoning for Long Video Understanding

Video-MTR: 用于长视频理解的多轮强化推理

Yuan Xie, Tianshui Chen, Zheng Ge, Lionel Ni

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Guangdong University of Technology(广东工业大学) X-Era AI Lab(X-Era人工智能实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 提出Video-MTR框架,通过强化多轮推理迭代选择关键视频片段并理解问题,结合门控双层奖励系统实现端到端训练,在长视频理解基准上提升准确率和效率。

Comments Accepted by ICML 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏