arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-29 至 2026-04-29 共收录 226 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 40 篇

2604.24832 2026-04-29 cs.LG cs.AI 88%

On the Trainability of Masked Diffusion Language Models via Blockwise Locality

通过块级局部性训练掩码扩散语言模型

Yuxiang Wang, Yu Xiang, Baojian Zhou, Qifang Zhao, Keyue Jiang, Yanghua Xiao, Xiaoxiao Xu

机构 * Fudan University, Shanghai, China(复旦大学,上海,中国) Alibaba Group, China(阿里巴巴集团,中国)

专题命中 推理与问题求解 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过块级局部性改进掩码扩散语言模型,发现其在结构生成任务中稳定性不足,提出Jigsaw和Scatter模型提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25039 2026-04-29 cs.CL cs.AI 87%

Dual-Track CoT: Budget-Aware Stepwise Guidance for Small LMs

双轨CoT:面向小语言模型的预算感知逐步引导

Sagnik Chatterjee, Atharva Patil, Sricharan Ramesh

专题命中 推理与问题求解 :SLM(abstract,abstract_cn);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出双轨CoT方法,旨在通过预算感知的逐步引导提升小语言模型的多步推理能力,解决传统方法在计算和token预算限制下的性能瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25684 2026-04-29 cs.AI 86%

Think Before You Act -- A Neurocognitive Governance Model for Autonomous AI Agents

在行动前思考--一种用于自主AI代理的神经认知治理模型

Eranga Bandara, Ross Gore, Asanga Gunaratna, Sachini Rajapakse, Isurunima Kularathna, Ravi Mukkamala, Sachin Shetty, Xueping Liang, Amin Hass, Tharaka Hewa, Abdul Rahman, Christopher K. Rhea, Anita H. Clayton, Preston Samuel, Atmaram Yarlagadda

机构 * Old Dominion University(老奥德纳大学) AI Motion Labs(AI运动实验室) Department of Psychiatry and Neurobehavioral Sciences(精神病学与神经行为科学系) University of Virginia School of Medicine(弗吉尼亚大学医学院) Florida International University(佛罗里达国际大学) Accenture Technology Labs(埃森哲技术实验室) Center for Wireless Communications(无线通信中心) University of Oulu(奥卢大学) Blanchfield Army Community Hospital(布莱恩菲尔德陆军社区医院) McDonald Army Health Center(麦克唐纳陆军健康中心)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种神经认知治理框架,通过将人类自我治理过程映射到LLM驱动的代理推理中,实现95%的合规准确率和零人工监督升级,展示嵌入治理的代理推理能产生更一致、可解释和可审计的合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05205 2026-04-29 cs.CL 86%

RELIC: Evaluating Complex Reasoning via the Recognition of Languages In-Context

RELIC:通过上下文语言识别评估复杂推理

Jackson Petty, Michael Y. Hu, Wentao Wang, Shauli Ravfogel, William Merrill, Tal Linzen

机构 * Department of Linguistics(语言学系) Center for Data Science(数据科学中心) New York University(纽约大学)

专题命中 推理与问题求解 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 RELIC通过评估语言是否属于上下文无关文法生成的语言,衡量LLM的复杂推理能力,发现先进模型在任务复杂度增加时推理计算减少,策略转向猜测。

Comments Accepted to TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24831 2026-04-29 cs.SE cs.LG 83%

FGDM: Reasoning Aware Multi-Agentic Framework for Software Bug Detection using Chain of Thought and Tree of Thought Prompting

FGDM:基于推理的多智能体框架用于软件缺陷检测的链式思维和树式思维提示

Srita Padmanabhuni, Bhargavi Karuturi, Jerusha Karen Indupalli, Santhan Reddy Chilla, Vivek Yelleti

机构 * SRM University, Andhra Pradesh(安得拉邦SRM大学)

专题命中 推理与问题求解 :prompting(title);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出FGDM框架,利用链式思维和树式思维提示,通过流程图识别代码错误并生成修复代码,有效提升大型代码库中缺陷检测的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25482 2026-04-29 cs.CL cs.AI 82%

From World-Gen to Quest-Line: A Dependency-Driven Prompt Pipeline for Coherent RPG Generation

从World-Gen到Quest-Line:一种依赖驱动的提示管道用于连贯的RPG生成

Dominik Borawski, Marta Szulc, Robert Chudy, Małgorzata Giedrowicz, Piotr Mironowicz

机构 * Gdańsk University of Technology(格但斯克技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种依赖驱动的提示管道,通过结构化中间表示建模叙事依赖,以生成连贯的RPG内容。该方法通过分阶段生成世界构建、NPC创建、玩家角色创建、战役级任务规划和任务扩展,减少叙事漂移并支持可扩展的叙事元素生成。

Comments 13 pages, 1 figure, 5 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25419 2026-04-29 cs.AI 81%

JURY-RL: Votes Propose, Proofs Dispose for Label-Free RLVR

JURY-RL: 选票提议,证明判定用于无标签的RLVR

Xinjie Chen, Biao Fu, Jing Wu, Guoxin Chen, Xinggao Liu, Dayiheng Liu, Minpeng Liao

机构 * Zhejiang University, Hangzhou, China(浙江大学,杭州,中国) Tongyi Lab, Alibaba Group, Hangzhou, China(通义实验室,阿里巴巴集团,杭州,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 JURY-RL提出一种无标签RLVR框架,通过模型回放提议候选答案,形式验证器判定是否可获正奖,从而稳定训练并提升数学推理性能。

Comments Preprint. 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24996 2026-04-29 cs.AI 81%

Sparse Personalized Text Generation with Multi-Trajectory Reasoning

稀疏个性化文本生成与多轨迹推理

Bo Ni, Haowei Fu, Qinwen Ge, Franck Dernoncourt, Samyadeep Basu, Nedim Lipka, Seunghyun Yoon, Yu Wang, Nesreen K. Ahmed, Subhojyoti Mukherjee, Puneet Mathur, Ryan A. Rossi, Tyler Derr

机构 * Department of Computer Science, Vanderbilt University, Nashville, Tennessee(范德比尔特大学计算机科学系) Adobe Research, San Jose, California(Adobe研究) University of Orgeon, Eugene, Oregon(奥尔戈恩大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出PAT框架,通过双轨迹检索和强化学习机制提升冷启动场景下个性化文本生成的质量和对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21598 2026-04-29 cs.SE cs.AI 81%

You Don't Need Public Tests to Generate Correct Code

你不需要公共测试来生成正确代码

Kaushitha Silva, Srinath Perera

机构 * WSO2(WSO2公司)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DryRUN框架,通过让大语言模型自主生成测试输入并模拟执行,避免依赖公共测试用例,从而减少过自信偏差并提升代码生成效率。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16558 2026-04-29 cs.CR cs.AI 81%

A First Look at the Security Issues in the Model Context Protocol Ecosystem

对模型上下文协议生态系统安全问题的首次观察

Xiaofan Li, Xing Gao

机构 * University of Delaware, USA(德克萨斯大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文首次研究了模型上下文协议生态系统中的跨实体安全问题,揭示了注册表层面的漏洞和代码层面的攻击风险,提出了MCPInspect工具检测漏洞和可疑元数据。

Comments This paper has been accepted to DSN 2026. The title has been updated from the anonymous submission version used during double-blind review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16918 2026-04-29 cs.CV 80%

AdaTooler-V: Adaptive Tool-Use for Images and Videos

AdaTooler-V:面向图像和视频的自适应工具使用

Chaoyang Wang, Kaituo Feng, Dongyang Chen, Zhongyu Wang, Zhixun Li, Sicheng Gao, Meng Meng, Xu Zhou, Manyuan Zhang, Yuzhang Shang, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MML实验室) THU(清华大学) SJTU(上海交通大学) DB Group, CUHK(香港中文大学DB小组) UCF(佛罗里达大学) Sangfor(Sangfor公司) JMU(约翰·霍普金斯大学)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AdaTooler-V,通过自适应工具使用提升多模态大语言模型的视觉推理能力,通过强化学习算法和定制数据集优化工具调用策略,实验证明其在多种视觉任务中表现优异。

Comments ACL 2026 Findings, Project page: https://github.com/CYWang735/AdaTooler-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03043 2026-04-29 cs.CV 80%

OneThinker: All-in-one Reasoning Model for Image and Video

OneThinker:面向图像和视频的统一推理模型

Kaituo Feng, Manyuan Zhang, Hongyu Li, Kaixuan Fan, Shuang Chen, Yilei Jiang, Dian Zheng, Peiwen Sun, Yiyuan Zhang, Haoze Sun, Yan Feng, Peng Pei, Xunliang Cai, Xiangyu Yue

机构 * MMLab, CUHK(CUHK多媒体实验室) Meituan Home(美团家)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 OneThinker提出一个统一的多模态推理模型,整合图像和视频理解,涵盖问答、描述生成、空间时间定位、跟踪和分割等任务,通过构建大规模训练语料和EMA-GRPO算法提升多任务强化学习效果。

Comments CVPR 2026, Project page: https://github.com/tulerfeng/OneThinker

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25276 2026-04-29 cs.CV 80%

OmniVTG: A Large-Scale Dataset and Training Paradigm for Open-World Video Temporal Grounding

OmniVTG:一种大规模数据集和开放世界视频时间定位的训练范式

Minghang Zheng, Zihao Yin, Yi Yang, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室) Central Media Technology Institute, Huawei Technologies Ltd.(华为技术有限公司中央媒体技术研究所) PKU-WUHAN Institute for Artificial Intelligence, Peking University(北京大学武汉人工智能研究所)

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出OmniVTG数据集和Self-Correction Chain-of-Thought训练范式,通过语义覆盖迭代扩展管道构建大规模数据集,并利用多模态大语言模型的密集描述能力提升视频时间定位性能。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25155 2026-04-29 eess.SP 80%

Rethinking Wireless Communications through Formal Mathematical AI Reasoning

通过形式数学AI推理重新思考无线通信

Changyuan Zhao, Jiacheng Wang, Dusit Niyato, Zan Li, Abbas Jamalipour, Shiwen Mao, Xianbin Wang, Dong In Kim

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出通过形式数学AI推理重新构建无线通信理论,提出验证、推导和发现三层框架,推动无线数学知识的建立。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-04-29 cs.CV cs.AI 79%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16518 2026-04-29 cs.RO cs.CL cs.CV 79%

MiMo-Embodied: X-Embodied Foundation Model Technical Report

MiMo-Embodied:X-Embodied基础模型技术报告

Xiaoshuai Hao, Lei Zhou, Zhijian Huang, Zhiwen Hou, Yingbo Tang, Lingfeng Zhang, Guang Li, Zheng Lu, Shuhuai Ren, Xianhui Meng, Yuchen Zhang, Jing Wu, Jinghui Lu, Chenxu Dang, Jiayi Guan, Jianhua Wu, Zhiyi Hou, Hanbing Li, Shumeng Xia, Mingliang Zhou, Yinan Zheng, Zihao Yue, Shuhao Gu, Hao Tian, Yuannan Shen, Jianwei Cui, Wen Zhang, Shaoqing Xu, Bing Wang, Haiyang Sun, Zeyu Zhu, Yuncheng Jiang, Zibin Guo, Chuhong Gong, Chaofan Zhang, Wenbo Ding, Kun Ma, Guang Chen, Rui Cai, Diyun Xiang, Heng Qu, Fuli Luo, Hangjun Ye, Long Chen

机构 * Xiaomi Embodied Intelligence Team(小米具身智能团队)

专题命中 推理与问题求解 :foundation model(title,abstract);分类 cs.CL

AI总结 MiMo-Embodied是首个跨具身基础模型,成功整合并实现自动驾驶和具身AI领域的最先进性能,在17个具身AI基准和12个自动驾驶基准中均取得新纪录,通过多阶段学习、数据构建和CoT/RL微调实现领域间的强正迁移。

Comments Code: https://github.com/XiaomiMiMo/MiMo-Embodied | Model: https://huggingface.co/XiaomiMiMo/MiMo-Embodied-7B

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19699 2026-04-29 cs.CL cs.CY 77%

Epistemic orientation in parliamentary discourse is associated with deliberative democracy

议会话语中的认知倾向与 deliberative democracy 的关联

Segun Aroyehun, Stephan Lewandowsky, David Garcia

机构 * Department of Politics and Public Administration, University of Konstanz(康斯坦茨大学政治与公共行政系) School of Psychological Science, University of Bristol(布里斯托大学心理学科学学院) Complexity Science Hub(复杂性科学中心) Department of Psychology, University of Potsdam(波茨坦大学心理学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究通过EMI评分分析议会话语中的认知倾向,发现其与democratic deliberation和治理质量正相关,揭示政治话语的认知特性对民主和治理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24179 2026-04-29 cs.CL cs.AI 73%

MemeScouts@LT-EDI 2026: Asking the Right Questions -- Prompted Weak Supervision for Meme Hate Speech Detection

MemeScouts@LT-EDI 2026:问对问题——针对弱监督的提示方法用于表情包仇恨言论检测

Ivo Bueno, Lea Hirlimann, Enkelejda Kasneci

机构 * Technical University of Munich(慕尼黑技术大学) LMU Munich(慕尼黑大学) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 推理与问题求解 :language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种提示弱监督方法,通过分解表情包理解为基于问题的标注函数,提升多语言多模态仇恨言论检测效果,尤其在中文和印地语中表现突出。

Comments Accepted at Sixth Workshop on Language Technology for Equality, Diversity and Inclusion at ACL2026 (LT-EDI@ACL26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25423 2026-04-29 cs.CL cs.AI 73%

Do LLMs Capture Embodied Cognition and Cultural Variation? Cross-Linguistic Evidence from Demonstratives

大语言模型能捕捉具身认知和文化差异吗?来自跨语言证据的示范词研究

Yu Wang, Emmanuele Chersoni, Chu-Ren Huang

机构 * Department of Language Science and Technology(语言科学与技术系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文通过示范词研究探讨大语言模型对具身认知和文化差异的捕捉能力,发现人类在视角转换和距离判断上存在文化差异,而LLMs则缺乏这种理解且默认英语中心化推理。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14862 2026-04-29 cs.CL cs.AI 73%

Schema Key Wording as an Instruction Channel in Structured Generation under Constrained Decoding

模式键作为在受限解码下的指令通道在结构生成中的应用

Yifan Le

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨了在受限解码中模式键作为隐式指令通道的作用,提出结构生成是多通道指令问题,并通过实验展示模式键词汇对准确性的影响,揭示了不同模型对不同通道的依赖性。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14174 2026-04-29 cs.CL cs.LG 73%

Cheaper, Better, Faster, Stronger: Robust Text-to-SQL without Chain-of-Thought or Fine-Tuning

更便宜、更好、更快、更强:无需链式思维或微调的鲁棒性文本到SQL

Yusuf Denizay Dönder, Derek Hommel, Andrea W Wen-Yi, David Mimno, Unso Eun Seo Jo

机构 * Gena Co.(Gena公司) Cornell University(康奈尔大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出N-rep一致性方法,通过多重表示缓解单一表示的弱点,以更低成本实现与更昂贵方法相似的BIRD基准表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25521 2026-04-29 cs.AI 70%

Automated Adversarial Collaboration for Advancing Theory Building in the Cognitive Sciences

自动化对抗协作促进认知科学理论构建

Suyog Chandramouli, George Kachergis, Akshay Jagadish

机构 * Department of Psychology, Princeton University(普林斯顿大学心理学系) Department of Psychology, Stanford University(斯坦福大学心理学系) Princeton AI Lab, Princeton University(普林斯顿大学人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出自动化对抗协作框架,通过闭环模拟验证认知科学理论 adjudication,展示了在噪声环境下恢复真实理论的可行性。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25506 2026-04-29 cs.NI cs.AI 70%

Assistants, Not Architects: The Role of LLMs in Networked Systems Design

助手,而非架构师:大语言模型在联网系统设计中的作用

Pratyush Sahu, Rahul Bothra, Venkat Arun, Brighten Godfrey, Akshay Narayan, Ahmed Saeed

机构 * Georgia Tech(佐治亚理工学院) UIUC(伊利诺伊大学香槟分校) UT Austin(得克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在联网系统架构设计中的局限性,并提出Kepler框架,结合专家驱动的规范与SMT优化,实现可行的设计方案并支持可解释的设计探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25444 2026-04-29 cs.CL 70%

One Refiner to Unlock Them All: Inference-Time Reasoning Elicitation via Reinforcement Query Refinement

一个refiner解锁所有:通过强化查询细化实现推理时间推理 elicitation

Yixiao Zhou, Dongzhou Cheng, zhiliang wu, Yi Yang, Yu Cheng, Hehe Fan

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出ReQueR框架,通过强化学习训练专门的Refiner策略,将推理 elicitation作为推理时间对齐任务,实现对多种模型的推理能力解锁,提升性能2.1%。

Comments Accepted to ACL26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15473 2026-04-29 cs.AI 70%

Agent Lifecycle Toolkit (ALTK): Reusable Middleware Components for Robust AI Agents

智能体生命周期工具包(ALTK):用于鲁棒AI智能体的可重用中间件组件

Zidane Wright, Jason Tsay, Anupama Murthi, Osher Elhadad, Diego Del Rio, Saurabh Goyal, Kiran Kate, Jim Laredo, Koren Lazar, Vinod Muthusamy, Yara Rizk

机构 * IBM Research(IBM研究院) IBM

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 ALTK通过模块化中间件组件系统性解决智能体全生命周期中的故障模式问题,提供一致接口并兼容低代码工具,显著降低构建可靠生产级智能体的难度。

Comments to appear in CAIS 2026 demonstration track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13730 2026-04-29 cs.IR cs.AI 70%

R3-REC: Reasoning-Driven Recommendation via Retrieval-Augmented LLMs over Multi-Granular Interest Signals

R3-REC:通过多粒度兴趣信号增强的检索增强型大语言模型推荐

Yuchen Miao, Mingxuan Cui, Yitong Zhu, Yu Wang, Siyang Xu

机构 * Sydney Smart Technology College, Northeastern University, China(悉尼智能技术学院,东北大学,中国)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文针对序列推荐中的证据不足和动态多维意图建模问题,提出R3-REC框架,通过多级用户意图推理、物品语义提取等模块提升推荐效果,实验显示在多个数据集上优于基线模型。

Comments 5 pages, 4 figures, 2 tables. Accepted to the 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

Journal ref ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), pp. 5951-5955, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16198 2026-04-29 cs.CL 70%

OMHBench: Benchmarking Balanced and Grounded Omni-Modal Multi-Hop Reasoning

OMHBench: 多模态多跳推理的基准测试

Seunghee Kim, Ingyu Bang, Seokgyu Jang, Changhyeon Kim, Sanghwan Bae, Jihun Choi, Richeng Xuan, Taeuk Kim

机构 * Hanyang University(翰阳大学) NAVER Cloud(NAVER云) Knowledge Work Inc.(知识工作公司) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Sony AI(索尼人工智能)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 OMHBench通过平衡的多模态多跳推理评估框架,揭示了多模态大语言模型在多模态接地方面的不均衡性,发现专有模型与开源模型性能差距显著,且对推理路径变化敏感。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25683 2026-04-29 cs.IR 67%

K-CARE: Knowledge-driven Symmetrical Contextual Anchoring and Analogical Prototype Reasoning for E-commerce Relevance

K-CARE:基于知识的对称上下文锚定与类比原型推理用于电商相关性

Chen Yifei, Tian Zhixing, Wang Chenyang, Cheng Ziguang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 K-CARE通过结合外部知识与类比推理,解决电商搜索中因知识边界缺失导致的相关性问题,显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25399 2026-04-29 cs.SE 67%

CoRE: A Fine-Grained Code Reasoning Benchmark Beyond Output Prediction

CoRE:超越输出预测的细粒度代码推理基准

Jun Gao, Yun Peng, Qian Qiao, Changhai Zhou, Yuhua Zhou, Shiyang Zhang, Shichao Weng, Zhenchang Xing, Xiaoxue Ren

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 CoRE基准通过实现不变性和过程透明性评估代码推理,揭示大语言模型在等价实现间存在显著鲁棒性差距,并发现模型可能通过表面执行达到正确输出,表明仅评估输出不足以衡量代码推理能力。

Comments ACL'26 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25299 2026-04-29 cs.CV cs.AI 57%

The Thinking Pixel: Recursive Sparse Reasoning in Multimodal Diffusion Latents

思考像素:多模态扩散潜在中的递归稀疏推理

Yuwei Sun, Yuxuan Yao, Hui Li, Siyu Zhu

机构 * Shanghai Academy of AI for Science(上海人工智能科学研究院) Fudan University(复旦大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出一种递归稀疏混合专家框架,用于提升多模态文本生成任务中视觉token的生成质量,通过递归机制和稀疏参数共享提高生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏