arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-04-08 至 2026-04-08 共收录 107 信号源:cs.CL, cs.AI, cs.LG

1. 视觉空间推理 11 篇

2604.05497 2026-04-08 cs.AI cs.CV 85%

Thinking Diffusion: Penalize and Guide Visual-Grounded Reasoning in Diffusion Multimodal Language Models

Thinking Diffusion: 通过惩罚和引导在扩散多模态语言模型中抑制和引导视觉推理

Keuntae Kim, Mingyu Kang, Yong Suk Choi

机构 * Department of Computer Science, Hanyang University(汉阳大学计算机科学系) Department of Artificial Intelligence, Hanyang University(汉阳大学人工智能系)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.AI

AI总结 本文针对扩散多模态语言模型在视觉推理中生成过早答案的问题,提出位置与步数惩罚和视觉推理引导方法,提升推理准确率并加快推理速度。

Comments CVPR 2026 - main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05655 2026-04-08 cs.CL cs.AI cs.LG 85%

LLM Reasoning as Trajectories: Step-Specific Representation Geometry and Correctness Signals

大语言模型推理作为轨迹:步骤特定的表示几何与正确性信号

Lihao Sun, Hang Dong, Bo Qiao, Qingwei Lin, Dongmei Zhang, Saravan Rajmohan

机构 * Microsoft(微软)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究通过表示空间结构揭示大语言模型的推理过程,发现推理步骤在不同层深度下逐渐分离,晚期阶段正确与错误解的分歧可预测最终答案正确性,提出轨迹引导框架控制推理。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06022 2026-04-08 cs.CL 79%

BiMind: A Dual-Head Reasoning Model with Attention-Geometry Adapter for Incorrect Information Detection

BiMind:一种带有注意力-几何适配器的双头推理模型,用于错误信息检测

Zhongxing Zhang, Emily K. Vraga, Jisu Huh, Jaideep Srivastava

机构 * University of Minnesota, Twin Cities(明尼苏达大学双城分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.CL

AI总结 BiMind通过双头推理框架分离内容内部推理与知识增强推理,引入注意力几何适配器、自检索知识机制和不确定性感知融合策略,提升错误信息检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03054 2026-04-08 cs.CV cs.AI 79%

IBISAgent: Reinforcing Pixel-Level Visual Reasoning in MLLMs for Universal Biomedical Object Referring and Segmentation

IBISAgent: 通过MLLMs增强像素级视觉推理以实现通用生物医学对象指称与分割

Yankai Jiang, Qiaoru Li, Binlu Xu, Haoran Sun, Chao Ding, Junting Dong, Yuxiang Cai, Xuhong Zhang, Jianwei Yin

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出IBISAgent,通过多步决策过程增强MLLMs的像素级视觉推理能力,解决现有分割方法在隐式分割标记和迭代优化方面的不足,提升生物医学分割任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04638 2026-04-08 cs.AI cs.CL cs.IR 62%

Advancing AI Research Assistants with Expert-Involved Learning

通过专家参与学习推进AI研究助手

Tianyu Liu, Simeng Han, Hanchen Wang, Xiao Luo, Pan Lu, Biqing Zhu, Yuge Wang, Keyi Li, Jiapeng Chen, Rihao Qu, Yufeng Liu, Xinyue Cui, Aviv Yaish, Yuhang Chen, Minsheng Hao, Chuhan Li, Kexing Li, Yinsheng Lu, Xinyu Wei, Qinzhe Xing, Antonia Panescu, Mengbo Wang, Vibha Annaswamy, Alicia Sanchez, Jack Cloherty, Arman Cohan, Hua Xu, Mark Gerstein, James Zou, Hongyu Zhao

机构 * Yale University(耶鲁大学) Broad Institute of MIT and Harvard(麻省理工学院-哈佛大学博德研究所) Google DeepMind(谷歌DeepMind) Stanford University(斯坦福大学) Genentech(基因泰克) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ARIEL框架,通过专家验证任务评估大语言模型和多模态模型在生物医学领域的表现,发现提示工程和轻量级微调能提升文本覆盖,计算扩展策略增强视觉问答能力,构建了集成文本和视觉线索的AI助手,提出可检验的机理假设。

Comments 43 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10238 2026-04-08 cs.CV cs.AI 57%

ForgeryGPT: A Multimodal LLM for Interpretable Image Forgery Detection and Localization

ForgeryGPT: 一种多模态大语言模型用于可解释的图像伪造检测与定位

Fanrui Zhang, Jiawei Liu, Jiaying Zhu, Esther Sun, Dong Li, Qiang Zhang, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 ForgeryGPT通过多模态大语言模型捕捉伪造图像的高阶取证知识关联,实现可解释的图像伪造检测与定位,提升检测精度和交互能力。

Comments 13 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05525 2026-04-08 cs.GR 50%

CrowdVLA: Embodied Vision-Language-Action Agents for Context-Aware Crowd Simulation

CrowdVLA: 一种用于情境感知人群模拟的具身视觉-语言-动作代理

Juyeong Hwang, Seong-Eun Hong, Jinhyun Kim, JaeYoung Seon, Giljoo Nam, Hanyoung Jang, HyeongYeop Kang

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 CrowdVLA通过引入视觉-语言-动作代理,解决了人群模拟中监督不足、控制不稳定和数据偏差等问题,推动模拟从运动导向转向感知驱动的决策制定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05515 2026-04-08 cs.CV 50%

Geometrical Cross-Attention and Nonvoid Voxelization for Efficient 3D Medical Image Segmentation

几何交叉注意力与非空体素化用于高效3D医学图像分割

Chenxin Yuan, Shoupeng Chen, Haojiang Ye, Yiming Miao, Limei Peng, Pin-Han Ho

机构 * organization= Shenzhen Institute for Advanced Study , addressline= University of Electronic Science organization= School of Electrical Electronic Engineering , addressline= Nanyang Technological University , city= Singapore , postcode= 639798 , country= Singapore organization= School of Science Engineering , addressline= The Chinese University of Hong Kong, Shenzhen , city= Shenzhen , postcode= 518172 , state= Guangdong , country= China organization= School of Computer Science Engineering , addressline= Kyungpook National University , city= Daegu , postcode= 37224 , country= South Korea organization= Department of Electrical Computer Engineering , addressline= University of Waterloo , city= Waterloo , postcode= N2L3G1 , state= Ontario , country= Canada

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文提出GCNV-Net框架,结合3DNVT、GCA和非空体素化模块,通过动态体素划分和几何位置信息融合,提升3D医学图像分割的精度与效率,实现56.13%的FLOPs和68.49%的推理延迟降低。

Comments 20 pages, 13 figures, supplementary material included, submitted to Medical Image Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05375 2026-04-08 cs.MM 50%

DAT: Dual-Aware Adaptive Transmission for Efficient Multimodal LLM Inference in Edge-Cloud Systems

DAT:双重视觉与带宽感知的自适应传输,用于边缘-云计算系统中高效多模态大语言模型推理

Qi Guo, Zheming Yang, Yunqing Hu, Chang Zhao, Wen Ji

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出DAT方法,通过轻量级边缘模型过滤非目标帧并触发MLLM推理,结合高效微调策略和多流自适应传输优化,实现高效多模态大语言模型推理,提升语义生成质量与低延迟警报性能。

Comments 10 pages, 6 figures. Submitted to ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05210 2026-04-08 cs.CV 50%

Integration of Object Detection and Small VLMs for Construction Safety Hazard Identification

对象检测与小型视觉语言模型的整合用于建筑安全危险识别

Muhammad Adil, Mehmood Ahmed, Muhammad Aqib, Vicente A. Gonzalez, Gaang Lee, Qipei Mei

机构 * Infrastructure Human Tech (IHT) Lab, Department of Civil and Environmental Engineering, University of Alberta, Edmonton, Alberta, Canada(基础设施人类技术(IHT)实验室,土木与环境工程系,阿尔伯塔大学,埃德蒙顿,阿尔伯塔,加拿大)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文提出了一种结合对象检测与多模态推理的轻量级框架,以提高建筑工地安全危险识别的准确性和效率,实验表明该方法在多个小型视觉语言模型上均提升了检测性能和解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26788 2026-04-08 cs.RO cs.CV 50%

ReMemNav: A Rethinking and Memory-Augmented Framework for Zero-Shot Object Navigation

ReMemNav:一种重新思考和记忆增强的零样本物体导航框架

Feng Wu, Wei Zuo, Wenliang Yang, Jun Xiao, Yang Liu, Xinhua Zeng

机构 * Fudan University(复旦大学) Tongji University(同济大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 ReMemNav通过整合全景语义先验和事件记忆,改进了零样本物体导航中的空间推理和决策,提升了成功率和探索效率。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 测试时计算 7 篇

2604.05868 2026-04-08 cs.CL 79%

Understanding Performance Gap Between Parallel and Sequential Sampling in Large Reasoning Models

理解并行采样与顺序采样在大推理模型中的性能差距

Xiangming Gu, Soham De, Larisa Markeeva, Petar Veličković, Razvan Pascanu

机构 * Google DeepMind(谷歌DeepMind) National University of Singapore(新加坡国立大学)

专题命中 测试时计算 :reasoning(title,abstract);分类 cs.CL

AI总结 本文研究大推理模型中并行与顺序采样性能差异,发现并行采样表现更优,提出探索不足是主要原因。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05939 2026-04-08 cs.AI cs.HC 70%

Context-Value-Action Architecture for Value-Driven Large Language Model Agents

基于价值的大型语言模型代理的上下文-价值-行动架构

TianZe Zhang, Sirui Sun, Yuhang Xie, Xin Zhang, Zhiqiang Wu, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) Yuanpei College, Peking University(北京大学元培学院) School of Psychological and Cognitive Sciences, Peking University(北京大学心理与认知科学学院) Key Laboratory of Machine Perception (Ministry of Education), Peking University(北京大学机器感知重点实验室(教育部)) PKU-Wuhan Institute for Artificial Intelligence(北大武汉人工智能研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文提出CVA架构,通过价值验证器缓解价值极化,提升代理行为的准确性和可解释性。

Comments Accepted to Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05716 2026-04-08 cs.AI 70%

Can Large Language Models Reinvent Foundational Algorithms?

大语言模型能否重新发明基础算法?

Jian Zhao, Haoren Luo, Yu Wang, Yuhan Cao, Pingyue Sheng, Tianxing He

机构 * Xiongan AI Institute(雄安人工智能研究院) Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) Shanghai Qi Zhi Institute(上海期智研究院) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI

AI总结 本文研究大语言模型能否在受控环境中重新发明基础算法,通过Unlearn-and-Reinvent流程验证模型在无提示、低提示和高提示下的表现,发现生成验证器在推理过程中起到关键作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06013 2026-04-08 cs.AI cs.CL 62%

Epistemic Blinding: An Inference-Time Protocol for Auditing Prior Contamination in LLM-Assisted Analysis

知识盲区:一种用于审计LLM辅助分析中先验污染的推理时协议

Michael Cuccarese

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种在代理系统中用于审计LLM辅助分析中先验污染的推理时协议,通过替换实体标识符以匿名代码并比较输出与未盲对照组,以恢复审计性。

Comments code and LLM skill at: https://github.com/mcuccarese/epistemic-blinding 7 pages 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05250 2026-04-08 cs.LG cs.CL 62%

DualDiffusion: A Speculative Decoding Strategy for Masked Diffusion Models

DualDiffusion: 一种用于掩码扩散模型的推测解码策略

Satyam Goyal, Kushal Patel, Tanush Mittal, Arjun Laxman

机构 * University of Michigan(密歇根大学)

专题命中 测试时计算 :verifier(abstract);分类 cs.CL、cs.LG

AI总结 DualDiffusion结合高效近似模型与准确验证模型,通过多步轻量级生成后单步验证,实现生成步骤与准确性之间的更优帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04987 2026-04-08 cs.LG cs.AI math.OC stat.ML 62%

Cactus: Accelerating Auto-Regressive Decoding with Constrained Acceptance Speculative Sampling

Cactus:通过受约束的接受推测采样加速自动回归解码

Yongchang Hao, Lili Mou

机构 * Dept. Computing Science & Alberta Machine Intelligence Institute (Amii), University of Alberta(阿尔伯塔大学计算机科学系与阿尔伯塔机器智能研究所) Canada CIFAR AI Chair(加拿大CIFAR人工智能讲席)

专题命中 测试时计算 :verifier(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Cactus方法,通过受约束优化框架,在保证与验证器分布可控差异的同时提升接受率,有效解决传统推测采样在分布匹配上的限制问题。

Comments Camera-ready version. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18740 2026-04-08 cs.IR 50%

Multimodal Large Language Models with Adaptive Preference Optimization for Sequential Recommendation

具有自适应偏好优化的多模态大语言模型用于序列推荐

Yu Wang, Yonghui Yang, Le Wu, Yi Zhang, Fei Liu, Richang Hong

专题命中 测试时计算 :reasoning(abstract)

AI总结 本文提出HaNoRec框架,通过自适应偏好优化解决多模态序列推荐中的样本不平衡和跨模态语义偏差问题,提升推荐性能。

Comments Accepted by SIGIR 2026 (Full Paper)

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 复杂问题求解 10 篇

2604.05355 2026-04-08 cs.AI cs.CL 90%

ETR: Entropy Trend Reward for Efficient Chain-of-Thought Reasoning

ETR:熵趋势奖励用于高效推理链推理

Xuan Xiong, Huan Liu, Li Gu, Zhixiang Chi, Yue Qiu, Yuanhao Yu, Yang Wang

机构 * University of Toronto(多伦多大学) McMaster University(麦克马斯特大学) Concordia University(康考迪亚大学) University of Ottawa(渥太华大学)

专题命中 复杂问题求解 :reasoning(title,abstract);chain-of-thought(title,abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ETR,通过轨迹感知的目标促进逐步不确定性降低,提升推理效率与准确性,实验表明在多个基准上显著提升性能。

Comments ACL 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05620 2026-04-08 cs.CV cs.AI 79%

Semantic-Topological Graph Reasoning for Language-Guided Pulmonary Screening

语义-拓扑图推理用于语言引导的肺部筛查

Chenyu Xue, Yiran Liu, Mian Zhou, Jionglong Su, Zhixiang Lu

机构 * Xi’an Jiaotong-Liverpool University(西交利物浦大学) University College London(伦敦大学学院) University of Liverpool(利物浦大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出语义-拓扑图推理框架,结合大语言模型与视觉基础模型,解决临床报告语义模糊和低对比度扫描的解歧问题,实现高精度肺部筛查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05477 2026-04-08 cs.CL 79%

Don't Act Blindly: Robust GUI Automation via Action-Effect Verification and Self-Correction

不要盲目行动:通过动作-效果验证和自我修正实现鲁棒的GUI自动化

Yuzhe Zhang, Xianwei Xue, Xingyong Wu, Mengke Chen, Chen Liu, Xinran He, Run Shao, Feiran Liu, Huanmin Xu, Qiutong Pan, Haiwei Wang

机构 * Beijing University of Technology(北京工业大学) Baidu Inc.(百度公司)

专题命中 复杂问题求解 :self-correction(title);reasoning(abstract);分类 cs.CL

AI总结 本文提出VeriGUI框架,通过动作-效果验证和自我修正机制,解决GUI自动化中环境噪声导致的失败问题,提升恢复性能。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03741 2026-04-08 cs.CV 75%

I2E: From Image Pixels to Actionable Interactive Environments for Text-Guided Image Editing

I2E: 从图像像素到可操作的交互环境:用于文本引导的图像编辑

Jinghan Yu, Junhao Xiao, Chenyu Zhu, Jiaming Li, Jia Li, HanMing Deng, Xirui Wang, Guoli Jia, Jianjun Li, Xiang Bai, Bowen Zhou, Zhiyuan Ma

机构 * Huazhong University of Science and Technology(华中科技大学) Kuaishou Technology(快手科技) Central China Normal University(华中师范大学) Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 复杂问题求解 :reasoning(abstract);chain-of-thought(abstract);planning(abstract)

AI总结 I2E提出一种'分解-然后-行动'范式,通过分解器将无结构图像转换为可操作的对象层,并利用物理感知的视觉-语言-行动代理进行复杂指令解析,同时构建I2E-Bench基准测试集,实验表明其在处理复杂组合指令和保持物理合理性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06066 2026-04-08 cs.CL 70%

From Hallucination to Structure Snowballing: The Alignment Tax of Constrained Decoding in LLM Reflection

从幻觉到结构雪球效应:约束解码在LLM反思中的对齐税

Hongxu Zhou

机构 * Saarland University(萨尔大学)

专题命中 复杂问题求解 :reasoning(abstract);self-correction(abstract);分类 cs.CL

AI总结 研究探讨了在开放式推理任务中,约束解码通过强制结构反思是否能避免错误传播,发现反而引发结构雪球效应,并揭示了约束解码的对齐税问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05484 2026-04-08 cs.RO cs.CV 67%

CoEnv: Driving Embodied Multi-Agent Collaboration via Compositional Environment

CoEnv:通过组合环境驱动具身体验多智能体协作

Li Kang, Yutao Fan, Rui Li, Heng Zhou, Yiran Qin, Zhemeng Zhang, Songtao Huang, Xiufeng Song, Zaibin Zhang, Bruno N. Y. Chen, Zhenfei Yin, Dongzhan Zhou, Wangmeng Zuo, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) University of Science and Technology of China(中国科学技术大学) CUHK-Shenzhen(香港中文大学(深圳)) Fudan University(复旦大学) Dalian University of Technology(大连理工大学) Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学)

专题命中 复杂问题求解 :reasoning(abstract);planning(abstract)

AI总结 本文提出CoEnv框架,通过模拟与现实结合的组合环境,实现多智能体协作的高效执行与安全部署,提升任务成功率和效率。

Comments 31 pages, 8 figures, including supplementary material. Project page: https://faceong.github.io/CoEnv/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05201 2026-04-08 cs.AI cs.CL cs.CV 62%

MedGemma Technical Report

MedGemma 技术报告

Andrew Sellergren, Sahar Kazemzadeh, Tiam Jaroensri, Atilla Kiraly, Madeleine Traverse, Timo Kohlberger, Shawn Xu, Fayaz Jamil, Cían Hughes, Charles Lau, Justin Chen, Fereshteh Mahvar, Liron Yatziv, Tiffany Chen, Bram Sterling, Stefanie Anna Baby, Susanna Maria Baby, Jeremy Lai, Samuel Schmidgall, Lu Yang, Kejia Chen, Per Bjornsson, Shashir Reddy, Ryan Brush, Kenneth Philbrick, Mercy Asiedu, Ines Mezerreg, Howard Hu, Howard Yang, Richa Tiwari, Sunny Jansen, Preeti Singh, Yun Liu, Shekoofeh Azizi, Aishwarya Kamath, Johan Ferret, Shreya Pathak, Nino Vieillard, Ramona Merhej, Sarah Perrin, Tatiana Matejovicova, Alexandre Ramé, Morgane Riviere, Louis Rouillard, Thomas Mesnard, Geoffrey Cideron, Jean-bastien Grill, Sabela Ramos, Edouard Yvinec, Michelle Casbon, Elena Buchatskaya, Jean-Baptiste Alayrac, Dmitry Lepikhin, Vlad Feinberg, Sebastian Borgeaud, Alek Andreev, Cassidy Hardin, Robert Dadashi, Léonard Hussenot, Armand Joulin, Olivier Bachem, Yossi Matias, Katherine Chou, Avinatan Hassidim, Kavi Goel, Clement Farabet, Joelle Barral, Tris Warkentin, Jonathon Shlens, David Fleet, Victor Cotruta, Omar Sanseviero, Gus Martins, Phoebe Kirk, Anand Rao, Shravya Shetty, David F. Steiner, Can Kirmizibayrak, Rory Pilgrim, Daniel Golden, Lin Yang

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedGemma 是基于 Gemma 3 的医学视觉-语言基础模型,具备强大的医学理解和推理能力,在医疗多模态问答、胸部X光分类等任务中表现优异,同时保持通用能力,为医疗AI发展提供基础。

Comments Fix references

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05876 2026-04-08 cs.CL 57%

Mechanistic Circuit-Based Knowledge Editing in Large Language Models

基于机制电路的知识编辑在大语言模型中

Tianyi Zhao, Yinhan He, Wendy Zheng, Chen Chen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文提出MCircKE框架,通过识别因果电路实现精准的知识编辑,解决大语言模型在动态环境中更新知识时的推理缺口问题,提升多跳推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05522 2026-04-08 cs.CL 57%

Cross-Modal Coreference Alignment: Enabling Reliable Information Transfer in Omni-LLMs

跨模态指代对齐:在全模态大语言模型中实现可靠信息传输

Hongcheng Liu, Yuhao Wang, Zhe Chen, Pingjie Wang, Zhiyuan Zhu, Yixuan Hou, Yanfeng Wang, Yu Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 研究提出跨模态指代对齐问题,通过CrossOmni数据集和两种方法提升全模态推理能力,揭示指代意识缺失是跨模态推理弱化的主要原因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05273 2026-04-08 cs.CL 57%

Beneath the Surface: Investigating LLMs' Capabilities for Communicating with Subtext

表层之下:研究LLMs在使用隐喻沟通中的能力

Kabir Ahuja, Yuxuan Li, Andrew Kyle Lampinen

机构 * Google DeepMind(谷歌DeepMind) University of Washington(华盛顿大学)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.CL

AI总结 本文研究语言模型是否能利用隐喻进行沟通,并引入四个新评估套件。发现前沿模型倾向于过于直白的沟通,但在某些情况下能通过共同基础减少直白线索,但难以推断隐含的共同基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 推理评测 32 篇

2604.05114 2026-04-08 cs.CL cs.AI cs.LG 83%

$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models

$π^2$:结构起源的推理数据提升大语言模型的长上下文推理能力

Quyet V. Do, Thinh Pham, Nguyen Nguyen, Sha Li, Pratibha Zunjare, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出$π^2$方法,通过结构化数据生成高质量推理数据,提升大语言模型的长上下文推理能力,在四个基准测试中取得显著改进。

Comments Our structured analytical reasoning data, which originates from Wikipedia tables, significantly improves long-context reasoning capability of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05364 2026-04-08 cs.AI 79%

TFRBench: A Reasoning Benchmark for Evaluating Forecasting Systems

TFRBench:用于评估预测系统推理能力的基准测试

Md Atik Ahamed, Mihir Parmar, Palash Goyal, Yiwen Song, Long T. Le, Qiang Cheng, Chun-Liang Li, Hamid Palangi, Jinsung Yoon, Tomas Pfister

机构 * Google(谷歌) University of Kentucky(肯塔基大学)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.AI

AI总结 TFRBench通过多智能体框架评估预测系统推理能力,提升预测准确性,验证了其在时间序列预测中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏