arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-23 至 2026-03-23 共收录 90 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 22 篇

2603.19252 2026-03-23 cs.CL cs.AI 81%

GeoChallenge: A Multi-Answer Multiple-Choice Benchmark for Geometric Reasoning with Diagrams

GeoChallenge: 一个用于基于图表的几何推理的多答案多选基准

Yushun Zhang, Weiping Fu, Zesheng Yang, Bo Zhao, Lingling Zhang, Jian Zhang, Yumeng Fu, Jiaxing Huang, Jun Liu

机构 * School of Computer Science and Technology, Xi’an Jiaotong University(西安交通大学计算机科学与技术学院) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 GeoChallenge通过9万个多步骤几何证明问题,评估大语言模型的符号推理能力,揭示模型在多选设置下的精确匹配失败、视觉依赖弱和推理扩展不足等问题。

Comments 18 pages, 10 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07558 2026-03-23 cs.LG cs.CV 79%

ReLaX: Reasoning with Latent Exploration for Large Reasoning Models

ReLaX:基于潜在探索的大型推理模型推理

Shimin Zhang, Xianwei Chen, Yufan Shen, Ziyuan Ye, Jibin Wu

机构 * Hong Kong Polytechnic University(香港理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.LG

AI总结 ReLaX通过引入潜在动态分析,提升大型推理模型的探索与利用平衡,通过动态谱分散度度量潜在动态异质性,优于现有token级方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20148 2026-03-23 cs.CV 78%

Can Large Multimodal Models Inspect Buildings? A Hierarchical Benchmark for Structural Pathology Reasoning

大型多模态模型能否检查建筑?一种用于结构病理推理的分层基准

Hui Zhong, Yichun Gao, Luyan Liu, Hai Yang, Wang Wang, Haowei Zhang, Xinhu Zheng

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong University(香港大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出DefectBench基准,评估大型多模态模型在建筑表面检测中的能力,发现其在拓扑理解和语义理解方面表现优异,但在精确定位方面存在不足,并验证了零样本生成分割的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19607 2026-03-23 cs.CV 78%

Physion-Eval: Evaluating Physical Realism in Generated Video via Human Reasoning

Physion-Eval:通过人类推理评估生成视频的物理真实性

Qin Zhang, Peiyu Jing, Hong-Xing Yu, Fangqiang Ding, Fan Nie, Weimin Wang, Yilun Du, James Zou, Jiajun Wu, Bing Shuai

机构 * Physion Labs(Physion实验室) Stanford University(斯坦福大学) MIT(麻省理工学院) Harvard University(哈佛大学) Character AI

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出Physion-Eval基准,通过专家人类推理评估生成视频的物理真实性,揭示当前视频生成模型在物理关键场景中存在显著缺陷,83.3%的外向视角和93.5%的内向视角视频存在可识别的物理错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12788 2026-03-23 cs.CV 78%

Think and Answer ME: Benchmarking and Exploring Multi-Entity Reasoning Grounding in Remote Sensing

思考并回答ME:基准测试和探索遥感中的多实体推理 grounding

Shuchang Lyu, Haiquan Wen, Guangliang Cheng, Meng Li, Zheng Zhou, You Zhou, Dingding Yao, Zhenwei Shi

机构 * Beihang University, Beijing, China(北京航空航天大学) University of Liverpool, Liverpool, UK(利物浦大学) Institute of Acoustics, Chinese Academy of Sciences, Beijing, China(中国科学院声学研究所)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出ME-RSRG基准数据集,通过Entity-Aware Reasoning框架提升遥感多实体推理能力,验证了该框架的有效性。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19468 2026-03-23 cs.SD eess.AS 78%

Listen First, Then Answer: Timestamp-Grounded Speech Reasoning

先听再回答:基于时间戳的语音推理

Jihoon Jeong, Pooneh Mousavi, Mirco Ravanelli, Cem Subakan

机构 * Mila-Quebec AI Institute(魁北克AI研究所) Université Laval(拉瓦尔大学) Concordia University(康科迪亚大学)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 本文提出基于强化学习的时间戳接地策略,使语音大模型在推理时更关注音频内容,提升多模态推理的准确性。

Comments Submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19765 2026-03-23 cs.CV 75%

FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs

FREAK:一种用于高级MLLMs细粒度幻觉评估的基准测试

Zhihan Yin, Jianxin Liang, Yueqian Wang, Yifeng Yao, Huishuai Zhang, Dongyan Zhao

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王学苑计算机技术研究所) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出FREAK基准测试,通过高质量图像评估MLLMs在细粒度视觉感知中的幻觉问题,揭示了现有模型在详细视觉感知上的严重幻觉问题。

Comments 34 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14184 2026-03-23 cs.LG cs.AI cs.CL 67%

MAFA: A Multi-Agent Framework for Enterprise-Scale Annotation with Configurable Task Adaptation

MAFA:一种用于企业级标注的多智能体框架,支持可配置的任务适应

Mahmood Hegazy, Aaron Rodrigues, Azzam Naeem

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAFA通过可配置的多智能体协作解决金融行业标注积压问题,实现86%的人工标注一致性,每年节省5000小时人工标注工作,提升标注准确率和效率。

Journal ref AAAI Conference on Artificial Intelligence 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19615 2026-03-23 cs.SD cs.AI cs.CL 62%

CAF-Score: Calibrating CLAP with LALMs for Reference-free Audio Captioning Evaluation

CAF-Score: 通过LALMs校准CLAP用于无参考音频描述评估

Insung Lee, Taeyoung Jeong, Haejun Yoo, Du-Seong Chang, Myoung-Wan Koo

机构 * Department of Artificial Intelligence, Sogang University, South Korea(人工智能系,ソガン大学,韩国)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CAF-Score,一种无参考音频描述评估指标,通过结合对比音频-文本嵌入与LALM推理,有效检测语法不一致和细微幻觉,实验表明其在BRACE基准上与人类判断相关性最高。

Comments A condensed version of this work has been submitted to Interspeech 2026. Section 10 is an extended analysis added in this version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19281 2026-03-23 cs.CL cs.AI cs.IR 62%

URAG: A Benchmark for Uncertainty Quantification in Retrieval-Augmented Large Language Models

URAG:一种用于检索增强大型语言模型不确定性量化的基准

Vinh Nguyen, Cuong Dang, Jiahao Zhang, Hoa Tran, Minh Tran, Trinh Chau, Thai Le, Lu Cheng, Suhang Wang

机构 * Uppsala University(乌普萨拉大学) University of Science, VNU-HCM(VNU-HCM大学) Indiana University(印第安纳大学) FPT Software, AI Center(FPT软件人工智能中心) The Pennsylvania State University(宾夕法尼亚州立大学) VNU University of Engineering(VNU工程大学) University of Illinois at Chicago(伊利诺伊大学芝加哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 URAG通过构建多选问答任务评估RAG系统在医疗、编程、科学、数学等领域的不确定性,揭示准确性与不确定性的关系及不同RAG方法的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19274 2026-03-23 cs.CL cs.AI 62%

CURE: A Multimodal Benchmark for Clinical Understanding and Retrieval Evaluation

CURE:临床理解和检索评估的多模态基准

Yannian Gu, Zhongzhen Huang, Linjie Mu, Xizhuo Zhang, Shaoting Zhang, Xiaofan Zhang

机构 * Shanghai Jiao Tong University, Shanghai, China(上海交通大学) SenseTime Research, China(商汤研究院) Shanghai Innovation Institute, Shanghai, China(上海创新研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 CURE基准通过控制证据环境评估多模态模型的推理与检索能力,揭示模型在依赖权威文献时性能显著下降,强调整合临床证据与精确检索的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19268 2026-03-23 cs.CL cs.AI 62%

Full-Stack Domain Enhancement for Combustion LLMs: Construction and Optimization

面向燃烧科学的全栈领域增强:构建与优化

Quanjia Xiao, Weimin Ouyang, Zonglin Yang, Tianhao Wu, Qingguo Zhou, Runze Mao, Zhi X. Chen

机构 * Peking University(北京大学) AI for Science Institute, Beijing(AI for Science研究院,北京)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出首个针对燃烧科学的全栈领域增强LLM工作流程,整合自动领域语料构建、增量预训练、指令微调及可验证奖励强化学习,构建标准化评估基准FlameBench,显著提升燃烧科学推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19974 2026-03-23 cs.CR cs.AI 57%

Trojan's Whisper: Stealthy Manipulation of OpenClaw through Injected Bootstrapped Guidance

Trojan's Whisper:通过注入的Bootstrap引导 stealthily操纵OpenClaw

Fazhong Liu, Zhuoyan Chen, Tu Lan, Haozhen Tan, Zhenyu Xu, Xiang Li, Guoxing Chen, Yan Meng, Haojin Zhu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了通过注入引导文件进行的隐蔽攻击,揭示了自主代理生态系统设计中的根本矛盾,强调了基于能力隔离、运行时策略执行和透明引导溯源的防御需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19935 2026-03-23 cs.LG 57%

Memori: A Persistent Memory Layer for Efficient, Context-Aware LLM Agents

Memori:一种高效的、基于上下文的LLM代理持久内存层

Luiz C. Borro, Luiz A. B. Macarini, Gordon Tindall, Michael Montero, Adam B. Struck

机构 * Memori Labs Inc.(Memori实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 Memori通过结构化表示替代大上下文窗口,实现高效、低成本的LLM代理部署,准确率达81.95%。

Comments 9 pages; 2 figures; white paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24897 2026-03-23 cs.AI 57%

RealUnify: Do Unified Models Truly Benefit from Unification? A Comprehensive Benchmark

RealUnify: 统一模型真的能从统一中受益吗?一个全面的基准测试

Yang Shi, Yuhao Dong, Yue Ding, Yuran Wang, Xuanyu Zhu, Sheng Zhou, Wenting Liu, Haochen Tian, Rundong Wang, Huanqian Wang, Zuyan Liu, Bohan Zeng, Ruizhe Chen, Qixun Wang, Zhuoran Zhang, Xinlong Chen, Chengzhuo Tong, Bozhou Li, Qiang Liu, Haotian Wang, Wenjing Yang, Yuanxing Zhang, Pengfei Wan, Yi-Fan Zhang, Ziwei Liu

机构 * PKU(北京大学) Kling Team(Kling团队) NTU(国立台湾大学) CASIA(中国科学院自动化研究所) NUS(国立新加坡大学) USTC(中国科学技术大学) THU(清华大学) ZJU(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RealUnify基准测试旨在评估统一模型中理解与生成能力的双向协同效应,通过10类32子任务的1000个人工标注实例,揭示现有统一模型在协同能力上的不足,强调需新的训练策略来提升统一建模潜力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19517 2026-03-23 cs.CV cs.LG 57%

ReXInTheWild: A Unified Benchmark for Medical Photograph Understanding

ReXInTheWild:医疗照片理解的统一基准

Oishi Banerjee, Sung Eun Kim, Alexandra N. Willauer, Julius M. Kernbach, Abeer Rihan Alomaish, Reema Abdulwahab S. Alghamdi, Hassan Rayhan Alomaish, Mohammed Baharoon, Xiaoman Zhang, Julian Nicolas Acosta, Christine Zhou, Pranav Rajpurkar

机构 * Department of Biomedical Informatics, Harvard Medical School(哈佛医学院生物医学信息学系) National Strategic Technology Research Institute, Seoul National University Hospital(首尔国立大学医院国家战略技术研究所) Department of Medicine, Division of Gastroenterology, Massachusetts General Hospital(麻省总医院内科与消化内科部门) Department of Neuroradiology, Heidelberg University Hospital(海德堡大学医院神经放射科部门) King Abdulaziz Medical City, National Guard Health Affairs(国王阿卜杜勒-阿齐兹医疗城,国民守卫健康事务局) Division of Pulmonary, Critical Care, and Sleep Medicine, University of Cincinnati(辛辛那提大学肺科、重症医学及睡眠医学部门)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ReXInTheWild基准,通过484张医学文献来源的照片和7个临床主题的955个多项选择问题,评估视觉-语言模型对医疗照片内容的理解能力,揭示不同模型在细粒度图像理解和医学推理上的性能差异。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17417 2026-03-23 cs.CY cs.MA 50%

Is Your LLM-as-a-Recommender Agent Trustable? LLMs' Recommendation is Easily Hacked by Biases (Preferences)

你的 LLM-as-a-Recommender 代理可信吗?LLM 的推荐容易被偏见(偏好)所 hack

Zichen Tang, Zirui Zhang, Qian Wang, Zhenheng Tang, Bo Li, Xiaowen Chu

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出 BiasRecBench 评估基准,揭示 LLM-as-a-Recommender 在高价值任务中易受偏见影响的漏洞,通过合成数据和注入上下文偏见,发现即使具备充足推理能力的代理也常受偏见影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17432 2026-03-23 cs.CV 50%

AIFloodSense: A Global Aerial Imagery Dataset for Semantic Segmentation and Understanding of Flooded Environments

AIFloodSense:一个全球空中影像数据集,用于洪水环境的语义分割与理解

Georgios Simantiris, Konstantinos Bacharidis, Apostolos Papanikolaou, Petros Giannakakis, Costas Panagiotakis

机构 * Department of Management Science and Technology(管理科学与技术系) Hellenic Mediterranean University(希伯伦地中海大学) Institute of Computer Science, FORTH(信息科学研究所,FORTH)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出AIFloodSense数据集,包含470张高分辨率图像,覆盖64个国家和六个大洲,支持图像分类、语义分割和视觉问答三个任务,旨在提升洪水环境的灾害评估能力。

Comments 36 pages, 19 figures, 8 tables

Journal ref Remote Sens. 2026, 18(6), 938

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 12 篇

2603.20170 2026-03-23 cs.AI 79%

Learning Dynamic Belief Graphs for Theory-of-mind Reasoning

学习动态信念图以进行心灵理论推理

Ruxiao Chen, Xilei Zhao, Thomas J. Cova, Frank A. Drews, Susu Xu

机构 * Department of Civil Systems Engineering, Johns Hopkins University, Baltimore, MD, USA School of the Environment, Society \& Sustainability, University of Utah, Salt Lake City, UT, USA Department of Psychology, University of Utah, Salt Lake City, UT, USA Coastal Engineering, University of Florida, Gainesville, FL, USA

专题命中 其他推理 :reasoning(title,abstract);分类 cs.AI

AI总结 本文提出一种动态信念图模型,用于增强大语言模型的心灵理论推理能力,通过联合推断潜在信念、学习时间变化依赖关系,并链接信念演变与信息获取和决策,提升高不确定性环境下的行动预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18014 2026-03-23 cs.LG 79%

Predictive Scaling Laws for Efficient GRPO Training of Large Reasoning Models

为高效训练大推理模型的预测缩放定律

Datta Nimmaturi, Vaishnavi Bhargava, Rajat Ghosh, Johnu George, Debojyoti Dutta

机构 * Nutanix

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 本文提出预测框架,通过实验推导出基于模型大小、初始性能和训练进度的经验缩放定律,识别三个训练阶段并建议提前停止以减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19779 2026-03-23 cs.CV 78%

One Model, Two Minds: Task-Conditioned Reasoning for Unified Image Quality and Aesthetic Assessment

一个模型,两种思维:任务条件推理用于统一的图像质量与审美评估

Wen Yin, Cencen Liu, Dingrui Liu, Bing Su, Yuan-Fang Li, Tao He

机构 * University of Electronic Science and Technology of China(电子科技大学) Faculty of Information Technology, Monash University(莫纳什大学信息科技学院) The Laboratory of Intelligent Collaborative Computing of UESTC(UESTC智能协同计算实验室)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出TATAR框架,通过任务感知的异步奖励机制,解决图像质量评估与审美评估的推理与优化不匹配问题,实验证明其在多个基准上的优越性能。

Comments 10 pages,7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19714 2026-03-23 cs.CL 77%

LoopRPT: Reinforcement Pre-Training for Looped Language Models

LoopRPT: 用于循环语言模型的强化预训练

Guo Tang, Shixin Jiang, Heng Chang, Nuo Chen, Yuhan Li, Huiming Fan, Jia Li, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology, Harbin, China(哈尔滨工业大学) Tsinghua University, Beijing, China(清华大学) The Hong Kong University of Science and Technology, Guangzhou, China(香港科学与技术大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL

AI总结 本文提出LoopRPT框架,通过将下一步预测转化为推理任务,利用EMA教师参考和噪声潜在轨迹直接优化循环语言模型的中间表示,提升表示质量并实现准确度与计算量的帕累托最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19532 2026-03-23 cs.CL cs.IR cs.LG 62%

EvidenceRL: Reinforcing Evidence Consistency for Trustworthy Language Models

EvidenceRL: 为可信语言模型强化证据一致性

J. Ben Tamo, Yuxing Lu, Benoit L. Marteau, Micky C. Nnamdi, May D. Wang

机构 * Georgia Institute of Technology(佐治亚理工学院) Pekin University(培根大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 EvidenceRL通过强化学习框架在训练中强制证据遵循,提升语言模型在医疗诊断和法律推理中的证据接地和可信度,同时保持任务准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20162 2026-03-23 cs.CL 57%

Evaluating Evidence Grounding Under User Pressure in Instruction-Tuned Language Models

评估在用户压力下指令调优语言模型的证据基础

Sai Koneru, Elphin Joe, Christine Kirchhoff, Jian Wu, Sarah Rajtmajer

机构 * College of Information Sciences and Technology, Pennsylvania State University(宾夕法尼亚州立大学信息科学与技术学院) Department of Computer Science, Old Dominion University(老 Dominion 大学计算机科学系)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 研究探讨了在用户压力下指令调优语言模型如何平衡用户对齐压力与上下文证据的忠实性,通过控制的认知冲突框架评估证据一致性准确性及排序表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19782 2026-03-23 cs.AI 57%

Embodied Science: Closing the Discovery Loop with Agentic Embodied AI

具身科学:通过代理具身AI闭合发现循环

Xiang Zhuang, Chenyi Zhou, Kehua Feng, Zhihui Zhu, Yunfan Gao, Yijie Zhong, Yichi Zhang, Junjie Huang, Keyan Ding, Lei Bai, Haofen Wang, Qiang Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Tongji University(同济大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出具身科学框架,将科学发现视为闭环过程,结合代理推理与物理执行,通过感知-语言-行动-发现框架实现自主发现系统。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18196 2026-03-23 cs.CR cs.AI 57%

Retrieval-Augmented LLMs for Security Incident Analysis

增强检索的大型语言模型用于安全事件分析

Xavier Cadet, Aditya Vikram Singh, Harsh Mamania, Edward Koh, Alex Fitts, Dirk Van Bruggen, Simona Boboila, Peter Chin, Alina Oprea

机构 * Dartmouth College(达特茅斯学院) Northeastern University(东北大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出基于RAG的系统,通过针对性查询过滤和LLM语义推理分析安全事件,展示LLM在恶意软件和Active Directory攻击中的高召回率和精度,证明RAG架构在安全分析中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19269 2026-03-23 cs.CL 57%

From Tokens To Agents: A Researcher's Guide To Understanding Large Language Models

从标记到代理:研究者理解大型语言模型的指南

Daniele Barolo

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 本文探讨了如何有效使用大型语言模型,分析了预训练数据、标记化、Transformer架构等六个关键组成部分,通过案例研究展示如何评估LLM在特定研究中的适用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19596 2026-03-23 cs.IR 50%

CO-EVOLVE: Bidirectional Co-Evolution of Graph Structure and Semantics for Heterophilous Learning

CO-EVOLVE:图结构与语义的双向共演用于异质学习

Jinming Xing, Muhammad Shahzad

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出CO-EVOLVE框架,通过双向共演解决异质学习中的语义-结构不一致、误差传播和盲从问题,引入对比损失、自适应门控和不确定性门控策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02142 2026-03-23 cs.RO cs.CV 50%

FD-VLA: Force-Distilled Vision-Language-Action Model for Contact-Rich Manipulation

FD-VLA:力感知的视觉-语言-动作模型用于接触密集的 manipulation

Ruiteng Zhao, Wenshuo Wang, Yicheng Ma, Xiaocong Li, Francis E. H. Tay, Marcelo H. Ang, Haiyue Zhu

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Electrical & Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) College of Information Science and Technology, Eastern Institute of Technology(东部技术学院信息科学与技术学院) John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Advanced Robotics Centre at National University of Singapore(新加坡国立大学先进机器人中心) Singapore Institute of Manufacturing Technology, Agency for Science, Technology and Research (A*STAR)(新加坡制造技术研究所,科技研究局(A*STAR))

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出FD-VLA模型,通过力蒸馏模块在不依赖物理力传感器的情况下实现接触密集任务的力感知,提升机器人视觉-语言-动作的鲁棒性与实用性。

Comments ICRA 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24837 2026-03-23 cs.CV 50%

ZOO-Prune: Training-Free Token Pruning via Zeroth-Order Gradient Estimation in Vision-Language Models

ZOO-Prune:基于零阶梯度估计的训练自由token剪枝方法用于视觉-语言模型

Youngeun Kim, Youjia Zhang, Huiling Liu, Aecheon Jung, Sunwoo Lee, Sungeun Hong

机构 * Amazon(亚马逊公司) Sungkyunkwan University(成均馆大学) Inha University(inha大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出ZOO-Prune方法,通过零阶梯度估计在视觉-语言模型中实现无需训练的token剪枝,实验表明其在剪枝94.4%token的同时保持精度,并提升推理效率2.3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏