arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-02 至 2026-03-02 共收录 87 信号源:cs.CL, cs.AI, cs.LG

1. 复杂问题求解 12 篇

2602.23980 2026-03-02 cs.CV 50%

Venus: Benchmarking and Empowering Multimodal Large Language Models for Aesthetic Guidance and Cropping

Venus: 多模态大语言模型在审美指导与裁剪中的基准测试与赋能

Tianxiang Du, Hulingxiao He, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学计算机技术研究所)

专题命中 复杂问题求解 :CoT(abstract)

AI总结 Venus通过两阶段框架提升多模态大语言模型的审美指导与裁剪能力,实现可解释的审美优化。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14245 2026-03-02 cs.IR 50%

XR: Cross-Modal Agents for Composed Image Retrieval

XR:跨模态代理用于组合图像检索

Zhongyu Yang, Wei Pang, Yingfang Yuan

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 XR通过多代理协作提升组合图像检索性能,实现38%的提升

Comments Accepted by WWW 2026. Project: https://01yzzyu.github.io/xr.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 推理评测 14 篇

2602.23610 2026-03-02 cs.CL cs.AI 84%

LLM-Driven Multi-Turn Task-Oriented Dialogue Synthesis for Realistic Reasoning

基于大语言模型的多轮任务导向对话合成用于真实推理

Yu Zhu, Kai Yang

专题命中 推理评测 :reasoning(title,abstract);logical reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的多轮任务导向对话合成框架,通过三级优化生成真实推理场景下的对话,提升LLM的逻辑推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23729 2026-03-02 cs.CL cs.AI cs.LG 82%

From Static Benchmarks to Dynamic Protocol: Agent-Centric Text Anomaly Detection for Evaluating LLM Reasoning

从静态基准到动态协议:面向评估LLM推理能力的代理中心文本异常检测

Seungdong Yoa, Sanghyu Yoon, Suhee Yoon, Dongmin Kim, Ye Seul Sim, Junhyun Lee, Woohyung Lim

机构 * LG AI Research(LG人工智能研究)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种动态协议,通过代理中心文本异常检测评估LLM推理能力,以克服静态数据集的局限性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23371 2026-03-02 cs.IR cs.AI cs.CL 81%

Domain-Partitioned Hybrid RAG for Legal Reasoning: Toward Modular and Explainable Legal AI for India

领域划分混合RAG用于法律推理:迈向模块化和可解释的印度法律AI

Rakshita Goel, S Pranav Kumar, Anmol Agrawal, Divyan Poddar, Pratik Narang, Dhruv Kumar

机构 * Birla Institute of Technology and Science, Pilani(巴尔·印度技术科学学院,比兰地)

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了一种针对印度法律研究的领域划分混合RAG与知识图谱架构,通过模块化设计和结构化关系推理提升法律AI的可解释性和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04506 2026-03-02 cs.CL 79%

Modeling Clinical Uncertainty in Radiology Reports: from Explicit Uncertainty Markers to Implicit Reasoning Pathways

在放射学报告中建模临床不确定性:从显式不确定性标记到隐式推理路径

Paloma Rabaey, Jong Hak Moon, Jung-Oh Lee, Min Gwan Kim, Hangyul Yoon, Thomas Demeester, Edward Choi

专题命中 推理评测 :reasoning(title,abstract);分类 cs.CL

AI总结 本研究提出Lunguage++基准,通过显式和隐式不确定性建模方法,提升放射学报告中不确定性分析的准确性和应用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24945 2026-03-02 cs.CL cs.AI 79%

MobileLLM-R1: Exploring the Limits of Sub-Billion Language Model Reasoners with Open Training Recipes

MobileLLM-R1: 探索子十亿参数语言模型推理能力的极限与开放训练配方

Changsheng Zhao, Ernie Chang, Zechun Liu, Chia-Jung Chang, Wei Wen, Chen Lai, Sheng Cao, Yuandong Tian, Raghuraman Krishnamoorthi, Yangyang Shi, Vikas Chandra

机构 * Meta AI

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 MobileLLM-R1通过开放训练配方在较少数据下实现子十亿参数模型的推理能力突破,显著超越现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00805 2026-03-02 cs.CV 78%

Thinking with Drafts: Speculative Temporal Reasoning for Efficient Long Video Understanding

通过草稿思考:用于高效长视频理解的推测性时间推理

Pengfei Hu, Meng Cao, Yingyao Wang, Yi Wang, Jiahua Dong, Jun Song, Yu Cheng, Bo Zheng, Xiaodan Liang

机构 * MBZUAI(马克斯·普朗克智能研究院) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Shanghai AI Lab(上海人工智能实验室)

专题命中 推理评测 :reasoning(title,abstract)

AI总结 SpecTemp通过协作双模型设计,实现高效长视频理解,平衡效率与准确性,提升推理速度。

Comments Accepted by CVPR 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18825 2026-03-02 cs.CV 67%

Q-Save: Towards Scoring and Attribution for Generated Video Evaluation

Q-Save:迈向生成视频评估的评分与归因

Xiele Wu, Zicheng Zhang, Mingtao Chen, Yixian Liu, Yiming Liu, Shushi Wang, Zhichao Hu, Yuhong Liu, Guangtao Zhai, Xiaohong Liu

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 Q-Save提出一个统一的生成视频评估模型和数据集,通过三阶段训练策略实现质量评分与归因生成,提升AIGV质量预测的准确性和可解释性。

Comments 20 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05228 2026-03-02 cs.LG cs.AI 62%

CMT-Benchmark: A Benchmark for Condensed Matter Theory Built by Expert Researchers

CMT-Benchmark:由专家研究人员构建的凝聚态理论基准

Haining Pan, James V. Roggeveen, Erez Berg, Juan Carrasquilla, Debanjan Chowdhury, Surya Ganguli, Federico Ghimenti, Juraj Hasik, Henry Hunt, Hong-Chen Jiang, Mason Kamb, Ying-Jer Kao, Ehsan Khatami, Michael J. Lawler, Di Luo, Titus Neupert, Xiaoliang Qi, Michael P. Brenner, Eun-Ah Kim

机构 * Rutgers University(罗格斯大学) Harvard University(哈佛大学) Weizmann Institute of Science(魏茨曼科学研究所) ETH Zürich(苏黎世联邦理工学院) Cornell University(康奈尔大学) Stanford University(斯坦福大学) University of Zürich(苏黎世大学) Stanford Institute for Materials and Energy Sciences(斯坦福材料与能源科学研究所) SLAC National Accelerator Laboratory(斯坦福直线加速器实验室) University of California, Los Angeles(加州大学洛杉矶分校) National Taiwan University(台湾大学) San José State University(圣何塞州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 CMT-Benchmark通过专家设计的50个凝聚态理论问题评估LLM在物理推理能力上的不足,揭示当前模型在复杂科学问题上的局限性。

Comments CMT-Benchmark dataset is available at https://huggingface.co/datasets/JVRoggeveen/cmt_benchmark. CMT-Benchmark was referenced in the Gemini 3 Deep Think (February 2026) release at https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-deep-think/

Journal ref International Conference on Learning Representations (ICLR) main conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23864 2026-03-02 cs.AI 57%

RUMAD: Reinforcement-Unifying Multi-Agent Debate

RUMAD:强化统一多智能体辩论

Chao Wang, Han Lin, Huaze Tang, Huijing Lin, Wenbo Ding

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 RUMAD通过强化学习动态控制通信拓扑,提升多智能体辩论的效率和准确性,实现80%以上的token成本降低和跨域泛化能力。

Comments 13 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21961 2026-03-02 cs.AI cs.HC 57%

How do Visual Attributes Influence Web Agents? A Comprehensive Evaluation of User Interface Design Factors

视觉属性如何影响网络代理?对用户界面设计因素的全面评估

Kuai Yu, Naicheng Yu, Han Wang, Rui Yang, Huan Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出VAF框架,通过系统评估视觉属性对网络代理决策的影响,发现背景颜色对比、项目大小等属性对代理行为有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23840 2026-03-02 cs.CL 57%

Measuring Sycophancy of Language Models in Multi-turn Dialogues

在多轮对话中衡量语言模型的趋炎附势性

Jiseung Hong, Grace Byun, Seungone Kim, Kai Shu, Jinho D. Choi

机构 * Carnegie Mellon University(卡内基梅隆大学) Emory University(埃默里大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本研究提出SYCON基准,评估多轮对话中语言模型的趋炎附势性,发现对齐调优会放大该行为,而模型规模和推理优化能增强抗压能力,采用第三人称视角可显著减少趋炎附势性。

Comments Accepted to Findings of EMNLP 2025

Journal ref Findings of the Association for Computational Linguistics: EMNLP 2025, pages 2239-2259

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23711 2026-03-02 cs.CV 50%

Can Unified Generation and Understanding Models Maintain Semantic Equivalence Across Different Output Modalities?

统一的生成与理解模型能否在不同输出模态间保持语义等价性?

Hongbo Jiang, Jie Li, Yunhang Shen, Pingyang Dai, Xing Sun, Haoyu Cao, Liujuan Cao

机构 * Tencent Youtu Lab(腾讯云图实验室) Xiamen University(厦门大学) Computing Lab, Department of Artificial Intelligence, School of Informatics(计算实验室,人工智能系,信息学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本研究探讨统一生成与理解模型在不同输出模态间保持语义等价性的能力,发现其在视觉回答任务中存在性能下降问题,原因在于跨模态语义对齐的失效。

Comments Equal contribution by Jie Li

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23299 2026-03-02 cs.CV cs.MM 50%

MMSD3.0: A Multi-Image Benchmark for Real-World Multimodal Sarcasm Detection

MMSD3.0:一个多图像基准用于现实世界多模态讽刺检测

Haochen Zhao, Yuyao Kong, Yongxiu Xu, Gaopeng Gou, Hongbo Xu, Yubin Wang, Haoliang Zhang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 MMSD3.0是一个多图像基准,用于现实世界多模态讽刺检测,引入了跨图像推理模型和相关引导的细粒度跨模态融合机制,验证了其在单图像和多图像场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04026 2026-03-02 cs.HC 50%

VeriWeb: Verifiable Long-Chain Web Benchmark for Agentic Information-Seeking

VeriWeb: 可验证的长链网络基准测试用于代理信息检索

Shunyu Liu, Minghao Liu, Huichi Zhou, Zhenyu Cui, Yang Zhou, Yuhao Zhou, Jialiang Gao, Heng Zhou, Yunhao Yang, Wendong Fan, puzhen zhang, Ge Zhang, Jiajun Shi, Weihao Xuan, Jiaxing Huang, Shuang Luo, Fang Wu, Heli Qi, Qingcheng Zeng, Junjie Wang, Aosong Feng, Jindi Lv, Sicong Jiang, Ziqi Ren, Wangchunshu Zhou, Zhenfei Yin, Wenlong Zhang, Guohao Li, Wenhao Yu, Lei Ma, Lei Bai, Qunshu Lin, Mingli Song, Dacheng Tao

专题命中 推理评测 :reasoning(abstract)

AI总结 VeriWeb是一个用于评估和开发网络代理的可验证长链网络基准测试,通过长链复杂性和子任务级可验证性设计,揭示了处理长时间网络任务的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他推理 11 篇

2602.22453 2026-03-02 cs.CL 83%

Bridging Latent Reasoning and Target-Language Generation via Retrieval-Transition Heads

通过检索-过渡头桥接潜在推理与目标语言生成

Shaswat Patel, Vishvesh Trivedi, Yue Han, Yihuai Hong, Eunsol Choi

专题命中 其他推理 :reasoning(title,abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本研究通过引入检索-过渡头(RTH)揭示多语言模型中负责目标语言生成的关键注意力机制,并通过实验验证其在链式推理中的重要性。

Comments In the paper, there are still many statements that are unclear and lack sufficient justification. Since it is difficult for us to estimate how much time would be required to properly revise and correct these issues, we would like to request a withdrawal of the paper in this moment. Thank you!

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22543 2026-03-02 cs.LG 79%

FAPO: Flawed-Aware Policy Optimization for Efficient and Reliable Reasoning

FAPO:面向高效可靠推理的缺陷感知策略优化

Yuyang Ding, Chi Zhang, Juntao Li, Haibin Lin, Min Zhang

机构 * Soochow University(苏州大学) ByteDance Seed(字节跳动种子)

专题命中 其他推理 :reasoning(title,abstract);分类 cs.LG

AI总结 FAPO通过引入缺陷感知机制,优化策略以提升大语言模型在高效可靠推理中的性能,提高结果正确性与训练稳定性。

Comments ICLR 2026. Project page: https://fapo-rl.github.io/; Infra Doc: https://verl.readthedocs.io/en/latest/advance/reward_loop.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02090 2026-03-02 cs.CL cs.AI 73%

LEC-KG: An LLM-Embedding Collaborative Framework for Domain-Specific Knowledge Graph Construction -- A Case Study on SDGs

LEC-KG: 一种基于大语言模型嵌入的领域知识图谱构建协作框架——以可持续发展目标为例

Yikai Zeng, Yingchao Piao, Changhua Pei, Jianhui Li

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.AI

AI总结 LEC-KG通过结合大语言模型与知识图谱嵌入的双向协作框架,有效解决领域知识图谱构建中的长尾关系问题,提升低频关系的识别与验证能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24100 2026-03-02 cs.AI cs.LG 62%

Artificial Agency Program: Curiosity, compression, and communication in agents

人工代理计划:代理中的好奇心、压缩与交流

Richard Csaky

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出人工代理计划,旨在通过整合好奇心、压缩与交流机制,构建资源受限的AI代理系统,以提升感知、理解和行动能力并减少人机交互摩擦。

Comments This is a working draft. Feedback and criticism is most welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00306 2026-03-02 q-bio.CB cs.AI cs.LG 62%

VCWorld: A Biological World Model for Virtual Cell Simulation

VCWorld:一种用于虚拟细胞模拟的生物世界模型

Zhijian Wei, Runze Ma, Zichen Wang, Zhongmin Li, Shuotong Song, Shuangjia Zheng

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 VCWorld通过整合生物学知识与大语言模型的推理能力,构建了可解释的虚拟细胞模拟模型,实现了对细胞扰动的高效预测和机理阐释。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24014 2026-03-02 cs.CV cs.AI 57%

Interpretable Debiasing of Vision-Language Models for Social Fairness

可解释的视觉-语言模型社会公平性偏见消除

Na Min An, Yoonna Jang, Yusuke Hirota, Ryo Hachiuma, Isabelle Augenstein, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) University of Copenhagen(哥本哈根大学) NVIDIA(英伟达公司)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究提出DeBiasLens框架,通过稀疏自编码器局部化VLM中的社会属性神经元,以可解释的方式消除模型中的社会偏见,同时保持语义知识。

Comments 25 pages, 30 figures, 13 Tables Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23792 2026-03-02 cs.CL 57%

Divide and Conquer: Accelerating Diffusion-Based Large Language Models via Adaptive Parallel Decoding

分而治之:通过自适应并行解码加速扩散式大语言模型

Xiangzhong Luo, Yilin An, Zhicheng Yu, Weichen Liu, Xu Yang

机构 * Southeast University(东南大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL

AI总结 DiCo通过分而治之的自适应并行解码方法,提升扩散式大语言模型的推理速度并保持生成质量。

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19364 2026-03-02 cs.AI cs.MA 57%

Integrating LLM in Agent-Based Social Simulation: Opportunities and Challenges

将大语言模型整合到基于代理的社会模拟中:机遇与挑战

Patrick Taillandier, Jean Daniel Zucker, Arnaud Grignard, Benoit Gaudou, Nghi Quang Huynh, Alexis Drogoul

机构 * UR MIAT, University of Toulouse, INRAE, Castanet-Tolosan, France(法国图卢兹大学UR MIAT,INRAE,Castanet-Tolosan分校) UMI 209 UMMISCO, IRD/Sorbonne University, Bondy, France(法国Bondy IRD/索邦大学UMI 209 UMMISCO) LMI ACROSS, Thuyloi University, Hanoi, Vietnam(越南胡志明大学LMI ACROSS) UMR 5505 IRIT, University of Toulouse Capitole, Toulouse, France(法国图卢兹大学Capitole UMR 5505 IRIT) CICT, Can Tho University, Can Tho, Vietnam(越南金瓯大学CICT)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨了大语言模型在社会模拟中的应用,分析其潜力与局限,并提出混合宪法架构作为整合LLM与传统代理模型的可行方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23400 2026-03-02 cs.LG 57%

U-CAN: Utility-Aware Contrastive Attenuation for Efficient Unlearning in Generative Recommendation

U-CAN:面向生成推荐中高效遗忘的效用感知对比衰减

Zezheng Wu, Rui Wang, Xinghe Cheng, Yang Shao, Qing Yang, Jiapu Wang, Jingwei Zhang

机构 * Guilin University of Electronic Technology(桂林电子科技大学) University of Southampton(南安普顿大学) Jinan University(暨南大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 U-CAN通过低秩适配器实现生成推荐中的高效隐私遗忘,利用效用感知对比衰减机制提升效用保留与计算效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24041 2026-03-02 cs.CV 50%

Look Carefully: Adaptive Visual Reinforcements in Multimodal Large Language Models for Hallucination Mitigation

仔细观察:多模态大语言模型中的自适应视觉增强以缓解幻觉

Xingyu Zhu, Kesen Zhao, Liang Yi, Shuo Wang, Zhicai Wang, Beier Zhu, Hanwang Zhang

机构 * MoE Key Lab of BIPC, University of Science and Technology of China(信息与电子技术联合实验室,中国科学技术大学) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract)

AI总结 本研究提出自适应视觉增强框架AIR,通过减少冗余标记和选择性整合补丁来缓解多模态大语言模型中的幻觉问题。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23952 2026-03-02 cs.CV 50%

CC-VQA: Conflict- and Correlation-Aware Method for Mitigating Knowledge Conflict in Knowledge-Based Visual Question Answering

CC-VQA: 一种考虑冲突和相关性的方法,用于缓解基于知识的视觉问答中的知识冲突

Yuyang Hong, Jiaqi Gu, Yujin Lou, Lubin Fan, Qi Yang, Ying Wang, Kun Ding, Yue Wu, Shiming Xiang, Jieping Ye

机构 * School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院) MAIS, Institute of Automation(自动化研究所MAIS) Alibaba Cloud Computing(阿里云计算)

专题命中 其他推理 :reasoning(abstract)

AI总结 CC-VQA提出了一种无训练、考虑冲突和相关性的方法,通过视觉中心的上下文冲突推理和相关性引导的编码解码,提升基于知识的视觉问答的准确率。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏