arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-31 至 2026-03-31 共收录 22 信号源:cs.CL, cs.AI, cs.LG

1. 其他推理 22 篇

2502.18273 2026-03-31 cs.CL 85%

Beyond In-Distribution Success: Scaling Curves of CoT Granularity for Language Model Generalization

超越分布内表现:CoT粒度的缩放曲线对语言模型泛化能力的提升

Ru Wang, Wei Huang, Selena Song, Haoyu Zhang, Qian Niu, Yusuke Iwasawa, Yutaka Matsuo, Jiaxian Guo

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过实验揭示CoT数据粒度与泛化性能的关联,证明CoT在减少样本需求的同时提升模型在分布偏移任务中的泛化能力。

Comments Accepted at the Conference on Parsimony and Learning (CPAL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11404 2026-03-31 cs.RO 82%

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

ACoT-VLA:面向视觉-语言-动作模型的行动链式推理

Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Maoqing Yao, Si Liu, Guanghui Ren

机构 * Beihang University(北京航空航天大学) AgiBot

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 本文提出ACoT-VLA,通过在动作空间中直接进行推理,改进视觉-语言-动作模型的行动生成,引入显式和隐式动作推理器,实验证明其在真实和仿真环境中的优越性。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27057 2026-03-31 cs.CL cs.AI 79%

Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuning

通过提示知识微调去偏大型语言模型在在线行为分析中的社会因素

Hossein Salemi, Jitin Krishnan, Hemant Purohit

机构 * George Mason University(乔治梅森大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在社交情境中通过引入用户目标推断 dispositional 因果性和消息上下文推断 situational 因果性对 LLM 性能的影响,提出了一种通过增强指令提示来减少社会归因偏见的方法,提升零样本分类任务的性能。

Comments This is a preprint of the accepted paper for publication in IEEE Transactions on Computational Social Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13874 2026-03-31 cs.CV 78%

SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

SAGE:基于强化学习训练长视频推理的智能任意时间范围智能体

Jitesh Jain, Jialuo Li, Zixian Ma, Jieyu Zhang, Chris Dongjoo Kim, Sangho Lee, Rohun Tripathi, Tanmay Gupta, Christopher Clark, Humphrey Shi

机构 * Allen AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出SAGE系统,通过多轮推理处理长视频并单轮处理简单问题,结合Gemini-2.5-Flash生成合成数据,提出RL后训练方案,并通过SAGE-Bench验证系统有效性,提升视频推理性能达6.1%。

Comments Project Page: https://praeclarumjj3.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV 78%

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27522 2026-03-31 cs.CL cs.CR cs.LG 73%

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

隐性广告:用于视觉语言模型中广告注入的行为触发语义后门

Duanyi Yao, Changyue Li, Zhicong Huang, Cheng Hong, Songze Li

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO 73%

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 67%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16430 2026-03-31 cs.CL cs.AI 62%

EngGPT2: Sovereign, Efficient and Open Intelligence

EngGPT2:主权、高效且开放的智能

G. Ciarfaglia, A. Rosanova, S. Cipolla, J. Bartoli, A. Di Domenico, C. Fioroni, A. Fontana, M. R. Scoleri, M. I. Mone, D. Franchi, M. C. Del Gaudio, A. Leodori, F. Cinti, M. Capozzi, C. Baston, F. Picariello, M. Gabusi, S. Bonura, V. Morreale, I. Bailo

机构 * Engineering Group(工程集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EngGPT2是工程集团最新迭代的意大利大语言模型,通过训练2.5万亿token实现高效性能,其在多个基准测试中表现接近8B-16B密集模型,同时消耗更少的推理和训练资源,支持多语言推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27056 2026-03-31 cs.CY cs.AI cs.LG 62%

Persona-Based Simulation of Human Opinion at Population Scale

基于人设的大众意见模拟

Mao Li, Frederick G. Conrad

机构 * University of Michigan(密歇根大学) Institute for Social Research(社会研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SPIRIT框架,通过分析社交媒体数据构建人设,实现个体化模拟,提升对人口层面意见和干预效果的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14575 2026-03-31 cs.LG cs.CL stat.ML 62%

CausalEvolve: Towards Open-Ended Discovery with Causal Scratchpad

CausalEvolve:迈向开放性发现的因果草稿

Yongqiang Chen, Chenxi Liu, Zhenhao Chen, Tongliang Liu, Bo Han, Kun Zhang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) TMLR Group, Hong Kong Baptist University(香港浸会大学TMLR实验室) SAIC Centre, The University of Sydney(悉尼大学SAIC中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 CausalEvolve通过因果草稿机制提升进化效率,在四个开放性科学任务中发现更优解,解决传统进化代理在指导和知识利用上的不足。

Comments Preprint of ongoing work; Yongqiang and Chenxi contributed equally;

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14043 2026-03-31 cs.AI cs.CL cs.MA 62%

AISAC: An Integrated multi-agent System for Transparent, Retrieval-Grounded Scientific Assistance

AISAC:一个集成的多智能体系统,用于透明、基于检索的科学协助

Chandrachur Bhattacharya, Sibendu Som

机构 * Transportation and Power Systems Division, Argonne National Laboratory, USA(美国阿贡国家实验室交通与动力系统部)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AISAC 提供了一个透明的多智能体运行环境,支持长期的证据支持科学推理,通过结构化保证实现角色语义、预算管理、可追溯执行和工具交互可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28361 2026-03-31 cs.AI cs.MA 57%

Deep Research of Deep Research: From Transformer to Agent, From AI to AI for Science

深度研究的深度研究:从Transformer到代理,从AI到AI为科学

Yipeng Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨深度研究的定义与发展方向,整合行业深度研究与AI为科学的视角,提出生成式AI的双支柱,并讨论AI4S在各学科的进展及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03904 2026-03-31 cs.LG 57%

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

LLM作为算法家:通过程序合成增强异常检测器

Hangting Ye, Jinmeng Li, He Zhao, Mingchen Zhuge, Dandan Guo, Yi Chang, Hongyuan Zha

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CUHK-Shenzhen(香港中文大学(深圳)) Department of DSAI, Monash University(莫纳什大学数据科学与人工智能系) KAUST(阿卜杜拉国王科技大学) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LLM-DAS框架,将LLM从数据处理者转变为算法家,通过程序合成生成对抗性异常,提升检测器鲁棒性。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27536 2026-03-31 cs.AI 57%

Dual-Stage LLM Framework for Scenario-Centric Semantic Interpretation in Driving Assistance

双阶段LLM框架用于驾驶辅助中的场景中心语义解释

Jean Douglas Carvalho, Hugo Taciro Kenji, Ahmad Mohammad Saber, Glaucia Melo, Max Mauro Dias Santos, Deepa Kundur

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文提出双阶段LLM框架,用于评估城市驾驶场景中基于LLM的风险推理可复现性。通过多模态驾驶数据构建确定性场景窗口,并在固定提示约束和闭合数字风险方案下评估,揭示模型间在风险等级分配、高风险升级、证据使用和因果归因上的系统性差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27116 2026-03-31 cs.AI cs.IR cs.NE 57%

The Price of Meaning: Why Every Semantic Memory System Forgets

意义的代价:为何每一个语义记忆系统都会遗忘

Sambartha Ray Barman, Andrey Starenky, Sofia Bodnar, Nikhil Narasimhan, Ashwin Gopinath

机构 * Sentra Massachusetts Institute of Technology(麻省理工学院)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文研究了语义记忆系统中意义与遗忘的权衡,证明了语义连续核阈值记忆系统中干扰和遗忘不可避免,通过四个结果揭示了语义表示的有效秩、局部维度、记忆增长对保留的影响以及联想诱饵的虚假回忆无法消除。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08482 2026-03-31 cs.DB cs.AI 57%

CLEAR: A Knowledge-Centric Vessel Trajectory Analysis Platform

CLEAR:一种以知识为中心的船舶轨迹分析平台

Hengyu Liu, Tianyi Li, Haoyu Wang, Kristian Torp, Yushuai Li, Tiancheng Zhang, Torben Bach Pedersen, Christian S. Jensen

机构 * Aalborg University(奥尔堡大学) Northeastern University(东北大学)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 CLEAR平台利用大语言模型生成能力,将不完整复杂的AIS数据转化为完整可解释的船舶轨迹,通过结构化数据知识图谱提升非专业用户分析能力。

Comments 4 pages, 5 figures. Accepted at SIGMOD 2026 Demo Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26904 2026-03-31 quant-ph cs.AI 57%

Are LLMs Good For Quantum Software, Architecture, and System Design?

大语言模型在量子软件、架构和系统设计中是否有效?

Sourish Wawdhane, Poulami Das

机构 * UT Austin(德克萨斯大学奥斯汀分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨大语言模型在量子系统设计中的应用,评估了九种前沿模型与研究生在量子计算问题上的表现,提出未来研究方向。

Comments 2 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26797 2026-03-31 cs.LG 57%

MemGuard-Alpha: Detecting and Filtering Memorization-Contaminated Signals in LLM-Based Financial Forecasting via Membership Inference and Cross-Model Disagreement

MemGuard-Alpha:通过成员推断和跨模型分歧检测和过滤受记忆污染的信号在基于LLM的金融预测中

Anisha Roy, Dip Roy

机构 * Jaypee Institute of Information Technology(贾伊皮信息技术学院) Indian Institute of Technology Patna(印度理工学院巴特那分校)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 MemGuard-Alpha通过成员推断和跨模型分歧方法,检测并过滤LLM生成的受记忆污染的信号,提升金融预测的准确性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28755 2026-03-31 cs.CY 50%

Graphilosophy: Graph-Based Digital Humanities Computing with The Four Books

图哲学:基于图的数字人文计算与四书

Minh-Thu Do, Quynh-Chau Le-Tran, Duc-Duy Nguyen-Mai, Thien-Trang Nguyen, Khanh-Duy Le, Minh-Triet Tran, Tam V. Nguyen, Trung-Nghia Le

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出图哲学框架,通过多层知识图谱整合自然语言处理与人文分析,将中越双语文本转化为可解释的资源,提升跨文化伦理概念理解与学习。

Comments AI & Society journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28686 2026-03-31 cs.SE 50%

C2RustXW: Program-Structure-Aware C-to-Rust Translation via Program Analysis and LLM

C2RustXW: 通过程序分析和LLM实现的程序结构感知的C到Rust翻译

Yanyan Yan, Yang Feng, Jiangshan Liu, Di Liu, Zixi Liu, Hao Teng, Baowen Xu

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出C2RustXW工具,通过程序分析与LLM结合,实现结构感知的C到Rust翻译,提高代码正确性和可维护性,实验显示在CodeNet和GitHub上达到高语法正确率和代码压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27184 2026-03-31 cs.CV 50%

Incentivizing Temporal-Awareness in Egocentric Video Understanding Models

激励时间感知的自体视频理解模型

Zhiyang Xu, Tian Qin, Bowen Jin, Zhengfeng Lai, Meng Cao, Lifu Huang, Peng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) Apple(苹果公司) Harvard University(哈佛大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Davis(加州大学戴维斯分校)

专题命中 其他推理 :reasoning(abstract)

AI总结 本文提出TGPO算法,通过强化学习提升多模态大语言模型在自体视频理解中的时间感知能力,实验表明其在时间接地和因果连贯性方面优于现有方法。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏