arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-10 至 2026-03-10 共收录 443 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 91 篇

2603.06801 2026-03-10 cs.AI 70%

Breaking the Martingale Curse: Multi-Agent Debate via Asymmetric Cognitive Potential Energy

突破马尔可夫诅咒:基于非对称认知潜能的多智能体辩论

Yuhan Liu, Juntian Zhang, Yichen Wu, Martin Takac, Salem Lahlou, Xiuying Chen, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学国际关系学院) Harvard University(哈佛大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 AceMAD通过非对称认知潜能打破马尔可夫诅咒,提升多智能体辩论的真理收敛能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06648 2026-03-10 cs.CV cs.AI 70%

ObjChangeVR: Object State Change Reasoning from Continuous Egocentric Views in VR Environments

ObjChangeVR: 从VR环境中连续眼动视角推断物体状态变化

Shiyi Ding, Shaoen Wu, Ying Chen

机构 * Kennesaw State University(肯纳邦大学) Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ObjChangeVR通过结合视角感知和时间基检索,有效识别VR环境中物体状态变化,提升多模态大语言模型在复杂场景下的表现。

Comments European Chapter of the Association for Computational Linguistics (EACL) 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13695 2026-03-10 cs.AI math.AC math.CO math.CT 70%

Can a Lightweight Automated AI Pipeline Solve Research-Level Mathematical Problems?

能否一个轻量级的自动化AI流水线解决研究级别的数学问题?

Lve Meng, Weilong Zhao, Yanzhi Zhang, Haoxiang Guan, Jiyan He

机构 * University of Science and Technology of China(中国科学技术大学) Université Paris Cité(巴黎cité大学) Zhongguancun Academy(中关村学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究展示了一种轻量级自动化AI流水线,能够解决复杂的研究级数学问题,并通过验证和开源实现。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11549 2026-03-10 cs.CV 67%

ODI-Bench: Can MLLMs Understand Immersive Omnidirectional Environments?

ODI-Bench: MLLMs能否理解沉浸式全向环境?

Liu Yang, Huiyu Duan, Ran Tao, Juntao Cheng, Sijing Wu, Yunhao Li, Jing Liu, Xiongkuo Min, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Xinjiang University(新疆大学) Tianjin University(天津大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ODI-Bench旨在评估多模态大语言模型对全向图像沉浸环境的理解能力,通过定制基准和Omni-CoT方法提升模型表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18606 2026-03-10 cs.RO cs.CV 67%

OVerSeeC: Open-Vocabulary Costmap Generation from Satellite Images and Natural Language

OVerSeeC: 从卫星图像和自然语言生成开放词汇成本图

Rwik Rana, Jesse Quattrociocchi, Dongmyeong Lee, Christian Ellis, Amanda Adkins, Adam Uccello, Garrett Warnell, Joydeep Biswas

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 推理与问题求解 :LLM(abstract);foundation model(abstract)

AI总结 OVerSeeC通过模块化基础模型实现从卫星图像和自然语言生成开放词汇成本图,支持任务自适应的全球规划。

Comments Website : https://amrl.cs.utexas.edu/overseec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06985 2026-03-10 cs.CV 67%

Perception-Aware Multimodal Spatial Reasoning from Monocular Images

视感知-aware的多模态空间推理从单目图像

Yanchun Cheng, Rundong Wang, Xulei Yang, Alok Prakash, Daniela Rus, Marcelo H Ang, ShiJie Li

机构 * NUS, Singapore(新加坡国立大学) NTU, Singapore(新加坡国立大学) MIT, US(麻省理工学院) A*STAR, Singapore(新加坡科技研究局)

专题命中 推理与问题求解 :language model(abstract);post-training(abstract)

AI总结 本文提出了一种感知-aware的多模态推理框架,通过统一标记空间联合处理视觉证据和文本推理,提升单目图像空间推理的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17277 2026-03-10 cs.CR 67%

PolyJailbreak: Cross-Modal Jailbreaking Attacks on Black-Box Multimodal LLMs

PolyJailbreak: 对黑盒多模态大语言模型的跨模态劫持攻击

Xinkai Wang, Beibei Li, Zerui Shao, Ao Liu, Guangquan Xu, Shouling Ji

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 PolyJailbreak通过多模态安全性不对称现象,提出结构化原子策略原语库,实现对黑盒多模态大语言模型的高效劫持攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11165 2026-03-10 cs.CV 67%

Traffic-MLLM: Curiosity-Regularized Supervised Learning for Traffic Scenario Case-Based Reasoning

Traffic-MLLM: 基于好奇心正则化的交通场景案例推理监督学习

Waikit Xiu, Qiang Lu, Bingchen Liu, Chen Sun, Xiying Li

机构 * The University of Hong Kong(香港大学) Sun Yat-sen University(中山大学) University of Bristol(布里斯托大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 Traffic-MLLM通过好奇心驱动的结构化案例学习,提升多模态交通场景推理的鲁棒性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06400 2026-03-10 cs.CV 67%

DivCon: Divide and Conquer for Complex Numerical and Spatial Reasoning in Text-to-Image Generation

DivCon:用于文本到图像生成中复杂数值和空间推理的分而治之

Yuhao Jia, Wenhan Tan

机构 * Individual Researcher(独立研究者)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 DivCon通过分而治之的方法提升文本到图像生成中复杂数值和空间推理的能力,通过分解任务提高布局生成和图像合成的精度与质量。

Comments Accepted to ECAI 2025

Journal ref Frontiers in Artificial Intelligence and Applications 413 ECAI 2025 pp 4081-4088

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05522 2026-03-10 cs.AI cs.CV cs.LG cs.RO 62%

RoboLayout: Differentiable 3D Scene Generation for Embodied Agents

RoboLayout: 用于具身智能体的可微3D场景生成

Ali Shamsaddinlou

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 RoboLayout通过引入智能体感知推理和改进优化稳定性,提升3D场景生成在具身智能体交互中的可行性与物理合理性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07888 2026-03-10 cs.CV cs.AI cs.LG 62%

VLM-SubtleBench: How Far Are VLMs from Human-Level Subtle Comparative Reasoning?

VLM-SubtleBench: VLMs在人类水平的细微比较推理方面还有多远?

Minkyu Kim, Sangheon Lee, Dongmin Park

机构 * KRAFTON KAIST(韩国科学技术院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 VLM-SubtleBench通过评估VLMs在细微比较推理上的表现,揭示了模型与人类性能之间的差距,并为提升VLMs的推理能力提供了基础。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23488 2026-03-10 cs.AI cs.CL 62%

Mapping Overlaps in Benchmarks through Perplexity in the Wild

通过在野 perplexity 映射重叠关系

Siyang Wu, Honglin Bao, Sida Li, Ari Holtzman, James A. Evans

机构 * Data Science Institute, University of Chicago(芝加哥大学数据科学研究所)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 通过分析LLM基准测试的perplexity,揭示了不同任务间的重叠结构及LLM能力差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08269 2026-03-10 cs.RO cs.AI 57%

SAIL: Test-Time Scaling for In-Context Imitation Learning with VLM

SAIL:基于VLM的上下文模仿学习的测试时扩展

Makoto Sato, Yusuke Iwasawa, Yujin Tang, So Kuroki

机构 * The University of Tokyo(东京大学) Sakana AI

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 SAIL通过测试时扩展提升上下文模仿学习的鲁棒性和通用性,利用蒙特卡洛树搜索和视觉语言模型实现轨迹优化。

Comments 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08171 2026-03-10 cs.AI 57%

Evidence-Driven Reasoning for Industrial Maintenance Using Heterogeneous Data

基于异构数据的工业维护证据驱动推理

Fearghal O'Donncha, Nianjun Zhou, Natalia Martinez, James T Rayfield, Fenno F. Heath, Abigail Langbridge, Roman Vaculin

机构 * IBM Research Europe(IBM欧洲研究院) IBM Research Yorktown(IBM约克镇研究院) Imperial College London(伦敦帝国学院)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 本文提出Condition Insight Agent,通过整合维护语言、操作数据行为抽象和工程故障语义,实现基于证据驱动的工业维护决策支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08082 2026-03-10 cs.LG 57%

Tiny Autoregressive Recursive Models

微型自回归递归模型

Paulius Rauba, Claudio Fanconi, Mihaela van der Schaar

机构 * University of Cambridge(剑桥大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.LG

AI总结 本文提出自回归TRM,评估其在小型自回归任务上的表现,发现两步细化基线表现强劲,但完整架构未见显著性能提升。

Journal ref ICLR 2026 Workshop RSI Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07901 2026-03-10 cs.RO cs.LG 57%

NaviDriveVLM: Decoupling High-Level Reasoning and Motion Planning for Autonomous Driving

NaviDriveVLM:解耦高层推理与运动规划用于自动驾驶

Ximeng Tao, Pardis Taghavi, Dimitar Filev, Reza Langari, Gaurav Pandey

机构 * J. Mike Walker ’66 Department of Mechanical Engineering, Texas A&M University, College Station, TX 77843, USA(杰米·沃克’66机械工程系,德克萨斯A&M大学,学院站,TX 77843,美国) The Department of Engineering Technology and Industrial Distribution Texas A&M University, College Station, TX 77843, USA(工程技术与工业分配系,德克萨斯A&M大学,学院站,TX 77843,美国)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 NaviDriveVLM通过解耦高层推理与运动规划,提升自动驾驶中的推理能力与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07590 2026-03-10 cs.CV cs.LG 57%

Models as Lego Builders: Assembling Malice from Benign Blocks via Semantic Blueprints

模型作为乐高积木:通过语义蓝图从良性积木中组装恶意内容

Chenxi Li, Xianggan Liu, Dake Shen, Yaosong Du, Zhibo Yao, Hao Jiang, Linyi Jiang, Chengwei Cao, Jingzhe Zhang, RanYi Peng, Peiling Bai, Xiande Huang

机构 * DAIL Tech(DAIL科技) NLP & KG Lab, Huazhong University of Science and Technology(自然语言处理与知识图谱实验室,华中科技大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.LG

AI总结 本文提出StructAttack,通过语义蓝图将看似无害的槽类型组合成恶意内容,揭示LVLMs在视觉模态整合中的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02748 2026-03-10 cs.CV cs.AI 57%

iGVLM: Dynamic Instruction-Guided Vision Encoding for Question-Aware Multimodal Understanding

iGVLM:动态指令引导的视觉编码用于问题感知的多模态理解

Hanpeng Liu, Yaqian Li, Zidan Wang, Shuoxi Zhang, Zihao Bo, Rinyoichi Takezoe, Kaiwen Long, Kun He

机构 * School of Computer Science(计算机科学学院) Technology, Huazhong University of Science(科技,华中科技大学) Li Auto Inc.(Li汽车公司) Institute of AI for Industries, Chinese Academy of Sciences(产业人工智能研究所,中国科学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 iGVLM通过动态指令引导的视觉编码框架,提升多模态理解中对指令的敏感度,实现从通用感知到任务感知推理的平滑过渡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09820 2026-03-10 cs.RO cs.AI 57%

ViLAM: Distilling Vision-Language Reasoning into Attention Maps for Social Robot Navigation

ViLAM:将视觉-语言推理转化为注意力图用于社交机器人导航

Mohamed Elnoor, Kasun Weerakoon, Gershom Seneviratne, Jing Liang, Vignesh Rajagopal, Dinesh Manocha

机构 * Dept. of Electrical and Computer Engineering, University of Maryland, College Park, MD, USA(电气与计算机工程系,马里兰大学,College Park, MD, USA) Dept. of Computer Science, University of Maryland, College Park, MD, USA(计算机科学系,马里兰大学,College Park, MD, USA) James Clark School of Engineering, University of Maryland, College Park, MD, USA(James Clark工程学院,马里兰大学,College Park, MD, USA)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 ViLAM通过蒸馏视觉-语言模型的注意力图,提升社交机器人导航的社会适应性与导航效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08383 2026-03-10 cs.RO 50%

MoMaStage: Skill-State Graph Guided Planning and Closed-Loop Execution for Long-Horizon Indoor Mobile Manipulation

MoMaStage:基于技能-状态图的规划与闭环执行的长时域室内移动操作

Chenxu Li, Zixuan Chen, Yetao Li, Jiapeng Xu, Hongyu Ding, Jieqi Shi, Jing Huo, Yang Gao

专题命中 推理与问题求解 :language model(abstract)

AI总结 MoMaStage通过结构化视觉-语言框架和闭环执行机制,实现长时域室内移动操作的高效规划与执行。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07515 2026-03-10 cs.CV 50%

EvolveReason: Self-Evolving Reasoning Paradigm for Explainable Deepfake Facial Image Identification

EvolveReason: 为可解释的深度伪造面部图像识别设计的自演化推理范式

Binjia Zhou, Dawei Luo, Shuai Chen, Feng Xu, Seow, Haoyuan Li, Jiachi Wang, Jiawen Wang, Zunlei Feng, Yijun Bei

机构 * School of Software Technology, Zhejiang University(浙江大学软件技术学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 EvolveReason通过模仿人类推理过程和构建特定数据集,提升深度伪造面部图像识别的可解释性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06914 2026-03-10 cs.RO 50%

SysNav: Multi-Level Systematic Cooperation Enables Real-World, Cross-Embodiment Object Navigation

SysNav:多级系统性合作实现现实世界跨载体物体导航

Haokun Zhu, Zongtai Li, Zihan Liu, Kevin Guo, Zhengzhi Lin, Yuxin Cai, Guofei Chen, Chen Lv, Wenshan Wang, Jean Oh, Ji Zhang

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) Nanyang Technological University(南洋理工大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 SysNav通过多级系统性合作实现现实世界跨载体物体导航,提升复杂环境下的导航效率与成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06839 2026-03-10 cs.DL 50%

From Job Postings to Curriculum Decisions: Using AI to Generate Workforce Intelligence for MSW Program Planning

从职位发布到课程决策:利用AI生成劳动力情报用于MSW课程规划

Barbara S. Hiltz, Bryan G. Victor, Brian E. Perron

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文利用AI分析职位发布数据,为MSW课程规划提供劳动力情报,揭示了不同实践领域的能力需求及发展趋势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21497 2026-03-10 cs.CV 50%

See It, Say It, Sorted: An Iterative Training-Free Framework for Visually-Grounded Multimodal Reasoning in LVLMs

看见它,说出它,排序:一种无需训练的迭代框架用于LVLMs中的视觉引导多模态推理

Yongchang Zhang, Oliver Ma, Tianyi Liu, Guangquan Zhou, Yang Chen

机构 * Southeast University(东南大学) University of Oxford(牛津大学) AIIA, Ministry of Education, China(教育部人工智能研究院,中国)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出无需训练的迭代框架,通过视觉证据监督推理步骤,减少多模态推理中的幻觉问题,提升推理准确性。

Comments CVPR2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19821 2026-03-10 cs.CV 50%

Query-Guided Spatial-Temporal-Frequency Interaction for Music Audio-Visual Question Answering

基于查询引导的时空频交互的音乐音频视觉问答

Kun Li, Michael Ying Yang, Sami Sebastian Brandt

机构 * University of Twente(特文特大学) University of Bath(巴斯大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 本文提出一种查询引导的时空频交互方法,通过整合问题引导的线索和频域特性,提升音频-视觉问答的性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 96 篇

2603.08704 2026-03-10 cs.AI 91%

Evaluating Financial Intelligence in Large Language Models: Benchmarking SuperInvesting AI with LLM Engines

评估大型语言模型的金融智能:用LLM引擎基准测试SuperInvesting AI

Akshay Gulati, Kanha Singhania, Tushar Banga, Parth Arora, Anshul Verma, Vaibhav Kumar Singh, Agyapal Digra, Jayant Singh Bisht, Danish Sharma, Varun Singla, Shubh Garg

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(title);分类 cs.AI

AI总结 本文提出AFIB基准测试,评估SuperInvesting等AI系统在金融分析中的性能,发现SuperInvesting在准确性、完整性和一致性方面表现最优。

Comments 12 pages, 6 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08275 2026-03-10 cs.CL cs.AI 90%

AdaCultureSafe: Adaptive Cultural Safety Grounded by Cultural Knowledge in Large Language Models

AdaCultureSafe: 基于文化知识的自适应文化安全大语言模型

Hankun Kang, Di Lin, Zhirong Liao, Pengfei Bai, Xinyi Zeng, Jiawei Jiang, Yuanyuan Zhu, Tieyun Qian

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

AI总结 AdaCultureSafe通过整合文化知识与大语言模型,提升文化安全性和响应生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15701 2026-03-10 cs.AR cs.CL cs.LG 90%

HDLxGraph: Bridging Large Language Models and HDL Repositories via HDL Graph Databases

HDLxGraph: 通过HDL图数据库连接大型语言模型和HDL仓库

Pingqing Zheng, Jiayin Qin, Fuqi Zhang, Niraj Chitla, Zishen Wan, Shang Wu, Yu Cao, Caiwen Ding, Yang, Zhao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 HDLxGraph通过整合HDL图特性与RAG,提升LLM在HDL任务中的搜索、调试和完成准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12945 2026-03-10 cs.CL cs.LG 90%

A Component-Based Survey of Interactions between Large Language Models and Multi-Armed Bandits

基于组件的大型语言模型与多臂老虎机交互调研

Siguang Chen, Chunli Lv, Miao Xie

机构 * College of Information and Electrical Engineering, China Agricultural University, Beijing 100083, China(信息与电气工程学院,中国农业大学,北京) Key Laboratory of Agricultural Machinery Monitoring and Big Data Application, Ministry of Agriculture and Rural Affairs, Beijing 100083, China(农业机械监测与大数据应用重点实验室,农业农村部,北京)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文调研了大型语言模型与多臂老虎机在组件层面的双向交互,分析了两者在解决对方挑战中的协同作用及未来研究方向。

Comments 25 pages, 6 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10934 2026-03-10 cs.DB cs.LG 89%

Towards Practical Benchmarking of Data Cleaning Techniques: On Generating Authentic Errors via Large Language Models

面向数据清洗技术实用基准测试的探索:通过大语言模型生成真实错误

Xinyuan Liu, Jiahui Chen, Bocheng Hu, Yu Sun, Xinyang Chen, Shaoxu Song, Yongxin Tong

机构 * Nankai University(南开大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Tsinghua University(清华大学) Beihang University(北京航空航天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.LG

AI总结 TableEG利用大语言模型生成真实错误,通过三元组表示和表格微调策略,提升数据清洗技术的基准测试效果。

详情

展开后加载摘要…

URL PDF HTML 收藏