arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-03 至 2026-03-03 共收录 599 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 110 篇

2506.03135 2026-03-03 cs.CV cs.AI cs.CL 81%

OmniSpatial: Towards Comprehensive Spatial Reasoning Benchmark for Vision Language Models

OmniSpatial:迈向视觉语言模型的空间推理综合基准

Mengdi Jia, Zekun Qi, Shaochen Zhang, Wenyao Zhang, Xinqiang Yu, Jiawei He, He Wang, Li Yi

机构 * Tsinghua University(清华大学) Xian Jiaotong University(西安交通大学) Shanghai Jiao Tong University(上海交通大学) Galbot Peking University(北京大学) Shanghai Qi Zhi Institute(上海启智研究院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 OmniSpatial是一个基于认知心理学的综合性空间推理基准,通过动态推理、复杂空间逻辑等四个类别,评估视觉语言模型在空间推理上的能力与局限。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02091 2026-03-03 cs.LG cs.AI cs.CL 80%

Learning from Synthetic Data Improves Multi-hop Reasoning

通过合成数据学习提升多跳推理能力

Anmol Kabra, Yilun Yin, Albert Gong, Kamilė Stankevičiūtė, Dongyoung Go, Johann Lee, Katie Z. Luo, Carla P. Gomes, Kilian Q. Weinberger

机构 * Cornell University(康奈尔大学) University of Cambridge(剑桥大学) Stanford University(斯坦福大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究通过规则生成的合成数据提升LLM多跳推理能力,发现合成数据能有效训练模型组成知识,从而在现实问答任务中表现更优。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07484 2026-03-03 cs.IR 80%

Reasoning by Exploration: A Unified Approach to Retrieval and Generation over Graphs

通过探索进行推理:一种统一的图检索与生成方法

Haoyu Han, Kai Guo, Harry Shomer, Yu Wang, Yucheng Chu, Hang Li, Li Ma, Jiliang Tang

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 RoE通过统一检索与生成过程,利用图探索机制提升大型语言模型在结构化图推理中的性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02208 2026-03-03 cs.CL 79%

Reasoning Core: A Scalable Procedural Data Generation Suite for Symbolic Pre-training and Post-Training

Reasoning Core:一个可扩展的程序化数据生成套件,用于符号预训练和后训练

Valentin Lacombe, Valentin Quesnel, Damien Sileo

机构 * Univ. Lille, Inria, CNRS, Centrale Lille, UMR 9189 - CRIStAL(里尔大学、法国国家信息与自动化研究所、法国国家科学研究中心、中央理工大学、UMR 9189 - CRIStAL)

专题命中 推理与问题求解 :post-training(title);language model(abstract);分类 cs.CL

AI总结 Reasoning Core 提出了一种可扩展的程序化数据生成套件,用于符号预训练和后训练,通过生成多样化的符号推理数据提升语言模型的推理能力。

Comments Keywords: LLMs, NLP, Dataset, Corpus, Procedural Pre-training, Reasoning, Logic, Formal Semantics https://github.com/sileod/reasoning_core

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01580 2026-03-03 cs.CL 79%

Markovian ODE-guided scoring can assess the quality of offline reasoning traces in language models

马尔可夫ODE引导的评分可以评估语言模型离线推理轨迹的质量

Arghodeep Nandi, Ojasva Saxena, Tanmoy Chakraborty

机构 * Department of Electrical Engineering, Indian Institute of Technology Delhi(电子工程系,印度理工学院德里) Indian Institute of Technology Delhi(印度理工学院德里) Yardi School of Artificial Intelligence, Indian Institute of Technology Delhi(人工智能学院,印度理工学院德里)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 MarODE通过马尔可夫模型和常微分方程评估语言模型推理轨迹质量,有效提升评估性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00925 2026-03-03 cs.CL cs.CV cs.CY 79%

The Aftermath of DrawEduMath: Vision Language Models Underperform with Struggling Students and Misdiagnose Errors

DrawEduMath之后的后果:视觉语言模型在挣扎学生面前表现不佳且误判错误

Li Lucy, Albert Zhang, Nathan Anderson, Ryan Knight, Kyle Lo

机构 * University of Washington(华盛顿大学) Insource Services(Insource服务) Worcester Polytechnic Institute(沃斯特理工学院) Allen Institute for AI(人工智能联合研究所)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了视觉语言模型在处理学生数学错误识别任务中的表现,发现其在挣扎学生面前表现不佳,需改进以支持教育应用。

Comments 15 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10085 2026-03-03 cs.CV cs.AI 79%

VITA: Zero-Shot Value Functions via Test-Time Adaptation of Vision-Language Models

VITA:通过视觉语言模型的测试时间适应实现零样本价值函数

Christos Ziakas, Alessandra Russo

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 VITA通过测试时间适应提升视觉语言模型的零样本价值估计能力,实现跨任务和环境的泛化,优于现有方法。

Comments International Conference on Learning Representations, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00142 2026-03-03 cs.MA cs.AI 79%

Evaluating Theory of Mind and Internal Beliefs in LLM-Based Multi-Agent Systems

评估基于大语言模型的多智能体系统中的理论心和内部信念

Adam Kostka, Jarosław A. Chudziak

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 本文提出一种整合理论心、BDI内部信念和符号求解器的多智能体架构,评估其在资源分配问题中提升协作智能的效果。

Journal ref 17th International Conference on Computational Collective Intelligence (ICCCI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02128 2026-03-03 cs.CL cs.AI cs.CY 79%

LLMs as Strategic Actors: Behavioral Alignment, Risk Calibration, and Argumentation Framing in Geopolitical Simulations

大语言模型作为战略行为体:地缘政治模拟中的行为对齐、风险校准与论证框架

Veronika Solopova, Viktoria Skorik, Maksym Tereshchenko, Alina Haidun, Ostap Vykhopen

机构 * Mantisanalytics

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大语言模型在地缘政治模拟中的行为表现,发现其在初期能模拟人类决策,但随时间推移表现出不同的策略特征,且在论证框架上偏向规范性与合作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18753 2026-03-03 cs.LG cs.AI 79%

HalluGuard: Demystifying Data-Driven and Reasoning-Driven Hallucinations in LLMs

HalluGuard: 解密数据驱动和推理驱动的LLM幻觉

Xinyue Zeng, Junhong Lin, Yujun Yan, Feng Guo, Liang Shi, Jun Wu, Dawei Zhou

机构 * CS Department Virginia Tech(弗吉尼亚理工学院计算机科学系) EECS Department MIT(麻省理工学院电子工程与计算机科学系) CS Department Dartmouth College(达特茅斯学院计算机科学系) Statistics Department Virginia Tech(弗吉尼亚理工学院统计学系) CS Department Michigan State University(密歇根州立大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 HalluGuard通过统一理论框架和NTK评分方法,系统识别LLM中的数据驱动和推理驱动幻觉,实现高精度检测。

Comments Accepted by The Fourteenth International Conference on Learning Representations (ICLR'26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18453 2026-03-03 cs.AI cs.CL 79%

Reason Like a Radiologist: Chain-of-Thought and Reinforcement Learning for Verifiable Report Generation

像放射科医生一样推理:用于可验证报告生成的推理链和强化学习

Peiyuan Jing, Kinhei Lee, Zhenxuan Zhang, Huichi Zhou, Zhengqing Yuan, Zhifan Gao, Lei Zhu, Giorgos Papanastasiou, Yingying Fang, Guang Yang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 BoxMed-RL通过推理链和强化学习生成可验证的放射科报告,提升报告的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01089 2026-03-03 cs.CL cs.LG 79%

CARD: Towards Conditional Design of Multi-agent Topological Structures

CARD: 向多智能体拓扑结构的条件设计迈进

Tongtong Wu, Yanming Li, Ziye Tang, Chen Jiang, Linhao Luo, Guilin Qi, Shirui Pan, Gholamreza Haffari

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 CARD通过条件图生成框架实现多智能体通信拓扑的动态适应,提升系统在不同环境下的有效性和鲁棒性。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19842 2026-03-03 cs.AI cs.LG 79%

DAG-Math: Graph-of-Thought Guided Mathematical Reasoning in LLMs

DAG-Math: 图思维引导的大型语言模型数学推理

Yuanhe Zhang, Ilja Kuzborskij, Jason D. Lee, Chenlei Leng, Fanghui Liu

机构 * Department of Statistics, University of Warwick(沃里克大学统计系) Google DeepMind(谷歌DeepMind) Department of Applied Mathematics, Hong Kong Polytechnic University(香港理工大学应用数学系) School of Mathematical Sciences, Institute of Natural Sciences and MOE-LSC, Shanghai Jiao Tong University(上海交通大学数学科学学院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 DAG-Math通过构建图思维引导的数学推理框架,评估LLM的推理能力,揭示了推理忠实度与最终答案准确性的差异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13888 2026-03-03 cs.CL cs.AI 79%

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

自然语言数学证明的可靠细粒度评估

Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Peking University(北京大学) Allen Institute for AI(人工智能研究院)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出ProofGrader,通过结合强推理模型、丰富上下文和简单集成方法,实现对LLM生成数学证明的细粒度评估,有效提升证明生成任务的可靠性。

Comments 40 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05069 2026-03-03 cs.CL cs.AI 79%

SwiReasoning: Switch-Thinking in Latent and Explicit for Pareto-Superior Reasoning LLMs

SwiReasoning: 在潜在空间和显式空间中切换以实现帕累托更优推理的LLM

Dachuan Shi, Abedelkadir Asi, Keying Li, Xiangchi Yuan, Leyan Pan, Wenke Lee, Wen Xiao

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 SwiReasoning通过在潜在空间和显式空间之间切换,提升推理LLMs的准确率和令牌效率。

Comments ICLR 2026. Code: https://github.com/sdc17/SwiReasoning, Website: https://swireasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01025 2026-03-03 cs.LG cs.AI 79%

One-Token Verification for Reasoning Correctness Estimation

单token验证用于推理正确性估计

Zhan Zhuang, Xiequn Wang, Zebin Chen, Feiyang Ye, Ying Wei, Kede Ma, Yu Zhang

机构 * Southern University of Science(南方科技大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出单token验证方法,用于高效估计推理正确性,通过低秩适应集成到LLM中,减少token使用并提升推理可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25532 2026-03-03 cs.CL cs.AI 79%

Calibrating Verbalized Confidence with Self-Generated Distractors

校准带有自生成干扰项的置信度

Victor Wang, Elias Stengel-Eskin

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出DINCO方法,通过自生成干扰项和归一化置信度校准,提升大型语言模型的置信度估计准确性。

Comments ICLR 2026. Code: https://github.com/victorwang37/dinco

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19400 2026-03-03 cs.CV 78%

Seeing Across Views: Benchmarking Spatial Reasoning of Vision-Language Models in Robotic Scenes

跨视角视觉:评估视觉-语言模型在机器人场景中的空间推理能力

Zhiyuan Feng, Zhaolu Kang, Qijie Wang, Zhiying Du, Jiongrui Yan, Shubin Shi, Chengbo Yuan, Huizhi Liang, Yu Deng, Qixiu Li, Rushuai Yang, Arctanx An, Leqi Zheng, Weijie Wang, Shawn Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Peking University(北京大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong University of Science and Technology(香港科技大学) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出MV-RoboBench基准,评估视觉-语言模型在机器人场景中的多视角空间推理能力,揭示其在多视角机器人感知中的挑战。

Comments Accepted to ICLR 2026. Camera-ready version. Project page: https://aaronfengzy.github.io/MV-RoboBench-Webpage/

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10760 2026-03-03 q-bio.BM cs.AI 77%

FROGENT: An End-to-End Full-process Drug Design Multi-Agent System

FROGENT:一种端到端的全流程药物设计多智能体系统

Qihua Pan, Dong Xu, Qianwei Yang, Jenna Xinyi Yao, Sisi Yuan, Zexuan Zhu, Jianqiang Li, Junkai Ji

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 FROGENT通过多智能体系统整合药物发现全流程,利用LLM能力提升效率与准确性,减少人工干预。

Comments 37 pages, 20 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17519 2026-03-03 cs.CR cs.CL 77%

Chain-of-Lure: A Universal Jailbreak Attack Framework using Unconstrained Synthetic Narratives

链式诱饵:一种利用无约束合成叙述的通用 jailbreak 攻击框架

Wenhan Chang, Tianqing Zhu, Yu Zhao, Shuangyong Song, Ping Xiong, Wanlei Zhou

机构 * School of Information Engineering, Zhongnan University of Economics and Law(中南财经政法大学信息工程学院) TeleAI, Beijing(北京TeleAI) City University of Macau(澳门城市大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于无约束合成叙述的通用jailbreak攻击框架,通过任务转移生成诱饵问题链并利用辅助模型优化,实现对LLMs的高成功率攻击,并提出毒性和防御策略。

Comments 23 pages, 3 main figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19000 2026-03-03 cs.AI cs.HC 77%

MagicAgent: Towards Generalized Agent Planning

MagicAgent:迈向通用代理规划

Xuhui Ren, Shaokang Dong, Chen Yang, Qing Gao, Yunbin Zhao, Yongsheng Liu, Xinwei Geng, Xiang Li, Demei Yan, Yanqing Li, Chenhao Huang, Dingwei Zhu, Junjie Ye, Boxuan Yue, Yingnan Fu, Mengzhe Lv, Zezeng Feng, Boshen Zhou, Bocheng Wang, Xuanjing Huang, Yu-Gang Jiang, Tao Gui, Qi Zhang, Yunke Zhang

机构 * Honor Device Co., Ltd(Honor设备有限公司) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 MagicAgent通过合成数据框架和两阶段训练范式,实现通用代理规划,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02860 2026-03-03 cs.RO cs.AI 77%

Tru-POMDP: Task Planning Under Uncertainty via Tree of Hypotheses and Open-Ended POMDPs

Tru-POMDP:通过假设树和开放性POMDPs在不确定性下进行任务规划

Wenjing Tang, Xinyu He, Yongxi Huang, Yunxiao Xiao, Cewu Lu, Panpan Cai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Tru-POMDP通过结合LLM生成的信念与开放性POMDP规划,有效应对任务规划中的不确定性,提升规划效率与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02339 2026-03-03 cs.CL 77%

AStar: Boosting Multimodal Reasoning with Automated Structured Thinking

AStar: 通过自动化结构化思维提升多模态推理

Jinyang Wu, Mingkuan Feng, Guocheng Zhai, Shuai Zhang, Zheng Lian, Fangrui Lv, Pengpeng Shao, Ruihan Jin, Zhengqi Wen, Jianhua Tao

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 AStar通过自动化结构化思维提升多模态推理效率,实现更高准确率和更强迁移能力。

Comments Accepted by AAAI 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01414 2026-03-03 cs.RO 75%

Jailbreaking Embodied LLMs via Action-level Manipulation

通过动作层面操控实现体感大语言模型的突破

Xinyu Huang, Qiang Yang, Leming Shen, Zijing Ma, Yuanqing Zheng

机构 * The Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学) University of Cambridge, Cambridge, United Kingdom(剑桥大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 Blindfold通过动作层面操控实现对体感大语言模型的突破,其攻击成功率显著高于现有基线,凸显了对后果感知防御机制的迫切需求。

Comments This paper has been officially accepted for ACM SenSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01272 2026-03-03 cs.SE 75%

NeuroSCA: Neuro-Symbolic Constraint Abstraction for Smart Contract Hybrid Fuzzing

NeuroSCA:面向智能合约混合模糊测试的神经符号约束抽象

Haochen Liang, Jiawei Chen, Hideya Ochiai

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 NeuroSCA通过神经符号约束抽象技术,提升智能合约混合模糊测试的效率和效果。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01113 2026-03-03 cs.RO 75%

From Dialogue to Execution: Mixture-of-Agents Assisted Interactive Planning for Behavior Tree-Based Long-Horizon Robot Execution

从对话到执行:基于混合代理的交互式规划用于基于行为树的长时域机器人执行

Kanata Suzuki, Kazuki Hori, Haruka Miyoshi, Shuhei Kurita, Tetsuya Ogata

机构 * Waseda University(早稻田大学) National Institute of Informatics(国家信息研究所) NII Research and Development Center for Large Language Models(国家信息研究所大型语言模型研究开发中心) The Graduate University for Advanced Studies (SOKENDAI)(高级研究大学研究生院(SOKENDAI))

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于混合代理的交互式规划框架,通过生成行为树实现长时域机器人任务的高效执行,减少人类干预并提升执行质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04366 2026-03-03 cs.HC cs.MM 75%

Towards Aligning Multimodal LLMs with Human Experts: A Focus on Parent-Child Interaction

向人类专家对齐多模态大语言模型:聚焦亲子互动

Weiyan Shi, Kenny Tsu Wei Choo

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨了如何通过两阶段提示方法使多模态大语言模型更有效地对齐语言治疗师在分析亲子互动中的联合注意,揭示了观察层与判断层对齐的差异及挑战。

Comments Accepted at CHI 2026 Full Papers

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00381 2026-03-03 cs.CR cs.AI cs.SY eess.SY 74%

Verifier-Bound Communication for LLM Agents: Certified Bounds on Covert Signaling

用于LLM代理的验证器绑定通信:对隐蔽信号的认证界限

Om Tailor

机构 * umd(马里兰大学)

专题命中 推理与问题求解 :LLM(title);分类 cs.AI

AI总结 本文提出CLBC协议,通过验证器绑定通信限制LLM代理的隐蔽信号,确保安全性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02193 2026-03-03 cs.LG cs.AI stat.ML 73%

Symbol-Equivariant Recurrent Reasoning Models

符号等变递归推理模型

Richard Freinschlag, Timo Bertram, Erich Kobler, Andreas Mayr, Günter Klambauer

机构 * ELLIS Unit Linz, LIT AI Lab \& Institute for Machine Learning, Johannes Kepler University Linz, Austria Clinical Research Institute for Medical AI, Johannes Kepler University Linz, Austria

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 SE-RRMs通过显式编码符号对称性,提升了神经推理的鲁棒性和可扩展性,在数独和ARC-AGI任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02024 2026-03-03 cs.CL cs.AI cs.CV 73%

MMR-Life: Piecing Together Real-life Scenes for Multimodal Multi-image Reasoning

MMR-Life: 组合真实场景以进行多模态多图像推理

Jiachun Li, Shaoping Huang, Zhuoran Jin, Chenlong Zhang, Pengfei Cao, Yubo Chen, Kang Liu, Jun Zhao

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所认知与决策智能复杂系统重点实验室) School of Advanced Interdisciplinary Sciences, University of Chinese Academy of Sciences(中国科学院大学交叉学科学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MMR-Life是一个评估多模态多图像推理能力的综合基准,通过现实场景中的多图像信息整合和多种推理类型测试,揭示了现有模型在复杂推理任务中的挑战和性能差异。

Comments Accepted by ICLR 2026, 78 pages, 60 figures

详情

展开后加载摘要…

URL PDF HTML 收藏