arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-20 至 2026-05-20 共收录 396 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 61 篇

2605.19950 2026-05-20 cs.CV 80%

AffectVerse: Emotional World Models for Multimodal Affective Computing

AffectVerse: 多模态情感计算中的情感世界模型

Bo Zhao, Fanghua Ye, Yixin Ji, Sicheng Zhao, Xiaojiang Peng, Zitong YU

机构 * Great Bay University(大湾大学) Tencent(腾讯) Tsinghua University(清华大学) Shenzhen Technology University(深圳技术大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本研究提出AffectVerse,一种基于Qwen2.5-Omni的多模态情感计算模型,通过引入情感世界模块实现短期潜在情感预测,利用未来预测作为自监督信号,提高了情感计算的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16137 2026-05-20 cs.CV cs.RO 80%

STABLE: Simulation-Ready Tabletop Layout Generation via a Semantics-Physics Dual System

STABLE: 通过语义-物理双系统生成仿真准备的桌面布局

Zhen Luo, Yixuan Yang, Xudong Xu, Jinkun Hao, Zhaoyang Lyu, Feng Zheng, Jiangmiao Pang, Yanwei Fu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出STABLE,一种通过语义-物理双系统生成仿真准备的桌面布局的方法,通过语义推理模块生成粗略布局,物理校正模块校正布局以确保物理合理性,从而提升场景的物理有效性。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18956 2026-05-20 cs.CV 80%

MotionMERGE: A Multi-granular Framework for Human Motion Editing, Reasoning, Generation, and Explanation

MotionMERGE: 一种用于人体动作编辑、推理、生成和解释的多粒度框架

Bizhu Wu, Jinheng Xie, Wenting Chen, Zhe Kong, Jianfeng Ren, Linlin Shen, Ruibin Bai, Rong Qu

机构 * Computer Vision Institute, School of Computer Science and Software Engineering, Shenzhen University(计算机视觉研究院,计算机科学与软件工程学院,深圳大学) Guangdong Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室,深圳大学) School of Computer Science, University of Nottingham Ningbo China(Nottingham Ningbo 中国计算机科学学院) Department of Electrical and Computer Engineering, National University of Singapore(电子与计算机工程系,新加坡国立大学) Department of Radiation Oncology, Stanford University(放射肿瘤科,斯坦福大学) Sun Yat-sen University(中山大学) School of Computer Science, University of Nottingham(计算机科学学院,Nottingham大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);language model(abstract,abstract_cn)

AI总结 本文提出MotionMERGE框架,通过细粒度语言引导的动作控制、跨粒度协同预训练和细粒度动作-语言对齐,实现了更精确的动作生成、理解和编辑,并建立了新的细粒度文本驱动动作编辑和动作引导推理基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15435 2026-05-20 cs.CV cs.AI cs.MA 79%

ORCA: An Agentic Reasoning Framework for Hallucination and Adversarial Robustness in Vision-Language Models

ORCA:一种用于视觉语言模型幻觉和对抗鲁棒性的代理推理框架

Chung-En Johnny Yu, Brian Jalaian, Nathaniel D. Bastian

机构 * University of West Florida(佛罗里达大学) United States Military Academy(美国军事学院)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出ORCA框架,通过推理时的结构化推理和小规模视觉模型,提升预训练视觉语言模型的事实准确性与对抗鲁棒性,并在幻觉基准和对抗扰动测试中取得显著提升。

Comments Accepted at the ACM International Conference on Cloud and Big Data Computing (ICCBDC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19663 2026-05-20 cs.AI 79%

Pseudocode-Guided Structured Reasoning for Automating Reliable Inference in Vision-Language Models

基于伪代码的结构化推理用于自动化可靠推理在视觉-语言模型中

Weicong Ni, Tianbao Jiang, Linlin Wang

机构 * East China Normal University(东华师范大学)

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 本文提出了一种基于伪代码的结构化推理框架(PStar),旨在通过自适应选择结构化伪代码推理路径,提高视觉-语言模型在复杂任务中的可靠性和鲁棒性,从而减少幻觉现象并提升推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19943 2026-05-20 cs.AI 77%

Probabilistic Tiny Recursive Model

概率性微型递归模型

Amin Sghaier, Ali Parviz, Alexia Jolicoeur-Martineau

机构 * Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 推理与问题求解 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出概率性微型递归模型(PTRM),通过在递归步骤中注入高斯噪声,使模型能够并行探索多样化的解决方案盆地,从而在不重新训练或进行任务特定增强的情况下,提升多个基准测试的准确性,包括Sudoku-Extreme和Pencil Puzzle Bench上的各种谜题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15698 2026-05-20 cs.CL cs.AI cs.LG 75%

CoLD: Counterfactually-Guided Length Debiasing for Process Reward Models in Mathematical Reasoning

CoLD: 用于数学推理过程中奖励模型的反事实引导长度偏差消除

Congmin Zheng, Jiachen Zhu, Jianghao Lin, Xinyi Dai, Weiwen Liu, Haoxuan Li, Yong Yu, Weinan Zhang, Mengyue Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Noah’s Ark Lab(华为诺亚实验室) Peking University(北京大学) University of Bristol(布里斯托大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CoLD,一种通过反事实引导消除过程奖励模型中长度偏差的统一框架,旨在提高多步骤推理的准确性和简洁性,同时提升下游强化学习性能和跨领域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18864 2026-05-20 cs.LG cs.AI cs.CL 75%

SAGE: Shaping Anchors for Guided Exploration in RLVR of LLMs

SAGE: 通过塑造锚点引导LLMs的RLVR探索

Chanuk Lee, Minki Kang, Sung Ju Hwang

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出SAGE框架,通过重塑反KL锚分布来实现可控的经验支持扩展,从而在数学推理基准中提升pass@1和pass@k的表现。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18799 2026-05-20 cs.LG cs.AI cs.CL 75%

ReCrit: Transition-Aware Reinforcement Learning for Scientific Critic Reasoning

ReCrit: 基于过渡意识的强化学习用于科学批评推理

Wanghan Xu, Yuhao Zhou, Hengyuan Zhao, Shuo Li, Dianzhi Yu, Zhenfei Yin, Yaowen Hu, Fengli Xu, Wanli Ouyang, Wenlong Zhang, Lei Bai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Chinese University of Hong Kong(香港中文大学) University of Oxford(牛津大学) Tsinghua University(清华大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究提出ReCrit框架,通过强化学习解决科学批评推理中的过渡意识问题,改进了批评准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20075 2026-05-20 cs.CL cs.AI 73%

CopT: Contrastive On-Policy Thinking with Continuous Spaces for General and Agentic Reasoning

CopT: 在连续空间中利用对比学习进行通用和代理推理的在线策略思考

Dachuan Shi, Hanlin Zhu, Xiangchi Yuan, Wanjia Zhao, Kejing Xia, Wen Xiao, Wenke Lee

机构 * Georgia Tech(佐治亚理工学院) UC Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学) Microsoft(微软公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CopT,一种改进的推理流程,通过反转传统思考和回答的顺序,首先生成草稿答案,再基于该答案进行在线策略思考以进行反思和修正。CopT利用连续嵌入作为推理时的对比验证器,通过对比离散令牌输入和连续嵌入输入下模型对相同生成令牌的支持,得到一个序列级的反KL估计器来评估答案的可靠性。在数学、编程和代理推理任务中,CopT在保持同等或更高准确性的情况下,将峰值准确率提高了高达23%,并将令牌使用量减少了高达57%。

Comments Code: https://github.com/sdc17/CopT, Website: https://copt-web.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19762 2026-05-20 cs.AI cs.CL 73%

What Really Improves Mathematical Reasoning: Structured Reasoning Signals Beyond Pure Code

什么真正提升了数学推理:超越纯代码的结构化推理信号

Yuze Zhao, Junpeng Fang, Lu Yu, Zhenya Huang, Kai Zhang, Qing Cui, Qi Liu, Jun Zhou, Enhong Chen

机构 * State Key Laboratory of Cognitive Intelligence, University of Science(认知智能国家重点实验室,科学大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Centerce(人工智能研究院,合肥综合性国家科学中心) Individual Researcher(个人研究员) Zhejiang University, Hangzhou, China(浙江大学,杭州,中国)

专题命中 推理与问题求解 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 本文通过控制预训练实验研究代码对推理能力的影响,发现代码主要提升编程能力而非通用推理,且在复杂数学推理中与知识密集型任务竞争,同时结构化推理轨迹(如代码-文本和数学-文本混合)比纯可执行代码更能提升推理能力。

Comments Accepted by ICML 2026, 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00600 2026-05-20 cs.RO cs.AI cs.CV cs.LG 73%

Hybrid Training for Vision-Language-Action Models

视觉-语言-动作模型的混合训练

Pietro Mazzaglia, Cansu Sancaktar, Markus Peschl, Daniel Dijkman

机构 * Qualcomm AI Research(高通AI研究)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出混合训练框架,旨在使视觉-语言-动作模型在推理时能够根据需要生成思考过程或直接预测动作,从而在保持性能提升的同时提高推理效率。

Comments Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11262 2026-05-20 cs.LG 70%

Latent Chain-of-Thought Improves Structured-Data Transformers

潜在的链式思维提升结构化数据转换器

Carson Dudley, Samet Oymak

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.LG

AI总结 本文研究了链式思维对时间序列和表格数据的影响,并提出了一种递归方案,通过压缩查询位置的隐藏状态生成反馈标记,从而在预测前进行多次潜在计算,从而提升结构化数据转换器的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19559 2026-05-20 cs.CV cs.AI 70%

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

EgoCoT-Bench: 用于MLLMs的 grounded 和可验证的 operation-centric 思维链推理基准测试

Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

机构 * Zhejiang University(浙江大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出EgoCoT-Bench,一个用于评估MLLMs在第一人称视角下细粒度操作中心推理能力的基准测试,包含3172个可验证的问答对,涵盖感知、预见和高层次推理等任务,旨在解决现有基准测试在细粒度推理和证据验证方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19418 2026-05-20 cs.AI 70%

Conflict-Resilient Multi-Agent Reasoning via Signed Graph Modeling

通过有向图建模实现冲突容忍的多智能体推理

Longgang He, Longzhu He, Daojing He, Chaozhuo Li

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出SIGMA框架,通过有向图建模显式捕捉智能体间的信任、冲突和中性关系,以提升多智能体系统的推理能力和冲突容忍性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19140 2026-05-20 cs.AI 70%

Learning to Hand Off: Provably Convergent Workflow Learning under Interface Constraints

学习手柄:在接口约束下的可证明收敛的工作流学习

Jiayu Li, Enpei Zhang, Dawei Zhou, Elynn Chen, Yujun Yan

机构 * Stern School of Business(斯特恩商学院) New York University(纽约大学) Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院) Virginia Tech(弗吉尼亚理工大学)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 该研究探讨了在接口约束下的工作流学习问题,提出了一种异步去中心化的Q学习算法IC-Q,并给出了神经IC-Q的有限样本界,证明了在去中心化部分可观测性下的神经Q学习的第一个有限样本保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10344 2026-05-20 cs.AI 70%

TMAS: Scaling Test-Time Compute via Multi-Agent Synergy

TMAS: 通过多智能体协同实现测试时间计算的扩展

George Wu, Nan Jing, Qing Yi, Chuan Hao, Ming Yang, Feng Chang, Yuan Wei, Jian Yang, Ran Tao, Bryan Dai

机构 * IQuest Research(IQuest研究) Beihang University(北航)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出TMAS框架,通过多智能体协同实现测试时间计算的扩展,利用层次化记忆和混合奖励强化学习提升推理能力和探索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13392 2026-05-20 cs.AI 70%

ReSS: Learning Reasoning Models for Tabular Data Prediction via Symbolic Scaffold

ReSS: 通过符号支架学习表格数据预测的推理模型

Chenlang Yi, Gang Li, Zizhan Xiong, Tue Minh Cao, Yanmin Gong, My T. Thai, Tianbao Yang

机构 * Department of Computer Science & Engineering, Texas A&M University(德克萨斯A&M大学计算机科学与工程系) Department of Computer Science, University of Florida(佛罗里达大学计算机科学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出ReSS框架,通过符号支架结合神经推理模型,提升表格数据预测的准确性和可解释性,实验表明其在医疗和金融领域优于传统决策树和标准微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25064 2026-05-20 cs.CL 70%

Can LLMs Estimate Cognitive Complexity of Reading Comprehension Items?

LLMs能否估算阅读理解题的认知复杂性?

Seonjeong Hwang, Hyounghun Kim, Gary Geunbae Lee

机构 * Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(韩国立科学技术院人工智能研究生院) Department of Computer Science and Engineering, POSTECH, Republic of Korea(韩国立科学技术院计算机科学与工程系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了大型语言模型是否能通过证据范围和转换级别两个维度估算阅读理解题的认知复杂性,结果显示LLMs能够近似估算认知复杂性,但存在推理能力与元认知意识之间的差距。

Comments ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18915 2026-05-20 cs.CR cs.AI 70%

DMN: A Compositional Framework for Jailbreaking Multimodal LLMs with Multi-Image Inputs

DMN: 一种用于多图像输入多模态大语言模型的组合框架

Wenzhuo Xu, Zhipeng Wei, Zonghao Ying, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Quanchen Zou

机构 * AI Security Lab(360人工智能安全实验室) International Computer Science Institute(国际计算机科学研究所) UC Berkeley(加州大学伯克利分校) Beihang University(北航大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出DMN框架,通过分布式指令、多模态证据和数字链任务,提升多图像输入多模态大语言模型的 jailbreak 性能,实验表明其在GPT-4o、Gemini-2.5-pro和Claude Sonnet 4上的攻击成功率超过90%。

Comments ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18903 2026-05-20 cs.LG cs.CV 70%

Reasoning Portability: Guiding Continual Learning for MLLMs in the RLVR Era

推理可移植性:引导MLLMs在RLVR时代的持续学习

Qiuhe Hong, Yuyang Liu, Shuo Yang, Tiantian Peng, Fei Zhu, Yonghong Tian

机构 * Shenzhen Graduate School of Peking University(北京大学深圳研究生院) Centre for Artificial Intelligence and Robotics, HKISI, CAS(香港科学院人工智能与机器人研究中心) Peng Cheng Laboratory(鹏城实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出了一种名为推理可移植性(RP)的机制,通过在持续学习中引入推理层面的约束,改进了多模态大语言模型在RLVR环境下的适应能力,实验表明RDB-CL在提升最后准确率方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20033 2026-05-20 cs.CV cs.GT 67%

A Nash Equilibrium Framework For Training-Free Multimodal Step Verification

为无训练多模态步骤验证构建纳什均衡框架

Rohit Sinha, Kunal Tilaganji, Tanuja Ganu, Nagarajan Natarajan, Amit Sharma, Vineeth N. Balasubramanian

机构 * Microsoft Research India(微软印度研究院) Indian Institute of Technology Hyderabad(印度海得拉巴理工学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出一种无训练的多模态步骤验证方法,将步骤验证视为专门法官之间的协调问题,并通过纳什均衡游戏形式化法官之间的交互,通过闭式解计算均衡分数,实现对分歧的敏感过滤和稳定性意识的排名,实验表明跨模态一致性(而非平均置信度)提供了鲁棒的验证信号。

Comments ICLR 2026 Workshop VerifAI-2

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19944 2026-05-20 cs.LG cs.AI cs.CC cs.CL 67%

A Measure-Theoretic Analysis of Reasoning: Structural Generalization and Approximation Limits

关于推理的测度论分析:结构泛化与近似限制

Yuyang Zhang, Yifu Zhang, Xuehai Zhou, Xiaoyin Chen

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克AI研究所) Université de Montréal(蒙特利尔大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过最优传输理论分析推理过程,揭示了结构泛化和近似限制的理论机制,发现位置依赖注意力机制和Transformer电路深度对推理性能有显著影响。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07209 2026-05-20 cs.GR cs.CV 67%

HOI-PAGE: Zero-Shot Human-Object Interaction Generation with Part Affordance Guidance

HOI-PAGE:基于部分可及性的零样本人类-物体交互生成

Lei Li, Angela Dai

机构 * University of Virginia(弗吉尼亚大学) Technical University of Munich(慕尼黑技术大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出HOI-PAGE,一种通过部分可及性推理生成高保真4D人类-物体交互的零样本方法,利用大语言模型进行部分级机械推理,并通过结构化部分可及性图(PAG)引导三阶段合成,生成复杂多物体或多人物交互序列。

Comments ICML 2026. Project page: https://craigleili.github.io/projects/hoipage/ Video: https://www.youtube.com/watch?v=gwXjOffCFyk

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19528 2026-05-20 cs.CV 67%

Towards Camera-Robust 3D Localization: Equation-Anchored Tool-Use for MLLMs

面向相机鲁棒的3D定位:基于方程的工具使用用于MLLMs

Xueying Jiang, Wenhao Li, Quanhao Qian, Deli Zhao, Shijian Lu, Gongjie Zhang, Ran Xu

机构 * Nanyang Technological University(南洋理工大学) DAMO Academy, Alibaba Group(阿里集团大模型研究院) HuPan Lab(虎派实验室) Alibaba Group(阿里集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出了一种基于方程的工具使用框架,通过将空间工具作为公式变量重新利用,以解决多模态大语言模型(MLLMs)中3D定位的相机固有模糊问题,从而在3D物体检测和3D视觉定位任务中取得了显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18445 2026-05-20 cs.CV cs.AI cs.CL cs.LG 67%

What's Holding Back Latent Visual Reasoning?

是什么在阻碍潜在视觉推理?

André G. Viveiros, Nuno Gonçalves, André F. T. Martins, Matthias Lindemann

机构 * Instituto Superior Técnico, Universidade de Lisboa(里斯本大学理工学院) Instituto de Telecomunicações(电信研究所) TransPerfect(TransPerfect公司) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了现有模型如何利用潜在令牌,发现潜在令牌在最终预测中起作用有限,主要问题在于训练数据中潜在令牌信息有限且推理时生成的潜在令牌偏离真实表示,需要高质量数据和更精确的潜在令牌预测来推动发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19352 2026-05-20 q-bio.NC cs.AI cs.LG 62%

Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

在自然主义游戏过程中,视觉语言和动作模型的推理与动作表示的脑部对齐

Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

机构 * Independent(独立) Microsoft Research(微软研究院) AWS AI Labs(AWS人工智能实验室) GE HealthCare(通用电气医疗) IIT Delhi(德里理工学院) IIIT-Hyderabad(海得拉巴理工学院) Microsoft(微软)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在自然主义游戏过程中,视觉语言模型和大动作模型的推理与动作表示在脑部活动中的对齐情况,发现动作聚焦和推理聚焦的提示影响模型内部表示与fMRI脑活动的对齐程度。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19722 2026-05-20 cs.CR cs.AI 57%

Measuring Safety Alignment Effects in Autonomous Security Agents

在自主安全代理中测量安全对齐效应

Isaac David, Arthur Gervais

机构 * University College London(伦敦大学学院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 本文提出了一种基于轨迹的基准测试,用于评估安全代理在执行漏洞分析任务时的安全对齐效果,发现安全代理的性能差异主要体现在拒绝、不安全行为和工具可靠性等方面,而非单纯的拒绝率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08830 2026-05-20 cs.CV cs.AI cs.RO 57%

VECTOR-Drive: Tightly Coupled Vision-Language and Trajectory Expert Routing for End-to-End Autonomous Driving

VECTOR-Drive: 紧密耦合的视觉-语言与轨迹专家路由用于端到端自动驾驶

Rui Zhao, Jianlin Yu, Zhenhai Gao, Jiaqiao Liu, Fei Gao

机构 * College of Automotive Engineering, Jilin University(吉林大学汽车工程学院) The National Key Laboratory of Automotive Chassis Integration and Bionics, Jilin University(吉林大学汽车底盘集成与生物力学国家级重点实验室) ReeFocus AI Technology(ReeFocus人工智能技术)

专题命中 推理与问题求解 :pretraining(abstract);分类 cs.AI

AI总结 本文提出VECTOR-DRIVE框架,通过紧密耦合的视觉-语言与轨迹专家路由,解决端到端自动驾驶中视觉语言理解和轨迹预测之间的耦合问题,实现更高的任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19995 2026-05-20 cs.CV 50%

CogOmniControl: Reasoning-Driven Controllable Video Generation via Creative Intent Cognition

CogOmniControl: 通过创意意图认知实现推理驱动的可控视频生成

Hongji Yang, Songlian Li, Yucheng Zhou, Xiaotong Zhao, Alan Zhao, Chengzhong Xu, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学SKL-IOTSC、CIS实验室) Online-Video BU, Tencent(腾讯在线视频事业部)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出CogOmniControl框架,通过将可控视频生成分解为创意意图认知和生成两个阶段,利用专门训练的CogVLM生成更专业清晰的输出,并通过强化学习对齐不同条件的控制,最终在两个基准测试中超越现有开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏