arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-03-16 至 2026-03-16 共收录 43 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 43 篇

2603.12559 2026-03-16 physics.soc-ph 91%

Large Language Models as Delivery Rider: Generating Instant Food Delivery Riders' Routing Decision with LLM Agent Framework

大语言模型作为配送骑手:利用LLM代理框架生成即时食品配送骑手的路线决策

Chengbo Zhang, Zuopeng Xiao

专题命中 推理与问题求解 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 本文提出LLM-DR框架,通过基于经验的骑手人设和基于推理的路线过程,模拟配送骑手的异质决策,以研究骑手劳动力战略对系统出行模式的影响。

Comments Proceedings of the 3rd International Conference on Urban Science and Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05880 2026-03-16 cs.CL cs.AI 90%

Large language models show fragile cognitive reasoning about human emotions

大型语言模型在人类情感认知推理中的脆弱性

Sree Bhattacharyya, Evgenii Kuriabov, Lucas Craig, Tharun Dilliraj, Reginald B. Adams,, Jia Li, James Z. Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大型语言模型是否能通过认知维度而非标签进行情感推理,提出CoRE基准测试,发现模型在情感认知结构上有系统性关系,但与人类判断存在偏差且在不同上下文中不稳定。

Comments Under Review, a version was presented at WiML Workshop @ NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12746 2026-03-16 cs.CV 89%

Thinking in Dynamics: How Multimodal Large Language Models Perceive, Track, and Reason Dynamics in Physical 4D World

动态思维:多模态大语言模型如何感知、跟踪和推理物理4D世界的动态

Yuzhi Huang, Kairun Wen, Rongxin Gao, Dongxuan Liu, Yibin Lou, Jie Wu, Jing Xu, Jian Zhang, Zheng Yang, Yunlong Lin, Chenxin Li, Panwang Pan, Junbin Lu, Jingyan Jiang, Xinghao Ding, Yue Huang, Zhi Wang

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出Dyn-Bench基准测试,评估多模态大语言模型在动态场景中的时空推理和动态物体感知能力,发现现有模型难以同时保持强性能,而结构化整合方法显著提升其动态感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11279 2026-03-16 cs.AI 88%

AI Psychometrics: Evaluating the Psychological Reasoning of Large Language Models with Psychometric Validities

AI心理测量学:通过心理测量效度评估大型语言模型的心理推理能力

Yibai Li, Xiaolin Lin, Zhenghui Sha, Zhiye Jin, Xiaobing Li

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过心理测量学方法评估四个主流LLM的心理推理能力和整体效度,发现高性能模型在效度上优于其 predecessors,验证了AI心理测量学的应用价值。

Comments Accepted for publication in the Proceedings of the 58th Hawaii International Conference on System Sciences (HICSS), 2025

Journal ref Proceedings of the 58th Hawaii International Conference on System Sciences (HICSS), January 2025, pp. 5189-5197

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12710 2026-03-16 cs.AI cs.CL 86%

AI Planning Framework for LLM-Based Web Agents

基于大语言模型的网络代理的AI规划框架

Orit Shahnovsky, Rotem Dror

机构 * Faculty of Computer and Information Science, University of Haifa(计算机与信息科学学院,海法大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种将网络任务视为序列决策过程的AI规划框架,通过将现代代理架构映射到传统规划范式,提出五种新的评估指标,验证了全计划提前代理在技术指标上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12953 2026-03-16 cs.LO cs.AI 85%

Delta1 with LLM: symbolic and neural integration for credible and explainable reasoning

Delta1与LLM:符号与神经整合用于可信且可解释的推理

Yang Xu, Jun Liu, Shuwei Chen, Chris Nugent, Hailing Guo

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Delta1与LLM结合的框架,通过符号推理与神经网络整合,实现可信且可解释的推理,适用于医疗、合规和监管领域。

Comments 12 pages, 1 figure, 3 tables, accepted oral presentation at AAAI2026 Bridge Program on Logic & AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02435 2026-03-16 cs.AI cs.LG 81%

VL-KGE: Vision-Language Models Meet Knowledge Graph Embeddings

VL-KGE:视觉-语言模型与知识图谱嵌入的结合

Athanasios Efthymiou, Stevan Rudinac, Monika Kackovic, Nachoem Wijnberg, Marcel Worring

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出VL-KGE框架,结合视觉-语言模型的跨模态对齐与结构关系建模,提升多模态知识图谱的链接预测性能。

Comments Published in Proceedings of the ACM Web Conference 2026 (WWW '26). This arXiv version includes extended supplementary material

Journal ref In Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00819 2026-03-16 cs.RO cs.AI 79%

DriveMind: A Dual Visual Language Model-based Reinforcement Learning Framework for Autonomous Driving

DriveMind: 一种基于双视觉语言模型的强化学习框架,用于自动驾驶

Dawood Wasif, Terrence J. Moore, Chandan K. Reddy, Frederica Free-Nelson, Seunghyun Yoon, Hyuk Lim, Dan Dongseong Kim, Jin-Hee Cho

专题命中 推理与问题求解 :language model(title,abstract);分类 cs.AI

AI总结 DriveMind结合对比视觉语言模型和动态提示生成,实现自动驾驶的语义奖励框架,提升适应性和安全性,实测性能优于基线4%以上。

Comments Submitted to IEEE Transactions on Intelligent Vehicles (T-IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12430 2026-03-16 cs.CV 78%

Surg-R1: A Hierarchical Reasoning Foundation Model for Scalable and Interpretable Surgical Decision Support with Multi-Center Clinical Validation

Surg-R1:一种用于可扩展且可解释的外科决策支持的分层推理基础模型,具有多中心临床验证

Jian Jiang, Chenxi Lin, Yiming Gu, Zengyi Qin, Zhitao Zeng, Kun Yuan, Yonghao Long, Xiang Xia, Cheng Yuan, Yuqi Wang, Zijie Yue, Kunyi Yang, Yuting Zhang, Zhu Zhuo, Dian Qin, Xin Wang, NG Chi Fai, Brian Anthony, Daguang Xu, Guy Rosman, Ozanan Meireles, Zizhen Zhang, Nicolas Padoy, Hesheng Wang, Qi Dou, Yueming Jin, Yutong Ban

专题命中 推理与问题求解 :foundation model(title);language model(abstract)

AI总结 Surg-R1通过四阶段流水线训练的分层推理模型,在多中心临床验证中实现了更高的准确率和可解释性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05869 2026-03-16 cs.CV 78%

PatchCue: Enhancing Vision-Language Model Reasoning with Patch-Based Visual Cues

PatchCue: 通过基于补丁的视觉提示增强视觉语言模型推理

Yukun Qi, Pei Fu, Hang Li, Yuhan Liu, Chao Jiang, Bin Qin, Zhenbo Luo, Jian Luan

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 本文提出PatchCue,一种基于补丁的视觉提示方法,通过两阶段训练提升VLMs的视觉推理能力,在多项任务中表现优于像素级和点级提示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00016 2026-03-16 cs.RO cs.AI cs.HC 77%

Beyond Static Instruction: A Multi-agent AI Framework for Adaptive Augmented Reality Robot Training

超越静态指令:一种多智能体AI框架用于自适应增强现实机器人训练

Nicolas Leins, Jana Gonnermann-Müller, Malte Teichmann, Sebastian Pokutta

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出多智能体AI框架,用于增强现实机器人训练中的动态适应,通过多模态输入预处理和LLM自主推理实现个性化学习环境调整。

Journal ref Companion Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (2026) 989-993

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02983 2026-03-16 cs.AI 77%

Do LLMs Share Human-Like Biases? Causal Reasoning Under Prior Knowledge, Irrelevant Context, and Varying Compute Budgets

大型语言模型是否具有人类般的偏见?在先验知识、无关上下文和不同计算预算下的因果推理

Hanna M. Dettki, Charley M. Wu, Bob Rehder

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过对比20余种LLM与人类基准,在11个由碰撞结构形式化的因果判断任务中发现,小型可解释模型能有效压缩LLM的因果判断,多数LLM表现出比人类更规则化的推理策略,但未表现出人类典型的碰撞偏见。

Journal ref ICLR 2026 Workshop "From Human Cognition to AI Reasoning (HCAIR)"

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12421 2026-03-16 cs.CV 75%

A Neuro-Symbolic Framework Combining Inductive and Deductive Reasoning for Autonomous Driving Planning

一种结合归纳推理与演绎推理的神经符号框架用于自动驾驶规划

Hongyan Wei, Wael AbdAlmageed

机构 * Clemson University(克莱姆森大学)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出一种神经符号框架,结合归纳与演绎推理提升自动驾驶规划的透明性和安全性,在nuScenes基准中优于现有方法。

Comments Under review. 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12420 2026-03-16 cs.HC 75%

LLMs for Human Mobility: Opportunities, Challenges, and Future Directions

大语言模型在人类迁移中的应用:机遇、挑战与未来方向

Jie Gao, Yaoxin Wu

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文探讨大语言模型在人类迁移研究中的应用,总结了五个任务中的核心挑战与LLM解决方案,并提出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04096 2026-03-16 cs.LG 74%

CORE: Context-Robust Remasking for Diffusion Language Models

CORE: 用于扩散语言模型的上下文鲁棒重掩码

Kevin Zhai, Sabbir Mollah, Zhenyi Wang, Mubarak Shah

专题命中 推理与问题求解 :language model(title);分类 cs.LG

AI总结 CORE通过上下文鲁棒重掩码方法改进扩散模型解码,通过检测上下文敏感性token提升生成稳定性,在推理阶段实现高效修正,优于现有基线方法。

Comments Project Page: https://ucf-crcv.github.io/core/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03366 2026-03-16 cs.LG cs.AI 73%

Disentangling Recall and Reasoning in Transformer Models through Layer-wise Attention and Activation Analysis

通过分层注意力和激活分析解构Transformer模型中的回忆与推理

Harshwardhan Fartale, Ashish Kattamuri, Rahul Raja, Arpita Vats, Ishita Prasad, Akshata Kishore Moharir

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究通过可控数据集和激活分析,揭示Transformer模型中回忆与推理的分离电路,为模型泛化和安全部署提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21105 2026-03-16 cs.CV 71%

RLM: A Vision-Language Model Approach for Radar Scene Understanding

RLM:一种用于雷达场景理解的视觉-语言模型方法

Pushkal Mishra, Kshitiz Bansal, Dinesh Bharadia

机构 * University of California San Diego(加州大学圣地亚哥分校) Blue River Technology

专题命中 推理与问题求解 :language model(title)

AI总结 本文提出RadarVLM,通过结构化空间语言监督学习统一的场景表示,改进了雷达场景理解中的空间推理能力,实验显示其在生成描述和车辆分割任务中性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13100 2026-03-16 cs.RO cs.AI 70%

Evaluating VLMs' Spatial Reasoning Over Robot Motion: A Step Towards Robot Planning with Motion Preferences

评估VLMs在机器人运动中的空间推理能力:迈向具有运动偏好的机器人规划的一步

Wenxi Wu, Jingjing Zhang, Martim Brandão

机构 * King’s College London(伦敦国王学院) University College London(伦敦大学学院)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文评估了四种先进VLMs在机器人运动中的空间推理能力,探讨了运动偏好(如物体接近性和路径风格)的处理,并分析了准确率与计算成本的权衡。

Comments Accepted to the First Workshop on Efficient Spatial Reasoning at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09677 2026-03-16 cs.AI 70%

The Illusion of Diminishing Returns: Measuring Long Horizon Execution in LLMs

持续扩展的幻觉回报:衡量LLM的长周期执行

Akshit Sinha, Arvindh Arun, Shashwat Goel, Steffen Staab, Jonas Geiping

机构 * University of Cambridge(剑桥大学) Institute for AI, University of Stuttgart(斯图加特大学人工智能研究所) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Southampton(南安普顿大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过分析LLM在长周期任务中的执行能力,揭示了持续扩展LLM并非必然导致回报递减,而是执行能力的提升能显著改善长周期任务表现。

Comments Published at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12826 2026-03-16 cs.CL 70%

Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design

重新思考用于RLVR的多项选择题:通过干扰项设计解锁潜力

Xu Guo, Qiming Ge, Jian Tong, Kedi Chen, Jin Zhang, Xiaogui Yang, Xuan Gao, Haijun Lv, Zhihui Lu, Yicheng Zou, Qipeng Guo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了干扰项设计对RLVR的影响,发现选项数量不匹配和强干扰项能有效减少随机猜测,提出IDC框架提升干扰项质量,实验表明在多个基准上显著提升了RLVR训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12813 2026-03-16 cs.AI 70%

Context is all you need: Towards autonomous model-based process design using agentic AI in flowsheet simulations

上下文即一切:利用流表模拟中的代理AI实现自主的基于模型的过程设计

Pascal Schäfer, Lukas J. Krinke, Martin Wlotzka, Norbert Asprion

机构 * BASF SE(巴斯夫股份有限公司) RWTH Aachen University(亚琛工业大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种代理AI框架,利用先进LLM在工业流表模拟环境中辅助过程设计,通过分解任务实现工程知识与代码生成的协同,展示了在反应分离、压力 swing 蒸馏和异构azeotropic 蒸馏中的应用效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12382 2026-03-16 cs.CV cs.AI 70%

SPARROW: Learning Spatial Precision and Temporal Referential Consistency in Pixel-Grounded Video MLLMs

SPARROW:在像素级视频MLLM中学习空间精度和时间参照一致性

Mohamad Alansari, Naufal Suryanto, Divya Velayudhan, Sajid Javed, Naoufel Werghi, Muzammal Naseer

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SPARROW通过引入目标特定跟踪特征和双提示设计,提升视频像素级理解的空间精度和时间一致性,基于30646个视频和45231对问答对的数据集,实现六个基准测试的显著改进。

Comments Accepted at CVPR 2026; Project page: https://risys-lab.github.io/SPARROW; Repository: https://github.com/RISys-Lab/SPARROW

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10767 2026-03-16 cs.CL 70%

mAceReason-Math: A Dataset of High-Quality Multilingual Math Problems Ready For RLVR

mAceReason-Math: 一个高质量多语言数学问题数据集,适用于RLVR

Konstantin Dobler, Simon Lehnerer, Federico Scozzafava, Jonathan Janke, Mohamed Ali

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出mAceReason-Math数据集,包含14种语言超过10,000个样本的高质量数学问题翻译,旨在提升RLVR在多语言环境下的研究与评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14099 2026-03-16 cs.CV cs.AI 70%

FAPE-IR: Frequency-Aware Planning and Execution Framework for All-in-One Image Restoration

FAPE-IR:面向全场景图像修复的频率感知规划与执行框架

Jingren Liu, Shuning Xu, Qirui Yang, Yun Wang, Xiangyu Chen, Zhong Ji

机构 * Tianjin University(天津大学) University of Macau(澳门大学) City University of Hong Kong(香港城市大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所(TeleAI))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出FAPE-IR框架,通过频率感知规划与执行模块,结合多模态大语言模型和LoRA-MoE架构,实现统一且可解释的全场景图像修复,实验显示其在七项任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18632 2026-03-16 cs.CV cs.AI 70%

Think with 3D: Geometric Imagination Grounded Spatial Reasoning from Limited Views

用3D思考:从有限视角出发的几何想象引导的空间推理

Zhangquan Chen, Manyuan Zhang, Xinlei Yu, Xufang Luo, Mingze Sun, Zihao Pan, Xiang An, Yan Feng, Peng Pei, Xunliang Cai, Ruqi Huang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Meituan(美团) National University of Singapore(新加坡国立大学) Beihang University(北航) LMMs-Lab(LMMs实验室)

专题命中 推理与问题求解 :language model(abstract);foundation model(abstract);分类 cs.AI

AI总结 本文提出3DThinker框架,通过利用图像中的丰富几何信息实现空间推理,无需3D先验输入或显式标注3D数据,在多个基准测试中优于现有方法。

Comments 25 pages, 17 figures

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12644 2026-03-16 cs.CR 67%

Uncovering Security Threats and Architecting Defenses in Autonomous Agents: A Case Study of OpenClaw

揭示自主代理中的安全威胁并构建防御体系:以OpenClaw为例

Zonghao Ying, Xiao Yang, Siyang Wu, Yumeng Song, Yang Qu, Hainan Li, Tianlin Li, Jiakai Wang, Aishan Liu, Xianglong Liu

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文分析了自主代理在安全领域的挑战,提出三层次风险分类和FASA架构,旨在提升自主代理的安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22645 2026-03-16 cs.CV 67%

GeoZero: Incentivizing Reasoning from Scratch on Geospatial Scenes

GeoZero:从零开始激励地理空间场景的推理

Di Wang, Shunyu Liu, Wentao Jiang, Fengxiang Wang, Yi Liu, Xiaolei Qin, Zhiming Luo, Chaoyang Zhou, Haonan Guo, Jing Zhang, Bo Du, Dacheng Tao, Liangpei Zhang

机构 * Wuhan University(武汉大学) Zhongguancun Academy(中关村学院) Nanyang Technological University(南洋理工大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 GeoZero通过构建两个数据集和A$^2$GRPO方法,使大语言模型在无预定义推理链监督下实现地理空间推理,提升了遥感任务的推理多样性和准确性。

Comments Code, data, and models are available at https://github.com/MiliLab/GeoZero

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17476 2026-03-16 cs.CV 67%

The Coherence Trap: When MLLM-Crafted Narratives Exploit Manipulated Visual Contexts

一致性陷阱:当MLLM编写的叙述利用被篡改的视觉上下文

Yuchen Zhang, Yaxiong Wang, Yujiao Wu, Lianwei Wu, Li Zhu, Zhedong Zheng

机构 * School of Software Engineering, Xi’an Jiaotong University(西安交通大学软件工程学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) CSIRO(澳大利亚联邦科学与工业研究组织) Northwestern Polytechnical University(西北工业大学) University of Macau(澳门大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出AMD框架,通过Artifact Pre-perception Encoding策略和Manipulation-Oriented Reasoning,解决MLLM生成的多模态欺骗检测问题,验证了其在跨领域测试中的优越性能。

Comments Accepted to CVPR 2026 main track

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17188 2026-03-16 cs.CL cs.AI cs.IR 62%

Towards AI Search Paradigm

迈向人工智能搜索范式

Yuchen Li, Hengyi Cai, Rui Kong, Xinran Chen, Jiamin Chen, Jun Yang, Haojie Zhang, Jiayi Li, Jiayi Wu, Yiqun Chen, Changle Qu, Wenwen Ye, Lixin Su, Xinyu Ma, Lingyong Yan, Long Xia, Daiting Shi, Junfeng Wang, Xiangyu Zhao, Jiashu Zhao, Haoyi Xiong, Shuaiqiang Wang, Dawei Yin

机构 * Baidu Search(百度搜索)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 本文提出AI搜索范式,通过四个LLM驱动代理动态适应各类信息需求,结合任务规划、工具集成和高效推理方法,构建可信赖、适应性强的下一代搜索系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12717 2026-03-16 cs.RO cs.AI cs.LG 62%

Altered Thoughts, Altered Actions: Probing Chain-of-Thought Vulnerabilities in VLA Robotic Manipulation

改变的思维,改变的行为:探测VLA机器人操作中的链式思维漏洞

Tuan Duong Trinh, Naveed Akhtar, Basim Azam

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨VLA模型中链式思维的脆弱性,发现仅篡改推理轨迹中的物体名称即可显著降低任务成功率,而其他篡改方式影响较小,表明动作解码器依赖实体引用完整性而非推理质量。

详情

展开后加载摘要…

URL PDF HTML 收藏