arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 878 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 878 篇

2507.07574 2026-06-18 cs.CV 版本更新 50%

Beyond the Linear Separability Ceiling: Aligning Representations in VLMs

超越线性可分上限:对齐视觉-语言模型中的表征

Enrico Vompa, Tanel Tammet, Mohit Vaishnav

机构 * Applied Artificial Intelligence Group(应用人工智能小组) Tallinn University of Technology(塔林技术大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出线性可分上限(LSC)诊断框架,发现VLM存在对齐差距,并通过对比目标重塑视觉流形,使模型在抽象组合推理任务上显著超越LSC。

Comments Accepted TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18746 2026-06-17 cs.CV 版本更新 50%

Bridging Modality Disconnect in Self-Reflection via Closed-Loop Visually Grounded Verification

通过闭环视觉基础验证弥合自我反思中的模态脱节

Haoyu Zhang, Yuwei Wu, Pengxiang Li, Xintong Zhang, Zhi Gao, Rui Gao, Mingyang Gao, Che Sun, Yunde Jia

机构 * Beijing Institute of Technology(北京理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出MIRROR框架,通过闭环视觉反思(草稿-批评-区域验证-修订)减少VLM幻觉,并构建ReflectV数据集训练视觉基础的多轮反思。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13090 2026-06-16 cs.RO 版本更新 50%

Multi-Robot Motion Planning from Vision and Language using Heat-Inspired Diffusion

基于热启发的扩散模型实现从视觉和语言的多机器人运动规划

Jebeom Chae, Junwoo Chang, Seungho Yeom, Yujin Kim, Jongeun Choi

机构 * Department of Artificial Intelligence, Yonsei University(燕山大学人工智能学院) School of Mechanical Engineering, Yonsei University(燕山大学机械工程学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出LHD框架,结合CLIP语义先验与碰撞避免扩散核,实现语言条件化的多机器人无碰撞轨迹规划,在成功率上优于先前方法并降低延迟。

Comments 8 pages, 6 figures, accepted by IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 6, pp. 7118-7125, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10840 2026-06-16 cs.CV 版本更新 50%

PoseGAM: Robust Unseen Object Pose Estimation via Geometry-Aware Multi-View Reasoning

PoseGAM: 通过几何感知多视图推理实现鲁棒的未见物体姿态估计

Jianqi Chen, Biao Zhang, Xiangjun Tang, Peter Wonka

机构 * KAUST(卡塔尔科技大学)

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出PoseGAM,一种基于多视图基础模型的几何感知框架,直接预测未见物体的6D姿态,无需显式匹配,通过点云几何和特征网络整合几何信息,在多个基准上平均AR提升5.1%。

Comments Accepted by CVPR 2026 (Oral). Project page: https://windvchen.github.io/PoseGAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04717 2026-06-11 cs.CR cs.CY 版本更新 50%

Auditing CoT Answer-Hijack Patches: Source-Control Certificates with Type-I Guarantees

链式思维答案劫持的选择感知诊断

Jianwei Tai

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对链式思维答案劫持攻击,提出选择感知诊断方法,通过激活修补定位脆弱区域,并验证恢复依赖于同问题干净源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11548 2026-06-11 cs.CV 版本更新 50%

How Auxiliary Reasoning Unleashes GUI Grounding in VLMs

辅助推理如何释放VLM中的GUI定位能力

Weiming Li, Yan Shao, Jing Yang, Yujing Lu, Ling Zhong, Yuhan Wang, Min Yu, Tongxiao Ruan, Manni Duan

机构 * Zhejiang Lab(浙江实验室) Hangzhou Research and Development Center(杭州研发中心) China Mobile(中国移动) Innovation Center of Yangtze River Delta(长江三角洲创新中心) Zhejiang University(浙江大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 针对VLM在GUI定位任务中隐式空间理解强但显式坐标输出弱的问题,提出三种零样本辅助推理方法(如标记网格),通过输入图像添加空间线索,显著提升定位性能,在多个基准上达到接近最优微调方法的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05645 2026-06-10 cs.RO 版本更新 50%

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Discrete-WAM:面向世界-策略学习的统一离散视觉-动作标记编辑

Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

机构 * Xiaomi EV(小米电动车)

专题命中 推理与问题求解 :pretraining(abstract)

AI总结 提出Discrete-WAM,通过将未来视觉状态和自车动作对齐为离散标记,构建统一离散扩散框架,实现世界建模、世界-动作策略和分层决策策略的联合学习,支持可控生成和反事实推理,提升自动驾驶决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22238 2026-06-09 cs.RO 版本更新 50%

CodeGraphVLP: Code-as-Planner Meets Semantic-Graph State for Non-Markovian Vision-Language-Action Models

CodeGraphVLP:代码规划器与语义图状态的结合用于非马尔可夫视觉-语言-动作模型

Khoa Vo, Sieu Tran, Taisei Hanyu, Yuki Ikebe, Duy Nguyen, Nghi D. Q. Bui, Minh Vu, Anthony Gunderman, Chase Rainwater, Anh Nguyen, Ngan Le

机构 * University of Arkansas(亚拉巴马大学) Max Planck Research School for Intelligent Systems and the University of Stuttgart(马克斯·普朗克智能系统研究学校和斯图加特大学) Center of AI Research, VinUniversity(Vin大学人工智能研究中心) TU Wien(维也纳技术大学) University of Liverpool(利物浦大学)

专题命中 推理与问题求解 :prompting(abstract)

AI总结 CodeGraphVLP结合语义图状态与可执行代码规划器,提升非马尔可夫长周期任务的视觉语言动作执行效率,降低规划延迟并提高任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏