arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 4522
2609.15989 2026-09-15 cs.AI 新提交

Corrupt Plans, Clean Traces: Evading Chain-of-Thought Monitoring with Plan Injection

腐败计划,干净痕迹:利用计划注入规避思维链监控

Keertana Chidambaram, Andrew Ilyas, Vasilis Syrgkanis

机构 * Stanford University(斯坦福大学) CMU(卡内基梅隆大学)

AI总结 本研究提出“计划注入”攻击,通过在行动者上下文中植入良性推理以规避思维链监控,实验显示在多个基准上达到25-33%的规避率,并发现额外监控资源可能降低检测率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15988 2026-09-15 cs.RO 新提交

ResSafe: Learning Safety Filtering with Residual Reinforcement Learning for Humanoids

ResSafe:基于残差强化学习的人形机器人安全过滤

Gechen Qu, Tong Zhang, Bike Zhang, Yen-Jen Wang, Koushil Sreenath, Claire Tomlin, Jason Jangho Choi

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Los Angeles(加州大学洛杉矶分校)

AI总结 本文提出ResSafe,利用残差强化学习将性能与安全解耦,使残差策略作为隐式安全过滤器,改善人形机器人控制的性能-安全帕累托权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15983 2026-09-15 cs.AI cs.CL cs.LG 新提交

Stellar Colosseum: A Many-Agent Harness for Long-Horizon Research in Mathematics and Theoretical Computer Science

Stellar Colosseum:面向数学与理论计算机科学长时程研究的多智能体框架

Honghao Lin, David P. Woodruff, Yuan Deng, Jieming Mao, Song Zuo, Vahab Mirrokni

机构 * Google Research(谷歌研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对长时程数学与理论计算机科学研究中语言模型不可靠的问题,提出多智能体框架 Stellar Colosseum,通过策略探索、就绪门控、并行候选生成与证伪聚合等方法,在多个基准上取得新结果,并集成到 Google Antigravity 框架中。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15982 2026-09-15 cs.LG cs.AI cs.CL 新提交

The Router Within: Eliciting Native Skill Routing from a Frozen LLM

内在路由器:从冻结的LLM中激发原生技能路由

Ruishuo Chen, Xun Wang, Yu Chen, Zhuoran Li, Longbo Huang

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院)

AI总结 本文提出Gavel方法,利用冻结LLM内部状态通过两个线性映射实现无需上下文的技能路由,在Qwen3-32B上超越外部参数方法,最高提升21.9个百分点,并验证了路由能力随骨干增强而提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15980 2026-09-15 cs.LG cs.CV 新提交

A Chosen Future Can Still Be Rewritten: Causal Writability in Video Models

被选择的未来仍可改写:视频模型中的因果可写性

Xingyun Wang, Haomin Zheng, Man Yuan, Leqian Yang, Ziming Liu

机构 * Tsinghua University(清华大学) Peking University(北京大学) University of Science and Technology of China(中国科学技术大学) MetaCircle Shanghai Qi Zhi Institute(上海期智研究院)

AI总结 本文发现视频模型生成错误运动并非未学到正确运动,而是未使用;通过低维物理变量编辑可恢复正确运动,即因果可写性,并在1.3B模型中验证其普遍性。

Comments 34 pages, 33 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15976 2026-09-15 cs.RO 新提交

MessyMem: Learning-from-Doing Memory for Mobile Manipulation

MessyMem:移动操作中的做中学记忆

Anuva Banwasi, William Muckelroy, Priya Sundaresan, Linfeng Zhao, Jeannette Bohg, Cherie Ho

机构 * Stanford University(斯坦福大学)

AI总结 MessyMem通过持久记忆系统,利用空间3D场景图与交互知识,使移动操作机器人跨任务复用经验,在25任务仿真中任务进度达80%,显著优于基线。

Comments Accepted at CoRL 2026. 26 pages, 8 figures. Project page: https://messymem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15975 2026-09-15 cs.CL cs.LG 新提交

Disentangling Representation Evolution in Transformers through Directional Decomposition

通过方向分解解耦Transformer中的表示演化

Shwai He, Haichao Zhang, Shen Yan

机构 * University of Maryland, College Park(马里兰大学帕克分校) Northeastern University(东北大学) ByteDance(字节跳动)

AI总结 本研究通过方向分解将Transformer表示更新分解为平行与垂直分量,发现值空间平行操作更稳健,并可用于压缩诊断和训练干预。

Comments Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15972 2026-09-15 cs.CL cs.LG 新提交

Mind2Dialogue: Training Human-Aware Language Models by Simulating User Mental States

Mind2Dialogue:通过模拟用户心理状态训练人类感知语言模型

Zixuan Wang, Yufan Zhou, Jinzhou Tang, Xinle Yu, Chengjun Wu, Lyumanshan Ye, Zhaoxiang Feng, Letian Peng, Adyasha Patra, Fan Bai, Enze Ma, Zhengding Hu, Jianyang Gu, Zhao Wang, Yufei Ding, Jingbo Shang, Tianmin Shu, Zhiting Hu, Zhen Wang

机构 * UC San Diego(加州大学圣迭戈分校) KU Leuven(鲁汶大学) University of Illinois Chicago(伊利诺伊大学芝加哥分校) The Ohio State University(俄亥俄州立大学) Johns Hopkins University(约翰斯·霍普金斯大学)

AI总结 提出Mind2Dialogue框架,通过模拟用户心理状态生成优先监督,训练人类感知语言模型,显著提升个性化与心理推理能力。

Comments 40 pages, 10 figures, 11 tables. Project page: https://wannabeyourfriend.github.io/mind2dialogue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15964 2026-09-15 cs.CL 新提交

Verifiable by Construction: Claim-Level Evaluation of Verbatim Citation in Clinical Question Answering

按构造可验证:临床问答中逐字引用的声明级评估

Jiashuo Zhang, Yuling Chen, Yvonne Commodore-Mensah, Michael Oberst

机构 * Johns Hopkins University(约翰霍普金斯大学)

AI总结 本文评估了十二个大型语言模型在临床问答中端到端生成逐字引用并完全证实声明的能力,发现多数模型虽能附加引用,但完全证实率低,揭示了可验证临床QA系统的能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15950 2026-09-15 cs.LG 新提交

Privacy-Aligned Personalized Federated Learning with Compact Adaptation and Variable-Length Gaussian Communication

隐私对齐的个性化联邦学习:紧凑适配与变长高斯通信

Yilin Xu, Chun Hei Michael Shiu, Chih Wei Ling, Linqi Song

机构 * City University of Hong Kong(香港城市大学) University of British Columbia(不列颠哥伦比亚大学) Hebrew University of Jerusalem(耶路撒冷希伯来大学)

AI总结 针对个性化联邦学习中低维客户端变化与高维更新释放的结构错位,提出一次性释放私有上下文并限制适配于系数空间,结合变长量化实现高斯机制,在MNIST和CIFAR-10上匹配或超越全模型私有适配,并大幅降低通信成本。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15940 2026-09-15 cs.RO 新提交

Beyond Single-Axis Testing: Paired Evaluation of Compound Robustness in Vision-Language-Action Policies

超越单轴测试:视觉-语言-动作策略复合鲁棒性的配对评估

Hiroki Sawada, Shunichi Kasahara

机构 * Sony Computer Science Laboratory(索尼计算机科学实验室)

AI总结 针对视觉-语言-动作策略,提出六轴配对基准LIBERO-CTRL,发现复合鲁棒性无法由单轴成功率推断,需逐实例评估以揭示联合扰动下的行为变化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15938 2026-09-15 cs.CL cs.CE cs.MA cs.NE 新提交

HypoEvolve: Genetic Algorithms Enable Multi-Agent LLMs to Discover Scientific Hypotheses

HypoEvolve:遗传算法使多智能体大语言模型能够发现科学假说

Jieyuan Liu, Mengzhou Hu, Jefferson Chen, JungHo Kong, Pratibha Jagannatha, Yiming Gao, Dexter Pratt, Hsin-Yuan Lee, Zhiting Hu, Trey Ideker, Wei Wang, Eric P. Xing, Zhen Wang

机构 * University of California San Diego(加州大学圣迭戈分校) Texas A&M University(德克萨斯A&M大学) Carnegie Mellon University(卡内基梅隆大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

AI总结 HypoEvolve利用代际遗传算法协调多个大语言模型智能体协作,通过明确种群更新规则,在药物重定位的34种癌症类型评估中超越六种基线,提升假说质量。

Comments 22 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15932 2026-09-15 cs.AI 新提交

Recurrent GraphNeural NetworkswithSet-BasedAggregation

循环图神经网络与基于集合的聚合

Blai Bonet

机构 * Universidad Simón Bolívar(西蒙·玻利瓦尔大学)

AI总结 本研究提出循环图神经网络与模态μ-演算片段BΣ°₁之间的双向等价,通过基于集合的聚合和可从权重检查的条件,实现无需计数逻辑或外部信号的符号解释路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15921 2026-09-15 cs.RO 新提交

Touch2Trace: Tactile-Driven Imitation Learning for Dexterous Cable Tracing

Touch2Trace:触觉驱动的灵巧线缆追踪模仿学习

Matteo Grimaldi, David Klee, Ziling Chen, Tong Jian, Wonju Lee, Wenjie Lu, Tao Yu, Saleh Nabi

机构 * Analog Devices, Inc.(亚德诺半导体公司)

AI总结 Touch2Trace提出触觉驱动的模仿学习系统,用于灵巧线缆追踪,通过自监督预训练编码器和Transformer策略,显著提升追踪性能,实现零样本迁移。

Comments Accepted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15919 2026-09-15 cs.AI 新提交

Pilot Early, Commit Late: A Real-Options Model of Enterprise AI Adoption under Rapid Technological Progress

早期试点,后期承诺:快速技术进步下企业AI采纳的真实期权模型

Gaurav Tewari

机构 * Omega Venture Partners(欧米茄风险投资合伙公司)

AI总结 本文构建两期决策模型,分析快速技术进步下企业AI采纳的时机选择,区分部署、试点与等待,证明“早期试点、后期承诺”在组织学习价值足够高时最优,并阐明不确定性、能力与模块化对采纳阈值的影响。

Comments 22 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15915 2026-09-15 cs.LG cs.SY eess.SY 新提交

Safe Meta-Reinforcement Learning via Information Space Reachability

基于信息空间可达性的安全元强化学习

Zeyang Li, Sunbochen Tang, Navid Azizan

机构 * Massachusetts Institute of Technology(麻省理工学院)

AI总结 本文提出一种安全元强化学习框架,通过在信息空间中推理安全性并学习安全值函数,实现适应过程中的安全过滤与约束策略优化,实验验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15910 2026-09-15 cs.RO cs.AI cs.LG 新提交

SlipSense: Multimodal Tactile Learning for Low-Latency and Generalized Slip Detection

SlipSense:用于低延迟和泛化滑动检测的多模态触觉学习

Tong Jian, Aditya Thurvas Senthil Kumar, Xinyi Li, Ziling Chen, Tianyu Dai, Ali Sengul, Matteo Grimaldi, Wenjie Lu, Saleh Nabi, Tao Yu

机构 * Analog Devices, Inc.(亚德诺半导体公司)

AI总结 针对滑动检测延迟与泛化不足,提出基于TacV5的多模态触觉框架SlipSense,融合压阻阵列与加速度计,实现240Hz预测,宏F1达96.7%,并零样本迁移至新平台。

Comments Accepted to CoRL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15903 2026-09-15 cs.LG 新提交

Discrete Beckmann Transport Models for One-Step Language Modeling and Reasoning

离散贝克曼输运模型用于单步语言建模与推理

Sophia Tang, Shiyi Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) Harvard University(哈佛大学) Kempner Institute(肯普纳研究所) IAIFI

AI总结 针对多步采样压缩问题,提出离散贝克曼输运模型(DBTM),利用时间无关流的固定点性质实现单步生成,无需教师蒸馏,在语言建模和推理任务上优于离散扩散与连续流基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15895 2026-09-15 cs.RO eess.IV 新提交

Goal-Oriented Communications for Physical AI: Design and Testbed

面向物理AI的目标导向通信:设计与测试平台

Shutong Chen, Wenkai Zhang, Adnan Aijaz, Miao Guo, Yansha Deng

机构 * Toshiba Europe Ltd.(东芝欧洲有限公司)

AI总结 针对物理AI对低延迟高数据量视频流的需求,本文设计并实现了一个端到端目标导向通信测试平台,通过传输语义表示(3D边界框、2D/3D场景图)显著降低任务完成时间并提高成功率。

Comments Submitting to IEEE for potential publications

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15888 2026-09-15 cs.CV cs.AI 新提交

Anatomical Grounding and Leakage-Aware Multimodal Contrastive Learning for Alzheimer's Disease Classification from Structural MRI

解剖学锚定与泄漏感知的多模态对比学习用于基于结构MRI的阿尔茨海默病分类

Paul-Gabriel Nicolae, Irina Georgiana Mocanu

机构 * National University of Science and Technology POLITEHNICA Bucharest(布加勒斯特国立科技理工大学)

AI总结 本研究针对AD分类中模型关注无关区域及标签泄漏问题,提出解剖学锚定与泄漏感知的对比学习框架,并通过内侧颞叶裁剪将图像准确率提升至65.1%。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15886 2026-09-15 cs.CL 新提交

Inoculation Midtraining with Learned Neologisms

用学习到的新词进行中期接种训练

Kyle O'Brien, Edward James Young, Puria Radmard, Nathalie Kirch, Cameron Tice, Tomek Korbak, David Demitri Africa

机构 * Geodesic Research(大地测量研究) OpenAI UK AI Security Institute(英国人工智能安全研究所)

AI总结 本文提出中期接种训练,通过在中期训练中引入新词标记不安全上下文,减少后期训练中的错位,同时保留良性属性迁移,但效果未超标准方法且边界易泄漏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15883 2026-09-15 cs.LG cs.AI 新提交

Learning Multimodal One-step Flow Policy via Value-weighted Optimal Transport

通过值加权最优传输学习多模态一步流策略

Jaehun Shon, Jinha Choi, Jongwook Jeon, Jongmin Lee

机构 * Yonsei University(延世大学)

AI总结 针对离线强化学习中一步流策略学习的模式坍缩和分布外过估计问题,提出基于值加权最优传输的OptiFlow框架,通过传输引导实现分布内高值模态利用,在多个基准上表现优异。

Comments Preprint, 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15871 2026-09-15 cs.LG cs.AI cs.CR 新提交

LLM-Based Schema-Aware Split Learning for Privacy-Preserving Mental Distress Prediction Across Heterogeneous Surveys

基于LLM的架构感知分裂学习用于跨异构调查的隐私保护心理困扰预测

Md Khalid Syfullah, Alvi Ataur Khalil

机构 * Southern Illinois University Carbondale(南伊利诺伊大学卡本代尔分校)

AI总结 提出一种基于LLM的架构感知分裂学习框架,通过语义编码统一异构调查数据,在保护隐私的同时实现高效协作学习,显著提升准确率并降低客户端计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15870 2026-09-15 cs.RO 新提交

WLA$^3$: World Latent Action Modeling for Semantics, Dynamics, and Kinematics

WLA$^3$:面向语义、动力学和运动学的世界潜在动作建模

Peidong Liu, Zhiyuan Xiang, Mingyang Li, Wenhao Li, Jiale Zhang, Jiahao Sun, Jiawei Li

机构 * Joy Future Academy, JD Group(京东探索研究院)

AI总结 WLA$^3$通过世界潜在动作模型统一学习语义、动力学和运动学表示,利用人类视频和机器人轨迹,在LARYBench和真实机器人任务中显著提升性能。

Comments Project page can be found at https://wla-3.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15863 2026-09-15 cs.CV 新提交

LynnReal-Omni: Native multi-modal Video Generation for Agentic Visual Workflows

LynnReal-Omni:面向智能体视觉工作流的原生多模态视频生成

Xiaofeng Mao, Peijia Lin, Shaohao Rui, Yibo Zhang, Haibin Wan, Weijie Ma

机构 * LynnReal AI

AI总结 LynnReal-Omni提出统一多模态视频生成框架,结合智能体参考控制与扩散模型,实现稳定高质量生成,并通过Flash加速实现实时渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15861 2026-09-15 cs.RO 新提交

DuctAM: A Duct-Assisted Quadrotor-Based Aerial Manipulator Enabling High-Force Push-and-Pull Interactions

DuctAM:一种导管辅助的基于四旋翼的空中机械臂,实现高力推拉交互

Yi Wang, Rui Jin, Xinhang Xu, Haotian Jin, Ruiyang Liu, Yizhuo Yang, Lihua Xie

机构 * Nanyang Technological University(南洋理工大学) NTU–VinUni Joint Research Laboratory for Embodied AI and Robotics(南洋理工大学-维纳大学具身智能与机器人联合研究实验室) VinUniversity(维纳大学)

AI总结 本文提出DuctAM,一种通过集成导管风扇增强水平力能力的四旋翼空中机械臂,采用姿态-力解耦控制,实验验证了其在推拉任务中的高效性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15859 2026-09-15 cs.AI 新提交

LongAgent: History-Guided Agentic Search for Longitudinal Outcome Prediction

LongAgent:用于纵向结局预测的历史引导智能体搜索

Siyao Wang, Florian Guitton, Shuojie Fu, Guanyu Tao, Kai Sun, Wenjia Bai

机构 * Imperial College London(伦敦帝国理工学院)

AI总结 LongAgent 是一种基于智能体的方法,通过历史记忆引导搜索变量组合、时间窗口和聚合函数,在合成数据上提升预测精度,在临床数据上与最佳基线相当。

Comments This paper is accepted to the MICCAI 2026 Agentic AI for Medicine Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15857 2026-09-15 cs.LG eess.SP 新提交

Task-Directed Residual AddUNet:Perfect-Reconstruction Routing for Full-Rate Representations

任务导向的残差AddUNet:全速率表示的完美重建路由

Vikram R. Lakkavalli

机构 * International Institute of Information Technology Bangalore(国际信息技术学院班加罗尔)

AI总结 本文提出残差全速率PR架构,将AddUNet等价于多速率PR滤波器组,通过结构性守恒实现任务导向路由,在TIMIT上显著降低PER并保持精确重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15855 2026-09-15 cs.CL cs.AI cs.LG 新提交

K-Bench: a clinically calibrated benchmark for evaluating large language models in high-risk mental health conversations

K-Bench:一个临床校准的基准,用于评估高风险心理健康对话中的大型语言模型

Laura M. Vowels, Matthew J. Vowels, Shivali Sharma, Apoorv Jha, Rehnuma Choudhury, Wasseem El Sarraj, Rachel Francois-Walcott, Aruba Hussain, Sarah Ingram, Angela Loulopoulou, Adva Segal, Elena Volkova

机构 * University of Roehampton(罗汉普顿大学) Kivira Health University of Hertfordshire(赫特福德大学) University of Surrey(萨里大学) University of Bedfordshire(贝德福德大学) Tavistock Relationships(塔维斯托克关系中心) InsideOut

AI总结 K-Bench是一个临床校准的基准,通过200个多轮高风险心理健康情景评估125种LLM配置,发现领先模型综合风险评分超95,且治疗性提示仅对较弱模型有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.15851 2026-09-15 cs.CL 新提交

Learning to Coach for Experiential Learning

学习教练以进行体验式学习

Guanheng Chen, Tianzhu Ye, Li Dong, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学)

AI总结 提出L2C框架,训练LLM作为教练从演员轨迹中提取经验知识,通过同实例和跨实例奖励优化,在数学推理和文本游戏中优于自我改进,并有效利用推理计算。

Comments 21 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏