arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-08 至 2026-07-08 共收录 68 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2409.06067 2026-07-08 cs.AI cs.CL cs.LG 版本更新 90%

MLLM-LLaVA-FL: Multimodal Large Language Model Assisted Federated Learning

MLLM-LLaVA-FL:多模态大语言模型辅助联邦学习

Jianyi Zhang, Hao Frank Yang, Ang Li, Xin Guo, Pu Wang, Haiming Wang, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Johns Hopkins University(约翰霍普金斯大学) University of Maryland College Park(马里兰大学学院市分校) Lenovo Research(联想研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对联邦学习中数据异质性问题,提出MLLM-LLaVA-FL框架,利用多模态大语言模型,通过全球视觉文本预训练、客户端本地训练和服务器端全局对齐三个阶段,提升联邦学习性能。

Comments Accepted to WACV 2025

Journal ref IEEE/CVF Winter Conference on Applications of Computer Vision (WACV 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11290 2026-07-08 cs.CL 版本更新 85%

Polyglot Teachers: Evaluating Language Models for Multilingual Synthetic Data Generation

多语言教师:评估语言模型用于多语言合成数据生成

Lester James V. Miranda, Ivan Vulić, Anna Korhonen

机构 * Language Technology Lab, University of Cambridge(剑桥大学语言技术实验室)

专题命中 预训练与数据 :language model(title,abstract);SFT(abstract,abstract_cn);分类 cs.CL

AI总结 本文评估了多语言教师模型的有效性,通过Polyglot Score衡量数据质量和学生模型表现,发现Gemma 3和Aya Expanse在不同学生模型家族中表现优异,数据质量如提示多样性、长度和响应流畅度对教学效果影响显著。

Comments Added human evaluation experiment results. Code is in https://github.com/ljvmiranda921/polyglot-teachers

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10547 2026-07-08 cs.SD 版本更新 82%

HeartMuLa: A Family of Open Sourced Music Foundation Models

HeartMuLa:一个开源音乐基础模型家族

Dongchao Yang, Yuxin Xie, Yuguo Yin, Zheyu Wang, Xiaoyu Yi, Gongxi Zhu, Xiaolong Weng, Zihan Xiong, Yingzhe Ma, Dading Cong, Jingliang Liu, Zihang Huang, Jinghan Ru, Rongjie Huang, Haoran Wan, Peixu Wang, Kuoxi Yu, Helin Wang, Liming Liang, Xianwei Zhuang, Yuanyuan Wang, Dingdong Wang, Haohan Guo, Junjie Cao, Zeqian Ju, Songxiang Liu, Yuewen Cao, Heming Weng, Yuexian Zou

机构 * HeartMuLa Teams(HeartMuLa团队)

专题命中 预训练与数据 :foundation model(title,abstract);LLM(abstract)

AI总结 介绍开源音乐基础模型家族HeartMuLa,含四个组件及两种特殊模式,能跨任务和模态推动音乐理解与生成,扩展到7B参数时有显著改进,可重现商业级系统,为未来研究提供基线并促进多模态应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19710 2026-07-08 cs.CV cs.LG cs.RO 版本更新 79%

PoseVLA: Universal Pose Pretraining for Generalizable Vision-Language-Action Policies

面向通用视觉-语言-动作策略的通用姿态预训练

Haitao Lin, Hanyang Yu, Jingshun Huang, He Zhang, Yonggen Ling, Ping Tan, Xiangyang Xue, Yanwei Fu

机构 * Tencent Robotics X(腾讯机器人X) Futian Laboratory(福田实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :pretraining(title);post-training(abstract);分类 cs.LG

AI总结 本文提出Pose-VLA,通过分离预训练和后训练阶段,解决视觉-语言-动作模型中的特征坍塌和训练效率问题,实现通用3D空间先验提取与机器人特定动作空间的高效对齐。

Comments Accepted to Robotics: Science and Systems (RSS) 2026. Project website: https://hetolin.github.io/PoseVLA

Journal ref Robotics: Science and Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24690 2026-07-08 cs.CV 版本更新 67%

UniICL: Systematizing Unified Multimodal In-context Learning through a Capability-Oriented Taxonomy

UniICL:通过能力导向的分类系统化统一多模态上下文学习

Yicheng Xu, Jiangning Zhang, Zhucun Xue, Teng Hu, Ran Yi, Xiaobin Hu, Yong Liu, Dacheng Tao

机构 * Zhejiang University(浙江大学) Shanghai Jiaotong University(上海交通大学) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 本文提出能力导向的分类系统,通过构建UniICL-760K语料库和UniICL-Bench评估体系,提出Context-Adaptive Prototype Modulator模块,提升多模态少样本学习效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22600 2026-07-08 cs.LG cs.AI 版本更新 62%

Transformers converge to invariant algorithmic cores

Transformer收敛到不变的算法核心

Joshua S. Schiffman

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究从Transformer偶然行为转向必然操作,用算法核心提取(ACE)隔离子空间等,发现不同Transformer的功能冗余及语言模型主谓语一致的控制轴,揭示其有简单共享计算结构,针对不变量利于理解和控制机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30611 2026-07-08 cs.CV 版本更新 50%

Reweighting Framewise Attention in Video Transformers for Facial Expression Understanding

视频Transformer中重加权帧级注意力用于面部表情理解

Seongro Yoon, Donghyeon Cho, Jinsun Park, François Brémond

机构 * Inria, Université Côte d’Azur, France(法国国家信息与自动化研究所、法国滨海阿尔卑斯大学) Hanyang University, South Korea(韩国家阳大学) Pusan National University, South Korea(韩国釜山国立大学)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 提出MiRA框架,通过重加权帧级注意力增强ViT对细微面部动态的时空选择性,无需额外参数,在表情识别基准上持续提升性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 1 篇

2601.12494 2026-07-08 cs.SD cs.AI cs.CL eess.AS 版本更新 93%

Multi-Task Instruction Tuning via Data Scheduling for Low-Resource Arabic SpeechLLMs

通过数据调度实现低资源阿拉伯语音频LLM的多任务指令微调

Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

机构 * Qatar Computing Research Institute(卡塔尔计算研究院)

专题命中 指令微调 :LLM(title_cn,summary_cn);instruction tuning(title,abstract);large language model(abstract,comments);language model(abstract,comments)

AI总结 本文研究了在资源受限环境下,通过数据调度优化多任务指令微调方法,提出AraMega-SSum用于训练和评估阿拉伯语中心的音频LLM,并比较了四种训练策略,发现两阶段TPC→ADS策略在任务平衡上表现最佳。

Comments Foundation Models, Large Language Models, Native, Speech Models, Arabic

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 3 篇

2602.00846 2026-07-08 cs.CL 版本更新 86%

Omni-RRM: Advancing Omni Reward Modeling via Automatic Rubric-Grounded Preference Synthesis

Omni-RRM:通过基于自动评分标准的偏好合成推进全模态奖励建模

Zicheng Kong, Dehua Ma, Zhenbo Xu, Alven Yang, Yiwei Ru, Haoran Wang, Zixuan Zhou, Fuqing Bie, Liuyu Xiang, Huijia Wu, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究所) ShiFang Technology Inc.(ShiFang科技公司)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);RLHF(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究针对多模态大语言模型对齐难题,提出全模态基于评分标准的奖励模型Omni-RRM。通过自动评分标准偏好合成构建数据集,用特定训练方案提升奖励辨别力,在多模态基准测试中达最优精度,还能指导选择与迁移,提升模型对齐能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05294 2026-07-08 cs.CL 版本更新 84%

Truthful or Fabricated? Using Causal Attribution to Mitigate Reward Hacking in Explanations

真实还是编造?利用因果归因减轻解释中的奖励作弊

Pedro Ferreira, Wilker Aziz, Ivan Titov

机构 * Institute for Logic, Language and Computation (ILLC), University of Amsterdam(逻辑、语言与计算研究所(ILLC),阿姆斯特丹大学) Institute for Language, Cognition and Computation (ILCC), University of Edinburgh(语言、认知与计算研究所(ILCC),爱丁堡大学)

专题命中 后训练与偏好优化 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 研究大语言模型解释中因奖励模型导致的奖励作弊问题,提出用预测的因果归因丰富奖励模型输入的方法,该方法能减少大语言模型生成误导性解释的倾向,提升解释忠实度。

Comments ICLR 2026 Camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00860 2026-07-08 cs.LG 版本更新 70%

Policy Improvement Reinforcement Learning

策略改进强化学习

Huaiyang Wang, Xiaojie Li, Xiaohan Wang, Zhixia Zhang, Xiaodong Lu, Zixuan Huang, Jiajun Chai, Guojun Yin, Deqing Wang, Haoyi Zhou, Yaodong Yang, Jianxin Li, Yikun Ban

机构 * Beihang University(北航) Peking University(北京大学)

专题命中 后训练与偏好优化 :LLM(abstract);post-training(abstract);分类 cs.LG

AI总结 提出策略改进强化学习(PIRL)框架,通过最大化跨迭代的累积策略改进来替代替代奖励最大化,并基于此设计策略改进策略优化(PIPO)算法,实现闭环优化,在数学推理基准上提升稳定性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 1 篇

2605.25451 2026-07-08 cs.LG 版本更新 90%

BigMac: Breaking the Pareto Frontier of Compute and Memory in Multimodal LLM Training

BigMac: 打破多模态大语言模型训练中的计算与内存帕累托前沿

Zili Zhang, Chengxu Yang, Shenglong Zhang, Chenyu Wang, Yufan Zhang, Tuo Dai, Zhouyang Li, Yuhong Ge, Chao Jin, Xin Jin, Yuliang Liu

机构 * Peking University(北京大学) Independent Researcher(独立研究员) Xiaohongshu, Inc(小红书公司)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出BigMac训练流水线,通过嵌套编码器和生成器计算到LLM流水线中,同时优化计算效率和内存使用,打破帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 13 篇

2604.02537 2026-07-08 cs.CL cond-mat.mtrl-sci 版本更新 90%

PolyJarvis: An LLM-Orchestrated Agent for Automated All-Atom Molecular Dynamics of Amorphous Homopolymers

PolyJarvis:用于自主聚合物分子动力学模拟的LLM代理

Alexander Zhao, Achuth Chandrasekhar, Amir Barati Farimani

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PolyJarvis结合大语言模型与RadonPy平台,通过MCP服务器实现从自然语言输入自主执行聚合物分子动力学模拟,预测密度、体积模量和玻璃化温度等性质,验证结果在不同聚合物中表现良好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.07892 2026-07-08 cs.SE cs.AI 版本更新 89%

Leveraging Metamemory Agent for Enhanced Data-Free Code Generation in Large Language Models

利用元记忆智能体增强大语言模型的无数据代码生成

Shengsheng Zhou, Shuai Wang, Liang Ding, Yibing Zhan, Yong Luo, Zheng He, Fu Lin, Dapeng Tao

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院,新加坡) School of Computer Science, National Engineering Research Center for Multimedia Software, Wuhan University, Wuhan, China(多媒体软件国家工程研究中心计算机学院,武汉大学,中国) The University of Sydney, Sydney, Australia(悉尼大学,澳大利亚) Yunnan United Vision Technology Company Ltd., China(云南联合视界技术有限公司,中国) School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院,中国) School of Information Science and Engineering, Yunnan University, Kunming, China(云南大学信息科学与工程学院,中国)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI

AI总结 提出元记忆智能体,通过引导模型回忆、评估和选择性利用相关知识,无需外部示例即可提升无数据场景下的单次代码生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15631 2026-07-08 cs.LG cs.AI 版本更新 88%

The relationship between reasoning and performance in large language models--o3 (mini) thinks harder, not longer

大语言模型中推理与性能的关系——o3(mini)思考更深入,而非更久

Marthe Ballon, Andres Algaba, Vincent Ginis

机构 * Data Analytics Lab, Vrije Universiteit Brussel(布鲁塞尔自由大学数据分析实验室) School of Engineering and Applied Sciences, Harvard University(哈佛大学工程与应用科学学院)

专题命中 推理与问题求解 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型推理与性能的关系,在Omni - MATH基准上分析o1 - mini和o3 - mini变体推理链长度,发现o3 - mini(m)无需更长推理链就能实现更高准确率,还表明推理链增长时准确率通常下降,为模型能力与推理长度关系提供新见解。

Comments 19 pages, 14 figures. Sci Rep (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10758 2026-07-08 cs.CR 版本更新 87%

Agents at Risk: How Users Unwittingly Undermine LLM Safety

处于风险中的智能体:用户如何在不知情的情况下破坏大语言模型的安全性

Fengchao Chen, Tingmin Wu, Van Nguyen, Surya. Nepal, Carsten Rudolph

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 研究基于大语言模型的智能体安全问题,介绍用户中继上下文操纵攻击,通过让良性用户在请求中传递对抗性内容,实验表明该攻击在多种防御下优于提示注入基线,揭示当前智能体框架设计缺陷。

Comments User-relayed Context Manipulation; LLM-based Agents; Agent Security; Human Factors in Cybersecurity; Web-Use Agents; Planning Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20182 2026-07-08 cs.RO cs.MA 版本更新 87%

IndoorR2X: Indoor Robot-to-Everything Coordination with LLM-Driven Planning

IndoorR2X: 基于大语言模型的室内机器人与万物协调

Fan Yang, Soumya Teotia, Shaunak A. Mehta, Prajit KrisshnaKumar, Quanting Xie, Jun Liu, Yueqi Song, Wenkai Li, Atsunori Moteki, Kanji Uchino, Yonatan Bisk

机构 * Fujitsu Research(富士通研究所) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理与问题求解 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 IndoorR2X通过整合移动机器人和静态物联网设备的观测数据,构建全局语义状态,实现可扩展的场景理解、减少冗余探索并利用大语言模型进行高层协调,提升多机器人系统的效率和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14147 2026-07-08 cs.CV 版本更新 87%

LaViDa-R1: Advancing Reasoning for Unified Multimodal Diffusion Language Models

LaViDa-R1:推进统一多模态扩散语言模型的推理

Shufan Li, Yuchen Zhu, Jiuxiang Gu, Kangning Liu, Zhe Lin, Yongxin Chen, Molei Tao, Aditya Grover, Jason Kuen

机构 * Adobe UCLA(加州大学洛杉矶分校) Georgia Tech(佐治亚理工学院)

专题命中 推理与问题求解 :language model(title,abstract);SFT(abstract,abstract_cn);post-training(abstract)

AI总结 研究提出多模态通用推理dLLM LaViDa-R1,不同于现有工作,它以统一方式整合多任务,采用新颖统一训练后框架,集成监督微调与多任务强化学习,并运用多种训练技术,在多模态任务上展现强大性能。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19771 2026-07-08 cs.AI 版本更新 79%

Beyond Reactivity: Measuring Proactive Problem Solving in LLM Agents

超越反应性:衡量大语言模型智能体中的主动解决问题能力

Gil Pasternak, Dheeraj Rajagopal, Julia White, Dhruv Atreja, Matthew Thomas, George Hurn-Maloney, Ash Lewis

专题命中 推理与问题求解 :LLM(title,abstract);分类 cs.AI

AI总结 研究旨在衡量大语言模型智能体的主动解决问题能力。提出PROBE方法,将主动性分解为三个核心能力。应用该方法评估领先模型和框架,发现即使最先进的模型表现也不佳,GPT-5和Claude Opus-4.1最佳端到端性能为40%,突出局限并揭示未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07089 2026-07-08 cs.CV 版本更新 75%

RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent

RS-Agent:通过智能代理实现遥感任务自动化

Wenjia Xu, Zijian Yu, Boyang Mu, Jiuniu Wang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(网络与交换技术国家重点实验室,北京邮电大学,中国) City University of HongKong, Hong Kong 999077, China(香港城市大学,中国) School of Geographic Sciences, Hunan Normal University, Changsha 410081, China(地理科学学院,湖南师范大学,中国)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型在遥感任务中的局限,提出RS-Agent智能代理,通过结构化任务规划等连接用户意图与遥感流程,含四个组件及两种方法,实验显示其在多任务中显著优于现有模型,证明结合两者用于智能地理空间分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15600 2026-07-08 cs.RO cs.AI cs.CL cs.CV 版本更新 73%

From Passive Observer to Active Critic: Reinforcement Learning Elicits Process Reasoning for Robotic Manipulation

从被动观察者到主动批评者:强化学习激发机器人操作的过程推理

Yibin Liu, Yaxing Lyu, Daqi Gao, Zhixuan Liang, Weiliang Tang, Shilong Mu, Xiaokang Yang, Yao Mu

机构 * Shanghai Jiao Tong University(上海交通大学) Northeastern University(东北大学) Xiamen University Malaysia(厦门大学马来西亚分校) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Xspark AI

专题命中 推理与问题求解 :SFT(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出PRIMO R1框架,通过强化学习使视频MLLMs成为主动批评者,提升机器人操作中长期任务的监督准确性,实验表明其在过程推理和零样本泛化方面表现优异。

Comments Accepted to ECCV 2026. 32 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30794 2026-07-08 cs.CV cs.AI 版本更新 70%

MechVQA: Benchmarking and Enhancing Multimodal LLMs on Comprehensive Mechanical Drawing Understanding

MechVQA:在综合机械图纸理解上基准测试与增强多模态大语言模型

Qian Kou, Xiaofeng Shi, Yulin Li, Xiaosong Qiu, Xinyang Wang, Hua Zhou, Cao Dongxing

机构 * Beijing Academy of Artificial Intelligence (BAAI), China(北京人工智能研究院) Institute of Information Engineering, Chinese Academy of Sciences, China(信息工程研究所) Beijing University of Technology, China(北京理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在机械工程图纸理解上的不足,提出首个综合机械图纸理解数据集MechVQA,并开发MechVL模型,通过多阶段训练显著提升性能。

Comments accept by iclm2026, add github link

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23020 2026-07-08 cs.CV cs.AI 版本更新 57%

OpenGround: Planning-based Online Perception for Open-World 3D Visual Grounding

OpenGround:基于规划的开放世界3D视觉定位在线感知

Wenyuan Huang, Zhenyu Zhang, Zhao Wang, Zhou Wei, Ting Huang, Fang Zhao, Jian Yang

机构 * Nanjing University, School of Intelligent Science and Technology(南京大学智能科学与技术学院) China Mobile Zijin Innovation Institute(中国移动紫金创新院)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 针对开放世界3D视觉定位中现有方法的局限,提出OpenGround框架,集成任务链规划与上下文引导感知,还构建OpenTarget数据集。实验表明其在多个数据集上性能优异,在开放世界评估中有显著提升。

Comments ECCV2026, 46 pages, 13 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20342 2026-07-08 cs.HC cs.AI cs.CY 版本更新 57%

Narrative-Centered Emotional Reflection: An Early Prototype for AI-Supported Emotional Self-Reflection

以叙事为中心的情感反思:人工智能支持的情感自我反思的早期原型

Shou-Tzu Han

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI

AI总结 该研究以Reflexion为早期原型,通过整合情感检测、分层反思提示和隐喻故事生成等方法,探索结构化情感自我反思,支持用户超越基本情感分类进行自主情感探索,记录了理论驱动的情感计算方向。

Comments 7 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01642 2026-07-08 cs.RO 版本更新 50%

FailSafe: Reasoning and Recovery from Failures in Vision-Language-Action Models

FailSafe: 视觉-语言-动作模型中的失败推理与恢复

Zijun Lin, Jiafei Duan, Haoquan Fang, Dieter Fox, Ranjay Krishna, Cheston Tan, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(A*STAR前沿人工智能研究中心) Allen Institute for AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出FailSafe系统,自动生成多样化失败案例及可执行恢复动作,微调LLaVA-OV-7B构建FailSafe-VLM,使机器人检测并恢复失败,在ManiSkill任务上平均提升三个VLA模型性能达22.6%。

Comments IROS 2026. Project Page: https://jimntu.github.io/FailSafe

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 评测与基准 21 篇

2606.00476 2026-07-08 cs.AI 版本更新 90%

Doing What They Say, Not What They Reason: Locating the Faithfulness Gap in LLM Agents

做他们所说的,而不是他们所推理的:定位LLM智能体中的忠实性差距

Yufeng Wang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 通过将忠实性差距分解为推理-结论和结论-行动两个步骤,在可控的德克萨斯扑克模拟器中研究LLM智能体是否按照其陈述的推理行动。

Comments submitted to COLM social simulation with LLM workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27140 2026-07-08 cs.CR 版本更新 89%

Measuring the Security of Mobile LLM Agents under Adversarial Prompts from Untrusted Third-Party Channels

在来自不受信任第三方渠道的对抗性提示下衡量移动大语言模型代理的安全性

Chenghao Du, Quanfeng Huang, Tingxuan Tang, Zihao Wang, Adwait Nadkarni, Yue Xiao

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究移动LLM代理在对抗性环境下的安全风险,设计评估一系列案例研究,涵盖多种攻击类型并涉及多个先进移动代理,通过大量试验揭示系统漏洞,映射攻击到相关框架发现新途径,证明其在现实中可被利用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02964 2026-07-08 cs.CR 版本更新 89%

External Data Extraction Attacks against Retrieval-Augmented Large Language Models

针对检索增强型大语言模型的外部数据提取攻击

Yu He, Yifei Chen, Yiming Li, Shuo Shao, Leyi Qi, Boheng Li, Dacheng Tao, Zhan Qin

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究针对检索增强型大语言模型的外部数据提取攻击,提出统一框架并开发SECRET攻击方法,该方法含自适应优化与聚类聚焦触发策略,实验显示其显著优于先前攻击,能有效提取数据,呼吁关注此新兴威胁。

Comments Accepted by IEEE TIFS

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23826 2026-07-08 cs.CV cs.CL 版本更新 86%

Decomposing Queries into Tool Calls for Long-Video Keyframe Retrieval

将查询分解为工具调用以进行长视频关键帧检索

Michal Shlapentokh-Rothman, Prachi Garg, Yu-Xiong Wang, Derek Hoiem

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ToolMerge方法,通过LLM规划器将查询分解为工具调用并使用布尔运算符合并排名,实现长视频关键帧检索,在字幕检索任务上优于其他方法5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22851 2026-07-08 cs.CV cs.CL cs.RO 版本更新 83%

EgoDyn-Bench: Evaluating Ego-Motion Understanding in Vision-Centric Foundation Models for Autonomous Driving

EgoDyn-Bench:评估面向自动驾驶的视觉中心基础模型中的自我运动理解

Finn Rasmus Schäfer, Yuan Gao, Dingrui Wang, Thomas Stauner, Stephan Günnemann, Mattia Piccinini, Sebastian Schmidt, Johannes Betz

机构 * Professorship of Autonomous Vehicle Systems, Technical University of Munich, Munich, Germany(自动驾驶车辆系统教授职位,慕尼黑技术大学,德国慕尼黑) Bayerische Motoren Werke AG, Munich, Germany(巴伐利亚发动机有限公司,德国慕尼黑) Data Analytics and Machine Learning Group, Technical University of Munich, Munich, Germany(数据分析与机器学习小组,慕尼黑技术大学,德国慕尼黑)

专题命中 评测与基准 :foundation model(title,abstract);language model(abstract);分类 cs.CL

AI总结 本文提出EgoDyn-Bench基准,用于评估视觉中心基础模型的自我运动理解能力,发现模型在将物理逻辑与视觉感知结合时存在结构性缺陷,通过显式轨迹编码可恢复物理一致性。

Comments 36 Pages, Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏