arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-07-16 至 2026-07-16 共收录 89 信号源:cs.CL, cs.AI, cs.LG

1. 规划推理 14 篇

2607.01531 2026-07-16 cs.AI cs.LG 版本更新 62%

OPINE-World: Programmatic World Modeling with Ontology-error-Prioritized Interactive Exploration for ARC-AGI-3

OPINE-World:基于本体错误优先的交互式探索的程序化世界建模

David Courtis, Wenhao Li, Scott Sanner

机构 * University of Toronto(多伦多大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI、cs.LG

AI总结 提出OPINE-World,一种在线交互学习面向对象的程序化世界模型的LLM智能体,通过本体错误度量引导探索,在ARC-AGI-3基准上无需逐游戏训练即解决20/25个游戏,动作效率达78.4。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13988 2026-07-16 cs.LG 新提交 57%

TRACE: Turn-level Reward Assignment via Credit Estimation for Long-Horizon Agents

TRACE:通过信用估计进行长期奖励分配的回合级奖励分配

Leitian Tao, Baolin Peng, Wenlin Yao, Tao Ge, Hao Cheng, Mike Hang Wang, Jianfeng Gao, Sharon Li

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

专题命中 规划推理 :reasoning(abstract);分类 cs.LG

AI总结 研究针对多轮智能体训练后的信用分配难题,提出TRACE方法,通过特定状态转换、对数概率获取及转换等步骤进行奖励分配。该方法无需额外训练,在长期复杂搜索任务中显著提升基础模型工具使用能力,在基准测试中表现良好且学习曲线更佳。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13285 2026-07-16 cs.AI cs.SE 新提交 57%

Harness Handbook: Making Evolving Agent Harnesses Readable,Navigable, and Editable

Harness手册:使不断演进的智能体框架具有可读性、可导航性和可编辑性

Ruhan Wang, Yucheng Shi, Zongxia Li, Zhongzhi Li, Yue Yu, Junyao Yang, Kishan Panaganti, Haitao Mi, Dongruo Zhou, Leoweiliang

机构 * Tencent(腾讯) Indiana University(印第安纳大学) University of Maryland, College Park(马里兰大学帕克分校) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学)

专题命中 规划推理 :planning(abstract);分类 cs.AI

AI总结 研究智能体框架演进中行为定位难的问题,提出通过Harness手册和行为引导的渐进式披露,以行为为中心自动合成框架表示并辅助规划,提高行为定位和编辑计划质量,助力复杂智能体系统发展。

Comments 29 pages, 6 figures. Project page: https://ruhan-wang.github.io/Harness-Handbook/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11722 2026-07-16 cs.CL 版本更新 57%

STEP: Career-Path Recommendation via Temporal and Educational Trajectory Modeling

STEP:通过时间和教育轨迹建模进行职业路径推荐

Iman Johary, Guillaume Bied, Alexandru C. Mara, Tijl De Bie

机构 * AIDA-IDLab, Ghent University(AIDA-ID实验室,根特大学)

专题命中 规划推理 :planning(abstract);分类 cs.CL

AI总结 研究利用大语言模型从简历获取职业轨迹数据,提出STEP职业路径推荐系统,通过集成时间衰减GRU、FiLM及注意力序列池化预测下一份工作,引入ROUTE改进职业表示,在多数据集评估中优于基准,还公开了数据集和代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16944 2026-07-16 cs.AI cs.HC 版本更新 57%

A Causal Model of Theory of Mind in Conflict for Artificial Intelligence

冲突情境下心智理论的人工智能因果模型

Nikolos Gurney

机构 * Institute for Creative Technologies, University of Southern California(南加州大学创意技术研究所)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 提出结构因果模型,将心智理论视为由情境和主体条件激活的机制,通过三条因果路径决定何时进行心智化,提升AI社会推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06223 2026-07-16 cs.AI 版本更新 57%

From Reward-Hack Activations to Agentic Risk States: Context-Calibrated Mechanistic Monitoring in LLM Agents

从奖励黑客激活到智能体风险状态:LLM智能体中的上下文校准机制监控

Patrick Wilhelm, Odej Kao

机构 * University of Cambridge(剑桥大学)

专题命中 规划推理 :reasoning(abstract);分类 cs.AI

AI总结 本研究通过分析ReAct风格智能体在Gameable ALFWorld和WebShop环境中的奖励黑客行为,提出结合激活状态、熵和决策上下文的上下文校准监控方法,以更准确评估智能体风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉空间推理 11 篇

2607.13860 2026-07-16 cs.CV 新提交 85%

Towards Enhancing 3D Spatial Reasoning in Medical Multimodal Large Language Models

迈向增强医学多模态大语言模型中的 3D 空间推理

Zhuoyuan Fu, Zeshang Li, Yiqiong Zhang, Hangui Lin, Yan Shu, Yan Li, Binyang Li, Yaru Zhao

机构 * University of International Relations(国际关系学院)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究旨在增强医学多模态大语言模型的 3D 空间推理。通过新型逐片数据合成范式构建结构化推理数据集,用其对二维预训练模型进行指令微调,提升了模型在 3D 医学基准测试中的性能,缩小了与原生 3D 架构的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13539 2026-07-16 cs.CV cs.GR 新提交 85%

ThinkBLOX: 3D Indoor Scene Generation with Progressive Reasoning

ThinkBLOX:基于渐进推理的3D室内场景生成

Yuan Xiao, Can Wang, Xiangyu Kong, Jing Liao

机构 * City University of Hong Kong(香港城市大学) University of Hong Kong(香港大学) Beijing Information Science and Technology University(北京信息科技大学)

专题命中 视觉空间推理 :reasoning(title,abstract);chain-of-thought(abstract);CoT(abstract)

AI总结 研究针对传统与现有3D室内场景生成方法不足,提出基于VLM的渐进推理框架ThinkBLOX,构建数据集并采用监督微调与新强化学习方案,在多方面优于基线,支持多样3D场景应用。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13558 2026-07-16 cs.AI 新提交 79%

Multi-Agent Collaborative Reasoning with Tool-Augmented Evidence for Urban Region Profiling

基于工具增强证据的多智能体协作推理用于城市区域剖析

Xixuan Hao, Yutian Jiang, Jiabo Liu, Yihang Yang, Guangyin Jin, Song Gao, Yuxuan Liang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) University of Washington(华盛顿大学) Chang’an University(长安大学) University of Wisconsin - Madison(威斯康星大学麦迪逊分校)

专题命中 视觉空间推理 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对城市区域剖析问题,提出UrbanAgent框架,通过多智能体协作推理解决跨模态不一致,将指标预测扩展为闭环过程,经实验验证其性能优于现有基线,在未见城市设置中有强泛化性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12503 2026-07-16 cs.CV 版本更新 78%

DynTrace: Tracking Dynamic Object Evidence for 4D Spatio-Temporal Reasoning in MLLMs

DynTrace:用于多模态大语言模型中4D时空推理的动态对象证据跟踪

Rongxin Gao, Yuzhi Huang, Dongxuan Liu, Chu Li, Zhenye Wang, Jie Wu, Shuzhao Xie, Jingyan Jiang, Xinghao Ding, Xiaotong Tu, Yue Huang

机构 * Xiamen University(厦门大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学)

专题命中 视觉空间推理 :reasoning(title,abstract)

AI总结 研究针对多模态大语言模型在连续动态场景感知中跟踪动态对象证据的局限,提出DynTrace框架,含DTV和DT-Token两个互补组件,能为模型提供基于几何视觉先验和结构化时空轨迹的动态对象证据,在多个基准测试中达先进水平。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13877 2026-07-16 cs.LG 新提交 57%

AI-Augmented Adaptive Digital Twin Modeling for Brain Tumor Evolution Prediction and Treatment Scheduling

用于脑肿瘤进化预测和治疗计划安排的人工智能增强自适应数字孪生建模

Wenxi Liu, Michael Trimboli, Xianqi Li

机构 * Florida Institute of Technology(佛罗里达理工学院) Department of Mathematics and Systems Engineering(数学与系统工程系)

专题命中 视觉空间推理 :planning(abstract);分类 cs.LG

AI总结 针对脑肿瘤进化预测和治疗计划难题,提出人工智能增强自适应数字孪生框架,集成多种模型与方法。实验表明该框架能有效提升预测准确性,降低肿瘤负荷,为患者特异性治疗优化提供统一框架,奠定向现实治疗计划转化基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13451 2026-07-16 cs.RO cs.AI cs.CV 新提交 57%

Learning Physics-Guided Residual Dynamics for Deformable Object Simulation

学习用于可变形物体模拟的物理引导残差动力学

Shivansh Patel, Kaifeng Zhang, Sanjay Pokkali, Svetlana Lazebnik, Yunzhu Li

机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) Columbia University(哥伦比亚大学)

专题命中 视觉空间推理 :planning(abstract);分类 cs.AI

AI总结 研究针对可变形物体模拟中动力学预测难的问题,提出物理引导残差动力学(PGRD)框架,结合物理与学习方法优势,采用特定架构和公式,在多物体模拟上结果更准,还展示了其在操作规划和交互式模拟中的应用效用。

Comments Website: https://pgrd-robot.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13072 2026-07-16 cs.RO cs.AI eess.SP 新提交 57%

HRO: Hierarchical Room-to-Object Framework for Zero-Shot Object Goal Navigation with Large Language Models

HRO:用于基于大语言模型的零样本目标导航的分层房间到物体框架

Luyuan Jia, Yinfeng Yu

机构 * School of Computer Science and Technology, Xinjiang University(新疆大学计算机科学与技术学院) Joint Research Laboratory for Embodied Intelligence, Xinjiang University(新疆大学具身智能联合研究实验室) Joint International Research Laboratory of Silk Road Multilingual Cognitive Computing, Xinjiang University(新疆大学丝绸之路多语言认知计算国际联合研究实验室)

专题命中 视觉空间推理 :reasoning(abstract);分类 cs.AI

AI总结 针对零样本目标导航问题,提出LLM驱动的分层房间到物体(HRO)框架,引导智能体粗到细探索导航至目标物体,实验表明该框架在Gibson和HM3D数据集上优于现有基于LLM的方法。

Comments Main paper (6 pages). Accepted for publication by IEEE International Conference on Systems, Man, and Cybernetics 2026 (IEEE SMC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13461 2026-07-16 cs.RO 新提交 50%

Joint On-and-Off Policy Learning for Vision-and-Language Navigation

用于视觉与语言导航的联合在线与离线策略学习

Qingrong He, Lin Zhao, Kevin Zheng, Liang Lin

机构 * Joy Future Academy(京东探索研究院)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究视觉与语言导航问题,提出JOP-VLN框架,通过三阶段训练流程,协同结合离线策略模仿学习和在线策略探索,采用高熵轨迹采样和纠错优先轨迹排序策略,在相关基准上取得高成功率,创技术新水平。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13245 2026-07-16 cs.CV cs.RO 新提交 50%

Just-In-Time Scene Graph Growth: Combating Perceptual Saturation in Long-Horizon Robotics

即时场景图增长:应对长期机器人感知饱和

Yue Chang, Rufeng Chen, Yifan Tian, Dazhi Huang, Zhaofan Zhang, Yi Chen, Wenze Zhang, Li Chen, Hui Xiong, Sihong Xie

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Jilin University(吉林大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 研究针对长期机器人任务中传统3D场景图构建方式导致感知饱和的问题,提出JITOMA闭环框架,利用任务热图过滤观察、大语言模型解析意图动态唤醒锚点,经JITOMA-Bench评估,该框架有效减小图大小和延迟,保持处理时间稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27745 2026-07-16 cs.CV 版本更新 50%

Panoramic Scene Understanding: A Survey from Distortion-Aware Engineering to Sphere-Native Modeling

全景场景分析:从畸变感知工程到球面原生基础建模的综述

Qinfeng Zhu, Lei Fan

机构 * University of Liverpool(利物浦大学) Xi’an Jiaotong-Liverpool University(西交利物浦大学)

专题命中 视觉空间推理 :reasoning(abstract)

AI总结 本文综述全景场景分析从投影适应、畸变感知工程到球面原生建模的演进,指出当前方法无法同时实现严格球面等变性和重用预训练基础模型权重,并揭示评估协议中的五个系统性缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21268 2026-07-16 cs.CV 版本更新 50%

Vision Transformers and Convolutional Neural Networks for Land Use Scene Classification

视觉Transformer与卷积神经网络在土地利用场景分类中的应用

Arun D. Kulkarni

机构 * Computer Science Department, University of Texas at Tyler(德克萨斯理工大学计算机科学系)

专题命中 视觉空间推理 :planning(abstract)

AI总结 本文比较了视觉Transformer和CNN在遥感土地利用场景分类中的性能,发现CNN在有限训练样本和局部纹理特征强的场景中表现稳健,而ViT在数据充足时能更好地捕捉全局空间关系,但计算成本更高。

Comments 11 pages

Journal ref International Journal of Advanced Computer Science and Applications, vol. 17, no. 7, 2026,

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 测试时计算 6 篇

2607.13918 2026-07-16 math.ST cs.AI cs.LG stat.TH 新提交 82%

Partially Correlated Verifier Cascades in LLM Harnesses: Concave Log-Odds, Polynomial Reliability, and Blind-Spot Ceilings

大语言模型工具中的部分相关验证级联:凹对数优势、多项式可靠性和盲点上限

Jiangang Han

机构 * Independent researcher(独立研究者)

专题命中 测试时计算 :verifier(title,abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型工具中部分相关验证级联,将生成器错误接受率建模为潜在变量,给出理论。包括凹对数优势、多项式可靠性等特性,可测量,通过合成测试对比不同方法效果,指出实际应通过去相关而非加门提升可靠性。

Comments 14 pages, 2 figures. Code and synthetic-recovery experiments: https://github.com/jianganghan/harness-verifier-cascades

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11686 2026-07-16 cs.LG cs.AI 版本更新 73%

Representation-Based Exploration for Language Models: From Test-Time to Post-Training

基于表示的语言模型探索:从测试时到训练后

Jens Tuyls, Dylan J. Foster, Akshay Krishnamurthy, Jordan T. Ash

机构 * Princeton University(普林斯顿大学) Microsoft Research(微软研究院)

专题命中 测试时计算 :reasoning(abstract);verifier(abstract);分类 cs.AI、cs.LG

AI总结 研究语言模型中强化学习探索新行为的价值,提出基于预训练模型隐藏状态的表示奖励探索方法,在推理时和训练后都显著提升了模型性能,如验证效率和测试时样本效率,为发现新行为提供实用途径。

Comments Accepted at ICLR 2026. Website and code: https://rep-exp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13369 2026-07-16 cs.CR cs.CY 新提交 71%

xChk: Bring Your Own Identity -- Heterogeneous Assurance with Verifier-Determined Sufficiency

xChk:自带身份——基于验证者确定充分性的异构认证

Sean MacGuire

专题命中 测试时计算 :verifier(title)

AI总结 xChk作为自带身份的参考身份提供商,让用户通过异构证明注册并在OIDC令牌中披露声明,依赖方应用自身策略,支持人工参与高风险操作认证,生产部署实现双边RP评估及特定依赖方登录。

Comments 19 pages, 4 figures. Reference implementation at https://in.xchk.io; one documented RP (crabbyed.com, Appendix B)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13399 2026-07-16 cs.CL cs.LG 新提交 62%

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

揭开在线策略蒸馏的神秘面纱:作用、问题及调控

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 测试时计算 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12963 2026-07-16 cs.CL 版本更新 57%

The Illusion of Robustness: Aggregate Accuracy Hides Prediction Flips under Task-Irrelevant Context

稳健性的错觉:聚合准确率掩盖了与任务无关的上下文下的预测翻转

Yanzhe Zhang, Sanmi Koyejo, Diyi Yang

机构 * Georgia Tech(佐治亚理工学院) Stanford University(斯坦福大学)

专题命中 测试时计算 :test-time compute(abstract);分类 cs.CL

AI总结 研究大语言模型在含无关上下文环境中的表现,发现聚合准确率掩盖了单个示例预测的不稳定性,如随机伪词会改变部分预测,且此不稳定性受多种因素调节,揭示了尾部风险,推动对模型进行单个示例可靠性评估。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13965 2026-07-16 cs.SE cs.CR 新提交 50%

ProfMalPlus: Agent-Coordinated Detection of Malicious NPM Packages via Static-Dynamic Analysis Synergy

ProfMalPlus:通过静态-动态分析协同实现代理协调检测恶意NPM包

Yiheng Huang, Zhijia Zhao, Bihuan Chen, Susheng Wu, Zhuotong Zhou, Yiheng Cao, Kun Hu, Xin Hu, Xin Peng

专题命中 测试时计算 :reasoning(abstract)

AI总结 研究针对NPM包恶意代码检测问题,提出ProfMalPlus,结合对象敏感行为图与大语言模型推理,经多步骤提取安全切片并评估,对不确定情况增强证据后再评估,最终定位恶意代码,F1分数高且发现多个未知恶意包,性能优于现有检测器。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 复杂问题求解 7 篇

2607.14049 2026-07-16 cs.AI 新提交 87%

Deep Interaction: An Efficient Human-AI Interaction Method for Large Reasoning Models

深度交互:一种用于大型推理模型的高效人机交互方法

Hefeng Zhou, Jinxuan Zhang, Jiong Lou, Yuxin Liu, Chaochao Lu, Jingjing Qu, Jie Li

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学)

专题命中 复杂问题求解 :reasoning(title,abstract);CoT(abstract,abstract_cn);chain-of-thought(abstract);分类 cs.AI

AI总结 针对大语言模型推理出错时现有交互方法的问题,提出深度交互机制,可直接编辑原始响应并提炼精炼提示引导模型,在STEM任务推理中纠正成功率大幅提升,令牌使用量显著减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20379 2026-07-16 cs.AI 版本更新 79%

Policy of Thoughts: Scaling Test-Time Training for LLM Reasoning via Online Policy Evolution

思维策略:通过在线策略进化扩展大语言模型推理的测试时训练

Zhengbo Jiao, Hongyu Xian, Qinglong Wang, Yunpu Ma, Zhebo Wang, Zifan Zhang, Dezhang Kong, Meng Han

机构 * Binjiang Institute, Zhejiang University(浙江大学滨江学院) Shanghai University of Finance and Economics(上海财经大学) South China Normal University(华南师范大学) LMU Munich(慕尼黑大学) Wuhan University(武汉大学)

专题命中 复杂问题求解 :reasoning(title,abstract);分类 cs.AI

AI总结 研究针对大语言模型复杂推理难题,提出思维策略(PoT)框架,通过高效探索机制生成候选解,用组相对策略优化更新LoRA适配器,实现推理策略实时进化,显著提升模型性能。

Comments Under Review, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13881 2026-07-16 cs.CV cs.AI 新提交 57%

Unleashing Multimodal Large Language Models for Training-free HOI Detection in the Wild

释放多模态大语言模型用于野外无训练的人机交互检测

Ting Lei, Jialin Liu, Zhu Xu, Yuxin Peng, Yang Liu

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机技术研究所)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 该研究针对传统人机交互检测方法在开放世界和组合场景中泛化能力受限的问题,提出无训练的AgentHOI框架,利用基础模型多模态推理能力,通过上下文感知多轮推理和多方面交互定位机制,在实际场景中取得优于现有监督和弱监督方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10002 2026-07-16 cs.AI 版本更新 57%

Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate

辩论动态与价值对齐在大语言模型辩论中

Pratik S. Sachdeva, Tom van Nuenen

机构 * D-Lab University of California, Berkeley(D-Lab 加州大学伯克利分校)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究通过LLM辩论探讨多轮设置中模型的辩论动态与价值对齐,发现不同模型在同步和轮转结构下的行为差异及价值倾向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12349 2026-07-16 cs.CR cs.AI cs.SE 版本更新 57%

Mind the Gap: Action Rebinding Attacks against Android GUI Agents

零权限操纵:我们能否信任由大型多模态模型驱动的GUI代理?

Yi Qian, Kunwei Qian, Xingbang He, Ligeng Chen, Jikang Zhang, Tiantai Zhang, Haiyang Wei, Linzhang Wang, Hao Wu, Bing Mao

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) Hornor Device Co., Ltd(Hornor设备有限公司) Institute of Dataspace, Hefei Comprehensive National Science Center(数据空间研究所,合肥综合性国家科学中心)

专题命中 复杂问题求解 :reasoning(abstract);分类 cs.AI

AI总结 研究揭示了由大型多模态模型驱动的GUI代理在Android中存在视觉原子性假设的漏洞,通过零权限攻击实现对代理执行的重新绑定,并利用意图对齐策略绕过验证门,展示了代理-操作系统集成中的安全缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13792 2026-07-16 cs.CV 新提交 50%

EgoProceVQA: A Novel Egocentric Procedural Understanding Task with Self-Skill-Exploration Agent

EgoProceVQA:一种具有自我技能探索代理的新型自我中心程序理解任务

Junlong Li, Junxi Li, Yuxiang Yang, Wenbin Zou, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) South China University of Technology(华南理工大学)

专题命中 复杂问题求解 :reasoning(abstract)

AI总结 研究针对现有自我中心视频理解评估忽视程序理解的问题,引入EgoProceVQA任务,开发EgoProceGen数据生成平台并构建基准。通过评估发现模型不足,进而提出EgoProceAgent框架,设计相关工具库,使其在多任务上获最优性能,为该任务奠定统一基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13087 2026-07-16 cs.CR 新提交 50%

GDM AI Control Roadmap

GDM人工智能控制路线图

Mary Phuong, Erik Jenner, Laurent Simon, Lewis Ho, Rohin Shah, Sebastian Farquhar, Scott Coull

专题命中 复杂问题求解 :chain-of-thought(abstract)

AI总结 研究如何保障人工智能代理融入系统时的安全,提出GDM人工智能控制路线图,通过保守威胁建模、基于能力的缓解措施及一系列实际防御构建多层防御体系,平衡安全与开发者速度,为内部安全提供蓝图。

详情

展开后加载摘要…

URL PDF HTML 收藏