arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-15 至 2026-07-15 共收录 87 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 3 篇

2602.16726 2026-07-15 cs.MA 版本更新 91%

Bridging Individual and Collective Realism in LLM-Based Human Mobility Simulation via Mobility Scaling-Law Guidance

通过共享数据中的移动度量引导基于LLM的人群移动模拟

Hua Yan, Heng Tan, Yu Yang

专题命中 预训练与数据 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 M2LSimu通过共享数据中的移动度量引导多提示调整,有效提升基于LLM的人群移动模拟的群体协调与真实性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04029 2026-07-15 cs.DB cs.AI cs.LG 版本更新 84%

PluRel: Synthetic Data unlocks Scaling Laws for Relational Foundation Models

PluRel: 合成数据解锁关系基础模型的扩展定律

Vignesh Kothapalli, Rishabh Ranjan, Valter Hudovernik, Vijay Prakash Dwivedi, Johannes Hoffart, Carlos Guestrin, Jure Leskovec

机构 * Stanford University(斯坦福大学) SAP Labs LLC(SAP实验室)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 PluRel通过合成多表关系数据库,实现了关系基础模型在扩展定律上的突破,展示了合成数据在提升模型泛化能力方面的潜力。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11020 2026-07-15 cs.CL cs.LG 版本更新 81%

Can a Language Model Learn Facts Continually in Its Weights?

语言模型能否在其权重中持续学习事实?

Charles O'Neill

机构 * Baseten(巴斯滕)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 研究语言模型能否在权重中持续学习事实,通过追踪写入Qwen3模型的虚构事实及实验发现,训练数据广度决定知识类型,事实可行为遗忘但不擦除,广泛数据能创建可用知识,可靠通道是上下文而非权重。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 10 篇

2509.24372 2026-07-15 cs.LG cs.AI cs.NE 版本更新 92%

Evolution Strategies at Scale: LLM Fine-Tuning Beyond Reinforcement Learning

大规模进化策略:超越强化学习的LLM微调

Xin Qiu, Yulu Gan, Conor F. Hayes, Qiyao Liang, Yinggan Xu, Roberto Dailey, Elliot Meyerson, Babak Hodjat, Risto Miikkulainen

机构 * University of California, Los Angeles, Los Angeles, CA, USA(加州大学洛杉矶分校) Cognizant AI Lab, San Francisco, CA, USA(Cognizant AI实验室) The University of Texas at Austin, Austin, TX, USA(德克萨斯大学奥斯汀分校) Massachusetts Institute of Technology, Cambridge, MA, USA(麻省理工学院)

专题命中 指令微调 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出使用进化策略进行大规模LLM微调,证明其在多个方面优于强化学习,为LLM微调提供了新的方法。

Comments Published at ICML 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06715 2026-07-15 cs.CL cs.AI cs.LG 版本更新 90%

Does Topic Sentiment Cause Perceived Ideology? Comparing Human and LLM Annotations in Political News Articles

主题情感是否导致感知意识形态?比较政治新闻文章中人类与LLM的标注

Upasana Chatterjee

机构 * Columbia University(哥伦比亚大学)

专题命中 指令微调 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 研究主题情感对感知政治意识形态的因果效应,通过比较人类与LLM标注,发现微调GPT-4o-mini产生显著因果效应,归因于捷径学习。

Comments V1 accepted to ACL SRW 2026. V2 updates experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10125 2026-07-15 cs.CR cs.SE 版本更新 89%

D-LiFT: Improving LLM-based Decompiler Backend via Code Quality-driven Fine-tuning

D-LiFT:通过代码质量驱动的微调改进基于大语言模型的反编译器后端

Muqi Zou, Hongyu Cai, Hongwei Wu, Zion Leonahenahe Basque, Arslan Khan, Berkay Celik, Dave, Tian, Antonio Bianchi, Ruoyu, Wang, Dongyan Xu

专题命中 指令微调 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 研究针对反编译器输出质量问题,提出D-LIFT方法。通过代码质量感知强化学习微调LLM,利用D-Score综合评估系统指导,在保持准确性的同时提升可读性,实验证明该方法有效提高了反编译代码质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24787 2026-07-15 cs.AI 版本更新 87%

ReLope: KL-Regularized LoRA Probes for Multimodal LLM Routing

ReLope:KL正则化的LoRA探针用于多模态大语言模型路由

Yaopei Zeng, Congchao Wang, Blake JianHang Chen, Lu Lin

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon AGI(亚马逊AGI) Google(谷歌)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型路由中探针性能下降问题,提出Attention Probe和KL正则化的LoRA探针ReLope,通过改进隐藏状态质量提升路由效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12682 2026-07-15 cs.LG 版本更新 87%

RAFP: Identifying LLM Lineages via Rare-Region Fingerprints

RAFP:通过稀有区域指纹识别大语言模型谱系

Yun-Yun Tsai, Jia Hao Liang, Chuan Guo, Junfeng Yang, Laurens van der Maaten

机构 * Department of Computer Science, Columbia University, USA(哥伦比亚大学计算机科学系) Meta, USA(Meta公司)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对大语言模型所有权验证需求,提出RAFP框架,利用稀有区域指纹识别模型谱系。该方法非侵入性,通过离散梯度优化构建指纹,理论分析表明其在微调下似然变化有界,实验显示在黑盒设置中性能优于基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02244 2026-07-15 cs.LG cs.CL 版本更新 79%

Entropy-Preserving Supervised Fine-Tuning via Adaptive Self-Distillation for Large Reasoning Models

在学习中保持好奇心:通过自适应自蒸馏实现熵保持的监督微调以提升大推理模型

Hao Wang, Hao Gu, Hongming Piao, Kaixiong Gong, Yuxiao Ye, Xiangyu Yue, Sirui Han, Yike Guo, Dapeng Wu

机构 * City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 CurioSFT通过自适应自蒸馏和熵引导温度选择,提升大推理模型的探索能力,在监督微调和强化学习阶段均取得显著改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31437 2026-07-15 cs.CV 版本更新 78%

Astra: a generalizable report generation foundation model for 3D computed tomography

Astra:一种用于三维计算机断层扫描的通用报告生成基础模型

Zhuhao Wang, Fang Chen, Chaohui Yu, Zihan Li, Yuchao Zheng, Jing Wang, Xuan Yang, Jia Guo, Zhenlu Yang, Xingju Zheng, Yihua Sun, Haojie Han, Xiaoxiao Qin, Zhan Feng, Wenbo Xiao, Chao Zhu, Yuehua Li, Shipeng Zhang, Hao Luo, Yunsong Peng, Fan Wang, Hongen Liao

机构 * School of Biomedical Engineering, Tsinghua University(清华大学生物医学工程学院) School of Biomedical Engineering, Shanghai Jiao Tong University(上海交通大学生物医学工程学院) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Laboratory(壶辰实验室) Department of Biomedical Engineering, National University of Singapore(新加坡国立大学生物医学工程系) Department of Radiology, Guizhou Provincial People’s Hospital(贵州省级人民医院放射科) Department of Radiology, The First Affiliated Hospital, Zhejiang University School of Medicine(浙江大学医学院附属第一医院放射科) Department of Radiology, Shanghai Sixth People’s Hospital Affiliated to Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属第六人民医院放射科) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 指令微调 :foundation model(title,abstract)

AI总结 提出Astra模型,通过风格统一和强化学习,在8个器官系统的CT报告生成中实现高精度,平均细粒度诊断指标提升44.1%,并加速临床工作流。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28583 2026-07-15 cs.CV cs.AI cs.MM 版本更新 77%

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答

Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei Chen, Yushi Sun

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 指令微调 :SFT(abstract,abstract_cn);language model(abstract);分类 cs.AI

AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04144 2026-07-15 cs.AI 版本更新 57%

RippleBench: Capturing Ripple Effects Using Existing Knowledge Repositories

RippleBench: 利用现有知识库捕捉涟漪效应

Roy Rinberg, Usha Bhalla, Igor Shilov, Flavio P. Calmon, Rohit Gandikota

机构 * Harvard University(哈佛大学) Imperial College London(伦敦帝国学院) Northeastern University(东北大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 提出RippleBench-Maker自动管道,从知识库检索语义邻居生成选择题,评估八种遗忘方法在Llama3-8B-Instruct上的涟漪效应,发现准确率下降随语义距离衰减且跨模型一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05820 2026-07-15 cs.SE 版本更新 50%

SpecRL: Reinforcement Learning with Test-Based Completeness Rewards for Formal Specification Synthesis

通过负测试作为完整性信号的强化学习用于形式规范综合

Zhechong Huang, Zhao Zhang, Zeyu Sun, Huifeng Sun, Yingfei Xiong

专题命中 指令微调 :LLM(abstract_cn)

AI总结 本文提出SpecRL框架,利用负测试比例作为规范完整性的信号,提升规范强度和验证成功率,实验显示其在不同模型规模上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 4 篇

2607.02374 2026-07-15 cs.AI 版本更新 85%

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

DRIFTLENS: 测量个性化语言模型中记忆引发的推理漂移

Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 后训练与偏好优化 :language model(title,abstract);LLM(abstract_cn);post-training(abstract);分类 cs.AI

AI总结 提出DRIFTLENS框架,通过将推理步骤映射到价值类别并比较有无用户属性记忆的轨迹,量化个性化语言模型中的推理漂移,发现记忆会引发中等至大的推理变化,且现有后训练方法仅部分缓解。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 78%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 后训练与偏好优化 :post-training(title,abstract)

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00492 2026-07-15 cs.AI 版本更新 77%

Rethinking Reward Models for Multi-Domain Test-Time Scaling

重新思考多领域测试时扩展的奖励模型

Dong Bok Lee, Seanie Lee, Sangwoo Park, Minki Kang, Jinheon Baek, Dongki Kim, Dominik Wagner, Jiongdao Jin, Heejun Lee, Tobias Bocklet, Jinyu Wang, Jingjing Fu, Sung Ju Hwang, Jiang Bian, Lei Song

机构 * KAIST(韩国科学技术院) Microsoft Research Asia(微软亚洲研究院) TH Nürnberg

专题命中 后训练与偏好优化 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多领域测试时扩展的奖励模型,对四种奖励模型变体进行统一评估,发现dORM与dPRM相当,gPRM无竞争力,gORM最稳健,挑战细粒度监督更好的假设,支持生成式结果验证并公开代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09076 2026-07-15 cs.CV 版本更新 75%

Z-Reward: Beyond Scalar Rewards by Internalizing Reasoning into Score Distributions

超越标量奖励:将推理内化到分数分布中

Xin Jin, Huanqia Cai, Zhen Li, Zechao Zhan, Dengyang Jiang, Aiming Hao, Yuming Jiang, Xiangpeng Yang, Chunle Guo, Peng Gao, Ming-Ming Cheng, Steven C. H. Hoi

机构 * Alibaba Group(阿里巴巴集团) Nankai University(南开大学)

专题命中 后训练与偏好优化 :SFT(abstract,abstract_cn);post-training(abstract)

AI总结 提出Z-Reward框架,通过教师-学生模型将推理型奖励内化为紧凑VLM的分数分布,实现高效且准确的文本到图像优化。

Comments Z-Image Team Technical Report. Project page: https://srameo.github.io/projects/z-reward/

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 1 篇

2606.03363 2026-07-15 cs.CL 版本更新 77%

EntSQL: A Benchmark for Grounding Text-to-SQL in Long-Context Enterprise Knowledge

EntSQL:一个将Text-to-SQL置于长上下文企业知识中的基准

Chengxi Liao, Tao Xu, Zulong Chen, Chuanfei Xu, Yiyan Wang, Xinyun Wang, Yanlong Zhang, Xiaojun Chen, Zhibo Yang, Zeyi Wen

机构 * HKUST (GZ)(香港科技大学(广州)) Alibaba Group(阿里巴巴集团) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室(深圳))

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出EntSQL基准,通过包含1066个跨五个业务领域的中英文对齐示例,评估LLM在长上下文企业文档中基于私有业务知识生成SQL的能力,最佳系统仅达15.9%准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 推理与问题求解 11 篇

2606.18030 2026-07-15 cs.HC 版本更新 89%

ParaTutor: Coordinating Parent and Child Math Tutoring through Role Separated LLM Scaffolding

ParaTutor: 通过角色分离的实时脚手架界面实现LLM介导的亲子辅导

Lan Luo, Anqi Wang, Muzhi Zhou, Junhua Zhu, Jie Cai, Ao Yu, Hui Pan

专题命中 推理与问题求解 :LLM(title,title_cn)

AI总结 针对亲子辅导中角色不对称问题,提出ParaTutor系统,通过为家长提供辅导指导、为孩子提供视觉基础,在实时互动中保持家长主导和孩子参与,实验表明优于通用LLM辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23276 2026-07-15 cs.LG cs.MA 版本更新 83%

Auditable Context-Aware HFMD Forecasting with Structured LLM Agents

基于结构化大语言模型代理的可审计上下文感知手足口病预测

Joongwon Chae, Runming Wang, Chen Xiong, Gong Yunhan, Lian Zhang, Ji Jiansong, Dongmei Yu, Peiwu Qin

机构 * Institute of Biomedicine and Health Engineering, Tsinghua Shenzhen International Graduate School (SIGS), Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院生物医学与健康工程学院) The Fifth Affiliated Hospital of Wenzhou Medical University, Lishui 323000, China(温州医科大学第五附属医院) Hengqin Laboratory, Zhuhai, China(横琴实验室) The First Hospital of Hebei Medical University, Shijiazhuang, China(河北医科大学第一医院)

专题命中 推理与问题求解 :LLM(title,abstract);foundation model(abstract);分类 cs.LG

AI总结 研究针对手足口病预测,提出双代理神经符号框架,由基于大语言模型的事件解释器和预测生成器组成,通过摄取异构信号并结合历史病例数进行预测,在两个数据集评估中实现有竞争力的点准确性、可靠区间及可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09224 2026-07-15 cs.SE cs.AI cs.CL 版本更新 79%

Git-Assistant: Planning-Based Support for Updating Git Repositories

Git辅助工具:基于规划的Git仓库更新支持

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JPMorganChase(人工智能研究,摩根大通)

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对git工具对开发者有挑战的问题,提出结合大语言模型与自动规划的Git-Assistant,经合成和随机git环境评估,证明该方法能提升仓库管理可靠性、减少错误,展现混合人工智能方法在开发者辅助上的潜力。

Comments Pending permissions from the private company

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09008 2026-07-15 cs.CL cs.AI cs.LG cs.LO 版本更新 75%

A Neurosymbolic Approach to Natural Language Formalization and Verification

一种用于自然语言形式化和验证的神经符号方法

Chenyang An, Sam Bayless, Stefano Buliani, Darion Cassel, Byron Cook, Duncan Clough, Rémi Delmas, Nafi Diallo, Ferhat Erata, Nick Feng, Dimitra Giannakopoulou, Aman Goel, Aditya Gokhale, Joe Hendrix, Victor Heorhiadi, Marc Hudak, Dejan Jovanović, Andrew M. Kent, Benjamin Kiesl-Reiter, Jeffrey J. Kuna, Nadia Labai, Joseph Lilien, Divya Raghunathan, Zvonimir Rakamarić, Niloofar Razavi, Michael Tautschnig, Ali Torkamani, Nathaniel Weir, Michael W. Whalen, Jianan Yao

机构 * Amazon Web Services(亚马逊网络服务) University College London(伦敦大学学院) University of Toronto(多伦多大学) Queen Mary University of London(伦敦大学女王学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大型语言模型缺乏形式正确性保证的问题,提出神经符号方法ARc,通过使用带人工指导的大型语言模型形式化自然语言政策,并在推理时验证逻辑正确性,实现高健全性和低误报率,还能产生可审计工件。

Comments 28 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24267 2026-07-15 cs.CL cs.AI 版本更新 73%

Pigeonholing: how bad prompts hurt models, causing collapse and mistakes

鸽笼效应:不良提示导致模型崩溃和犯错

Hyunji Nam, Keertana Chidambaram, Dorottya Demszky, Natasha Jaques

机构 * Stanford University(斯坦福大学) University of Washington(华盛顿大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究不良上下文导致大语言模型性能下降和模式崩溃的“鸽笼效应”,发现重复错误答案、收敛于狭窄答案集等问题,并提出RLVR合成错误缓解方法。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01113 2026-07-15 cs.LG cs.AI cs.DS 版本更新 73%

Efficiently Learning Branching Networks for Multitask Algorithmic Reasoning

高效学习用于多任务算法推理的分支网络

Dongyue Li, Zhenshuo Zhang, Minxuan Duan, Edgar Dobriban, Hongyang R. Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在实现多任务算法推理,提出分支神经网络架构,通过递归树状划分任务,利用基于梯度的亲和度聚类,降低搜索复杂度。经实验验证,在多个基准测试中性能优于现有方法,减少运行时和内存使用,还可用于重叠社区检测。

Comments 31 pages. Modified the experiments section and improved exposition

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20963 2026-07-15 cs.LG 版本更新 70%

When and Why Does Multi-Agent Debate Fail and Does It Really Underperform?

多智能体辩论何时以及为何失败,它真的表现不佳吗?

Yongqiang Chen, Gang Niu, James Cheng, Bo Han, Masashi Sugiyama

机构 * The Chinese University of Hong Kong(香港中文大学) RIKEN Center for Advanced Intelligence Project(日本理化学研究院高级智能项目中心) Hong Kong Baptist University(香港 Baptist大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究多智能体辩论(MAD)失败原因及表现,分析竞争型和寻求共识型MAD范式问题,提出协作协议ColMAD,经实验验证其在错误检测等任务上比之前协议高出10个百分点,且优于单智能体方法,凸显协议设计对MAD潜力实现的关键作用。

Comments Preprint, ongoing work

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11875 2026-07-15 cs.LG cs.AI 版本更新 62%

Invariant Learning Dynamics of Transformers in Inductive Reasoning Tasks

归纳推理任务中Transformer的不变学习动态

Tiberiu Musat, Tiago Pimentel, Nicolas Zucchet, Thomas Hofmann

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford(斯坦福大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出理论框架解释Transformer语言模型归纳推理能力,研究广义归纳任务,证明其训练动态可限制在低维不变流形,刻画数据统计对学习竞争的影响,探讨初始化作用并展示坐标框架用途,向Transformer学习预测理论迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00333 2026-07-15 cs.CR 版本更新 50%

(A)I Sees What You Don't: Exploiting New Attack Surfaces in Third-Party Mobile Agents

(AI)看见你看不见的:利用第三方移动代理中的新攻击面

Zidong Zhang, Zhentao Xie, Wenrui Diao, Jianliang Wu

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文识别了第三方移动代理在屏幕感知和通道滥用方面的两种新攻击面,并设计了七种具体攻击,证明恶意应用可在无权限下劫持代理行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27706 2026-07-15 cs.MM 版本更新 50%

MAR3: Multi-Agent Recognition, Reasoning, and Reflection for Reference Audio-Visual Segmentation

MAR3:多智能体识别、推理与反思用于参考音频视觉分割

Yuan Zhao, Zhenqi Jia, Yongqiang Zhang

专题命中 推理与问题求解 :LLM(abstract)

AI总结 本文提出MAR3框架,通过多智能体机制解决参考音频视觉分割中的表达难度识别、模态主导性分析及反思学习问题,提升分割精度。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08010 2026-07-15 cs.CV 版本更新 50%

CASHEW: Stabilizing Multimodal Reasoning via Iterative Trajectory Aggregation

CASHEW: 通过迭代轨迹聚合稳定多模态推理

Chaoyu Li, Fei Tao, Pooyan Fazli

机构 * Arizona State University(亚利桑那州立大学) NewsBreak

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出CASHEW框架,通过迭代聚合多候选推理轨迹并利用视觉验证过滤幻觉步骤,以及其强化学习变体CASHEW-RL,显著提升多模态推理的稳定性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 评测与基准 28 篇

2606.17253 2026-07-15 cs.AR 版本更新 91%

PDAGENT-BENCH: Characterizing, Grounding, and Architecting LLM/VLM Agents for VLSI Physical Design

PDAGENT-BENCH: 用于VLSI物理设计的LLM代理的特征化、基础化与架构化

Qiufeng Li, Rongqian Chen, Quan Cheng, Chengxuan Wang, Sizhe Tang, Chia-Tung Ho, David Z. Pan, Tian Lan, Weidong Cao

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 提出PDAGENT-BENCH基准,用于评估LLM/VLM代理在VLSI物理设计中的能力,涵盖任务级和工作流级评估,揭示模型在工具执行和长程推理上的局限,并验证人类技能增强工作流的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏