arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-15 至 2026-07-15 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 26 篇

2607.12085 2026-07-15 cs.AI 新提交 57%

Operationalising Multi-Dimensional Evaluation for Conversational Agents: A Scalable, Governed Pipeline with Selective Re-evaluation and Model Benchmarking

实现对话代理的多维评估:一种具有选择性重新评估和模型基准测试的可扩展、受治理的管道

Niranjan Kumar M, Balaji Nagarajan, Karthik Nair, Faysal Satter, Nithin Surendran

机构 * Lowes(劳氏公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究针对零售对话代理评估难题,提出GenAI Evaluation管道,通过规范化等处理生产日志,能评估多维度指标。选择性重新评估提高效率,支持审计。每日处理约50000条记录,已评估超两百万次交互,取得较好分数和准确率。

Comments 14 pages, 1 figure of design of architecture and 2 tables exploring the results and benchmarking

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11019 2026-07-15 cs.AI 版本更新 57%

QwenPaw-Data: Bridging Facts, Methodology, and Execution for Autonomous Enterprise Data Analytics

QwenPaw-数据:为自主企业数据分析搭建事实、方法与执行的桥梁

Tianjing Zeng, Yuntao Hong, Zhongjun Ding, Dandan Liu, Yinan Mei, Yunxiang Su, Yiming Wang, Xiaojian Zhang, Jingyu Zhu, Junhao Zhu, Zhuowen Liang, Jiazhen Peng, Lianggui Weng, Zhihao Ding, Kerui Yi, Qifeng Wang, Rong Zhu, Bolin Ding, Liyu Mou, Jingren Zhou

机构 * Alibaba Group(阿里巴巴集团)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究针对企业数据分析在开放环境的特性,提出QwenPaw-Data系统,通过整合异构资产、转化自然语言请求为工作流,架构含三个协作子系统,实验证明该系统提升了数据访问和分析质量,为企业数据智能体提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29537 2026-07-15 cs.AI 版本更新 57%

OSWorld 2.0: Benchmarking Computer Use Agents on Long-Horizon Real-World Tasks

OSWorld2.0:在长时域真实世界任务上基准测试计算机使用智能体

Mengqi Yuan, Zilong Zhou, Xinzhuang Xiong, Weiming Wu, Jiayang Sun, Jiamin Song, Kaiqian Cui, Bowen Wang, Haoyuan Wu, Yitong Li, Dunjie Lu, Haikong Lu, Qi Zhen, Xinyuan Wang, Jiaqi Deng, Yuhao Yang, Cheng Chen, Boyuan Zheng, Alex Su, Xiao Yu, Hao Zou, Saaket Agashe, Xing Han Lu, Manpreet Kaur, Zhengyang Qi, Vincent Sunn Chen, Frederic Sala, Dayiheng Liu, Junyang Lin, Zhou Yu, Yu Su, Siva Reddy, Xin Eric Wang, Peng Qi, Tianbao Xie, Tao Yu

机构 * XLANG Lab(XLANG实验室)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出OSWorld 2.0基准,包含108个长时域计算机使用工作流,通过复杂真实任务揭示当前智能体在约束跟踪、动态信息处理等方面的局限,最佳模型仅完成20.6%任务。

Comments 68 pages, 42 figures. Equal contribution: Mengqi Yuan, Zilong Zhou, and Xinzhuang Xiong

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08862 2026-07-15 cs.RO cs.LG 版本更新 57%

APPLV: Adaptive Planner Parameter Learning from Vision-Language-Action Model

APPLV: 从视觉-语言-动作模型中自适应学习规划器参数

Yuanjie Lu, Beichen Wang, Zhengqi Wu, Yang Li, Xiaomin Lin, Chengzhi Mao, Xuesu Xiao

机构 * Department of Computer Science, George Mason University(计算机科学系,乔治·马歇尔大学) Department of Engineering Science, University of South Florida(工程科学系,佛罗里达州立大学) Department of Computer Science, Rutgers University(计算机科学系,罗格斯大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出APPLV,通过从视觉-语言-动作模型中自适应学习规划器参数,提升移动机器人在受限环境中的导航性能与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06486 2026-07-15 cs.AI 版本更新 57%

JADE: Expert-Grounded Dynamic Evaluation for Open-Ended Professional Tasks

JADE:面向开放式专业任务的专家基础动态评估

Lanbo Lin, Jiayao Liu, Tianyuan Yang, Li Cai, Yuanwu Xu, Lei Wei, Sicong Xie, Guannan Zhang

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团) Zhejiang University(浙江大学) Peking University(北京大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 提出JADE双层评估框架,结合专家知识与动态声明级评估,解决开放式专业任务中严格性与灵活性的矛盾,在BizBench等基准上提升稳定性并揭示关键失败模式。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12339 2026-07-15 cs.HC cs.AI 版本更新 57%

SheetMind: An End-to-End LLM-Powered Multi-Agent Framework for Spreadsheet Automation

SheetMind:一个由端到端大语言模型驱动的用于电子表格自动化的多智能体框架

Xi Cheng, Ruiyan Zhu, Ke Liu, Rakesh Chowdary Machineni, Lyuhao Chen, Brian Zhu, Daniel Jin, Zheng Qi, Neeraj Parihar, Zhoutian Xu, Oliver Gao

机构 * Cornell University(康奈尔大学) University of California, Berkeley(加州大学伯克利分校) University of Michigan(密歇根大学) Carnegie Mellon University(卡内基梅隆大学) Hong Kong University of Science and Technology (GZ)(香港科学与技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 介绍由大语言模型驱动的多智能体框架SheetMind用于电子表格自动化,其分层系统含三个智能体,经评估在SheetCopilot基准测试中执行成功率达100%、功能正确性54.8%超对手,消融研究验证配置优势,还集成到谷歌表格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12786 2026-07-15 cs.CV 新提交 50%

CoRe: A Comprehensive Framework for Cross-Image Comparative Reasoning in Vision-Language Models

CoRe:视觉语言模型中跨图像比较推理的综合框架

Lin Peng, Cong Wan, Zeyu Guo, SongLin Dong, Yihong Gong

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 安全评测 :alignment(abstract)

AI总结 针对视觉语言模型跨图像比较推理难题,提出CoRe框架,含自动构建的训练集CoRe-20K、结构化奖励框架TriSR及基准CoRe-Bench,实验显示其在CoRe-Bench上大幅超越现有模型,在标准基准上也有竞争力。

Comments Accepted by ACMMM2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12089 2026-07-15 cs.CR cs.SE 新提交 50%

Cross-Cutting Security Analysis of LLM-Generated Code via Metamorphic Testing and Association Rule Mining

通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析

Zedong Peng, Chenggang Wang, Shangyue Zhu

专题命中 安全评测 :safety(abstract)

AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。

Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12068 2026-07-15 cs.SE 新提交 50%

Beyond Test Presence: Assessing the Quality and Robustness of Agent-Generated Tests in Open-Source Projects

超越测试存在:评估开源项目中代理生成测试的质量和稳健性

Preet Jhanglani, Zeel Kaushal Desai, Vidhi Kansara, Eman Abdullah AlOmar

专题命中 安全评测 :safety(abstract)

AI总结 研究开源项目中代理生成测试的质量和稳健性,通过对大量测试工件进行实证比较,用“白盒”静态分析框架评估质量维度,发现代理在边缘情况覆盖率上优于人类,但生成测试更易脆弱,揭示其缺乏编写稳定测试的“环境意识”。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10385 2026-07-15 cs.CV 版本更新 50%

GTASA: Ground Truth Annotations for Spatiotemporal Analysis, Evaluation and Training of Video Models

GTASA:用于视频模型空间时间分析、评估和训练的地面真实标注

Nicolae Cudlenco, Mihai Masala, Marius Leordeanu

机构 * Institute of Mathematics of the Romanian Academy(罗马尼亚科学院数学研究所) National University of Science and Technology Politehnica Bucharest(布加勒斯特理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出GTASA,一种包含多主体视频的标注数据集,通过空间关系图和事件级时间映射,验证了其在视频模型训练和评估中的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23781 2026-07-15 cs.CR 版本更新 50%

Leveraging Large Language Models for Trustworthiness Assessment of Web Applications

利用大语言模型评估网络应用的可信度

Oleksandr Yarotskyi, José D'Abruzzo Pereira, João R. Campos

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出利用大语言模型自动评估网络应用的可信度,通过比较不同提示工程技术,提出基于逻辑偏好分数的分层质量模型,实验表明规则提示能提高评估可靠性。

Comments Accepted for publication in the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 1 篇

2606.20751 2026-07-15 cs.CL 版本更新 57%

From Sentiment to Actionable Insights: Public Sentiment Analysis of Advanced Air Mobility

从情感到可操作洞察:先进空中交通的数据驱动公众情感分析

Esrat Farhana Dulia, Amina Dhaher, Raiful Hasan, Syed Arbab Mohd Shihab

机构 * College of Aeronautics and Engineering, Kent State University(肯特州立大学航空与工程学院) Department of Computer Science, Kent State University(肯特州立大学计算机科学系)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL

AI总结 本研究利用AI模型分析306,009条Reddit和Quora文本,评估七种情感分析模型后选用ModernBERT,结合LDA主题建模识别出公众对先进空中交通的六大关注集群,并提出针对性策略以提升公众接受度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 12 篇

2607.12086 2026-07-15 cs.CL cs.CY cs.MA cs.SI 新提交 62%

CityBehavEx: A Scalable and Empirically Validated LLM-Assisted Urban Simulation Platform

CityBehavEx:一个可扩展且经过实证验证的基于大语言模型的城市模拟平台

Gustavo H. Santos, Aline Viana, Thiago H Silva

机构 * UTFPR(巴拉那联邦理工大学) Inria(法国国家信息与自动化研究所) University of Toronto(多伦多大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 CityBehavEx平台针对基于大语言模型的城市模拟器扩展成本高和验证薄弱问题,结合人类出行模型与交叉编码器,实现大规模模拟,能生成更贴合现实的出行模式,还允许用户进行多种操作及验证。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11893 2026-07-15 cs.CL cs.AI 新提交 62%

I'm Sorry, but I Can't Help with Braille: Revealing Accessibility Failures in State-of-the-Art LLMs

对不起,我无法处理盲文:揭示当前最先进语言模型中的无障碍性缺陷

Abdullah Abdullah

机构 * orinu Inc.(奥里努公司)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 研究评估先进语言模型在韩语-盲文翻译上的表现,发现其存在缺陷。通过人工标注数据集测试,发现输出差且不稳定。对比发现,对小模型进行监督微调效果更好,揭示了当前语言模型的局限,证明特定监督的有效性。

Comments Accepted at the LTEDI Workshop at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12180 2026-07-15 cs.HC cs.AI 新提交 57%

TRAIL: A Platform for Configurable Human--AI Teaming Experiments

TRAIL:一个用于可配置人机协作实验的平台

Mohammad Amin Samadi, Pedro Martins De Bastos, Jaeyoon Choi, Spencer JaQuay, Seehee Park, Nia Nixon

机构 * School of Education, University of California, Irvine(加州大学伊文斯分校教育学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 研究人工智能队友设计属性对团队的影响,TRAIL平台将大五人格等与多种实验方法结合,在课堂部署中实现纵向链式实验、文本相似性分析等,发现不同人格代理对团队有不同影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11899 2026-07-15 physics.ao-ph cs.LG 新提交 57%

Predictive Modeling of High-Altitude Clear Air Turbulence in the United States: A Machine Learning Approach

美国高空晴空湍流的预测建模:一种机器学习方法

Kadir Gokdeniz, Irem Ulku

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 该研究利用机器学习模型,基于飞行员报告、ERA5再分析数据和飞机空气动力学参数,对美国200 - 350百帕压力水平下的高空晴空湍流进行预测建模,梯度提升算法表现最佳,强调了地理坐标等因素作用,凸显机器学习在CAT预测中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12682 2026-07-15 cs.LG 版本更新 57%

RAFP: Identifying LLM Lineages via Rare-Region Fingerprints

RAFP:通过稀有区域指纹识别大语言模型谱系

Yun-Yun Tsai, Jia Hao Liang, Chuan Guo, Junfeng Yang, Laurens van der Maaten

机构 * Department of Computer Science, Columbia University, USA(哥伦比亚大学计算机科学系) Meta, USA(Meta公司)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 针对大语言模型所有权验证需求,提出RAFP框架,利用稀有区域指纹识别模型谱系。该方法非侵入性,通过离散梯度优化构建指纹,理论分析表明其在微调下似然变化有界,实验显示在黑盒设置中性能优于基线。

Comments 16 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12460 2026-07-15 cs.SE 新提交 50%

CodeOwl: Automatic Generation of Tiered Parsons Problems for Introductory Programming

CodeOwl:用于编程入门的分层帕森斯问题自动生成

Luca Cisternino, Florian Obermüller, Gordon Fraser

专题命中 其他安全 :alignment(abstract)

AI总结 针对编程教育中学习者异质性难题,介绍CodeOwl这一人工智能驱动工具自动生成分层帕森斯问题,经混合方法框架评估,该工具生成的问题难度提升效果好,获专家、教师和学生认可,不过教师和学生也分别提出了改进意见。

Comments To appear at the 38th CSEE&T

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12429 2026-07-15 cs.CV 新提交 50%

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Aerospace Control Center(北京航天飞行控制中心)

专题命中 其他安全 :alignment(abstract)

AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 50%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 其他安全 :alignment(abstract)

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12221 2026-07-15 cs.HC 新提交 50%

From Chaos to Clarity: A Framework for Program-Level AI Learning Outcomes

从混乱到清晰:程序级人工智能学习成果框架

Grace Barkhuff, Ian Pruitt, William Gregory Johnson, Rodrigo Borela, Ben Rydal Shapiro, Anu G. Bourgeois

专题命中 其他安全 :alignment(abstract)

AI总结 针对高等教育中缺乏明确人工智能准备界定结构的问题,提出程序级人工智能学习成果(PLAI-LOs)框架,通过工件级GenAI政策实施,为高等教育从分散规则走向清晰、以学习为中心的战略提供路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12193 2026-07-15 cs.HC cs.CV 新提交 50%

Compos3D: Interactive Part-Based Composition for Creative Control in Generative 3D Models

Compos3D:用于生成式3D模型中创意控制的基于部件的交互式合成

Faraz Faruqi, Sean J. Liu, George Fitzmaurice, Justin Matejka

机构 * Autodesk Research(Autodesk研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对生成式3D建模中控制有限问题,提出Compos3D系统,通过重新混合部件实现创意控制。用户从提示生成候选,选择部件组装,系统合成模型。用户研究表明该方法能带来更好控制、意图匹配和满意度,还给出了未来工作流程设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 50%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 其他安全 :safety(abstract)

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 50%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 其他安全 :alignment(abstract)

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏