arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-15 至 2026-07-15 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 4 篇

2607.11948 2026-07-15 cs.AI cs.CL cs.LG cs.MA 新提交 75%

Ontology-Amplified Distillation and Contextuality Auditing for Sovereign Enterprise Language Models: A Combined Proof-of-Mechanism and Negative-Results Method Study

主权企业语言模型的本体增强蒸馏与上下文审查:机制验证与负面结果的组合方法研究

Thanh Luong Tuan

机构 * AgenticOS(智能操作系统)

专题命中 偏好对齐 :DPO(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对受数据驻留规则约束的金融机构需求,结合本体增强蒸馏机制验证与上下文审查方法,对Qwen3.6 - 27B学生模型进行训练及测试,结果不支持模型在多方面的优势,为企业语言模型应用提供参考。

Comments 15 pages, 2 figures. Combined proof-of-mechanism and negative-results method article consolidating ontology-amplified distillation with contextuality-audit routing for enterprise agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.05736 2026-07-15 q-bio.QM cs.CL cs.CV cs.LG 73%

Multimodal Integrated Knowledge Transfer to Large Language Models through Preference Optimization with Biomedical Applications

通过偏好优化整合多模态知识以增强大语言模型的多模态知识转移(生物医学应用)

Zhanliang Wang, Da Wu, Quan Nguyen, Zhuoran Xu, Kai Wang

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 MINT通过偏好优化整合多模态知识,提升大语言模型在生物医学任务中的表现,特别是在罕见遗传疾病预测和组织类型分类中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02374 2026-07-15 cs.AI 版本更新 70%

DRIFTLENS: Measuring Memory-Induced Reasoning Drift in Personalized Language Models

DRIFTLENS: 测量个性化语言模型中记忆引发的推理漂移

Xi Fang, Weijie Xu, Yingqiang Ge, Yuhui Xu, Stephanie Eckman, Chandan K. Reddy

机构 * Amazon(亚马逊)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.AI

AI总结 提出DRIFTLENS框架,通过将推理步骤映射到价值类别并比较有无用户属性记忆的轨迹,量化个性化语言模型中的推理漂移,发现记忆会引发中等至大的推理变化,且现有后训练方法仅部分缓解。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09570 2026-07-15 cs.CL cs.HC 版本更新 57%

UXBench: Benchmarking User Experience in AI Assistants

UXBench:AI助手中的用户体验基准测试

Mengze Hong, Xia Zeng, Zeyang Lei, Sheng Wang, Chen Jason Zhang, Di Jiang, Taiming Fu, Jinfeng Huang, Mengqiao Liu, Qinghe Chang, Haosheng Zou, Qiongyi Zhou, Sijun He, Simonjmdeng, Haojing Huang, Zijian Li, Lucas Mu Li, Fubao Zhang, Mona Zhou, Wei Ma, Yuan Hua, Qi Zhu, Shuo Jiang, Chenxuan Ma, Yuanmeng Zhang, Jian Song, Minlong Peng, Di Liang, Davey Chen

机构 * Hong Kong Polytechnic University(香港理工大学) Tencent(腾讯)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 提出首个基于真实用户反馈的用户中心基准UXBench,包含三个任务和7400个测试实例,评估26个前沿语言模型,发现用户反馈预测是可学习的能力,并揭示了LLM作为评判者的系统偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 3 篇

2607.12112 2026-07-15 cs.LG cs.AI cs.CV cs.DC 新提交 62%

Continual Learning with Elastic Regularization and Synthetic Replay for Federated MLLM Fine-Tuning

用于联邦多模态大语言模型微调的弹性正则化和合成重放持续学习

Jing Liu, Chenxuanyin Zou, Jiayang Ren, Gaoyun Fang, Chengfang Li, Yan Wang, Zhenchao Ma, Bo Hu

机构 * The University of British Columbia(英属哥伦比亚大学) Fudan University(复旦大学) Royal College of Science, Imperial College London(伦敦帝国理工学院皇家科学学院) Dyson School of Design Engineering(戴森设计工程学院) Suzhou Institute of Biomedical Engineering and Technology (SIBET), Chinese Academy of Sciences(中国科学院苏州生物医学工程技术研究所) East China Normal University(华东师范大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究针对联邦多模态大语言模型微调中灾难性遗忘问题,提出FedCMM框架,在参数、数据、聚合三个层面嵌入持续学习保障,经实验验证该框架在准确性和反向迁移上优于基线,能实现跨异构网络AI部署的稳健进化适应。

Comments submitted to IEEE JSTSP

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12784 2026-07-15 cs.RO cs.LG 新提交 57%

Directional Constraints for Efficient Exploration in Safe Reinforcement Learning

安全强化学习中高效探索的方向约束

Paolo Magliano, Puze Liu, Jan Peters, Davide Tateo, Raffaello Camoriano

机构 * Dipartimento di Automatica e Informatica, Politecnico di Torino(自动控制与信息工程系,都灵理工大学) Tongji University, Shanghai Research Institute for Intelligent Autonomous Systems(同济大学,上海智能自主系统研究院) German Research Center for AI (DFKI)(德国人工智能研究中心(DFKI)) Intelligent Autonomous Systems Group, TU Darmstadt(智能自主系统组,达姆施塔特工业大学) Lund University(隆德大学) Istituto Italiano di Tecnologia(意大利技术研究院)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 针对安全强化学习中约束学习降低速度和性能的问题,提出扩展ATACOM框架的ATACOM-DC方法,通过引入方向约束区分动作,改善安全与性能权衡,在模拟机器人控制任务中评估,分析约束违反成本和任务性能。

Comments This paper has been accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Pittsburgh, USA, 2026. 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11906 2026-07-15 cs.AI 新提交 57%

In-Context Reinforcement Learning under Non-Stationarity: A Survey

非平稳性下的上下文强化学习:一项综述

A Run, Ziluo Ding

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 该综述围绕非平稳性下的上下文强化学习展开,探讨预训练或微调决策模型在交互中推断规则改善行为的能力。将其定义为策略固定时通过上下文适应问题,关联多种相关技术,并从变化内容、展开方式及智能体可观察性三方面组织文献。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2607.12406 2026-07-15 cs.AI 新提交 85%

Isolation as a First-Class Principle for LLM-Agent System Safety: Concepts, Taxonomy, Challenges and Future Directions

隔离作为大语言模型智能体系统安全的头等原则:概念、分类法、挑战及未来方向

Huihao Jing, Wenbin Hu, Shaojin Chen, Haochen Shi, Sirui Zhang, Hanyu Yang, Changxuan Fan, Zhongwei Xie, Hongyu Luo, Wun Yu Chan, Wei Fan, Haoran Li, Yangqiu Song

机构 * HKUST(香港科技大学) NYU(纽约大学) SWUPL(西南政法大学)

专题命中 越狱攻击 :safety(title,abstract);alignment(abstract);prompt injection(abstract);分类 cs.AI

AI总结 探讨大语言模型智能体系统安全问题,将隔离作为头等原则,用边界中心分类法组织文献,助于识别隔离丧失位置、妥协传播方式及相关防御,还总结了故障路径,讨论挑战并勾勒研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12469 2026-07-15 cs.SE cs.AI 新提交 79%

Agent-Safety Evaluations as Load-Bearing Evidence: A Vendor-Neutral, Cross-Harness Reconstructability Metric

作为承重证据的智能体安全评估:一种供应商中立的跨线束可重构性度量

Oleg Solozobov

专题命中 越狱攻击 :safety(title,abstract);分类 cs.AI

AI总结 研究智能体安全评估结果缺乏承重证据问题,引入属性级可重构性度量及跨线束适配器,通过特定协议和方法定义相关指标,在公共和捆绑轨迹上验证,为安全评估提供可重构性度量及相关验证方法。

Comments 36 pages, 3 tables. Reproducibility package (scorer, fixtures, Evidence Sufficiency Cards): https://doi.org/10.5281/zenodo.21055696

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 1 篇

2607.12624 2026-07-15 cs.CR 新提交 85%

PVDetector: Detecting Prompt Injection Attacks on Purpose-Specific LLM Agents through Policy-Violation Concept Analysis

PVDetector:通过策略违规概念分析检测针对特定目的大语言模型代理的提示注入攻击

Junhui Wang, Hangtao Zhang, Zhirun Zheng, Li Zeng, Jiejun Xiao, Xi Luo, Lihua Yin, Saiqin Long

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);safety(abstract)

AI总结 研究针对特定目的LLM代理的提示注入攻击,提出PVDetector框架,通过测量与离线派生的PV概念的隐藏状态对齐来检测攻击,实验表明该方法误报率低、开销小,性能优于现有方法。

Comments Accepted to ACM MM 2026. Code: https://github.com/Claresigle/PVDetector

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 2 篇

2607.12336 2026-07-15 cs.CL cs.AI cs.CY cs.ET cs.HC 新提交 67%

Evaluating Health Misinformation in Low-Resource Languages: Integrating Small Language Models with a Culturally-Sensitive Responsible NLP Framework (Bangla as a Case Study)

评估低资源语言中的健康错误信息:将小语言模型与文化敏感的负责任自然语言处理框架相结合(以孟加拉语为例)

Farnaz Farid, Raihan Alam, Al Al-Areqi, Farhad Ahamed, Muhammad Hassan Khan, Sadia Hossain, Irena Veljanova, Anika Tabassum Binte Hossain

机构 * Western Sydney University(西悉尼大学) Microsoft(微软公司) Excelsia College(埃克塞尔西亚学院) Faulconbridge Health Centre(福尔康布里奇健康中心)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 研究针对低资源语言中健康错误信息难检测问题,提出结合小语言模型与文化敏感的负责任自然语言处理框架,以孟加拉语为例进行实验,证明Phi-4表现优,还设计新框架,为评估低资源语言错误信息提供整体视角。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12257 2026-07-15 cs.AI cs.CL cs.IR cs.LG 新提交 67%

On-Device Deep Research at 4B: Exposure Bounds Faithfulness, Retrieval Bounds Coverage

4B 设备上的深度研究:曝光界限忠实度、检索界限覆盖率

Vinay Kumar Chaganti

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究聚焦 4B 设备上深度研究,区分引用主张忠实度与可信覆盖率两个量,通过交叉对比来源字符数和质量,发现曝光决定忠实度,检索决定覆盖率,提出先提高曝光再调控检索召回率的实际方法。

Comments 13 pages, 2 figures, appendix

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 3 篇

2607.13003 2026-07-15 cs.CR cs.IT cs.LG math.IT 新提交 57%

Watermark Forensics for Generative Models: An Information-Theoretic Perspective

生成模型的水印取证:信息论视角

Xiaoyu Li, Zheng Gao, Xiaoyan Feng, Jiaojiao Jiang, Yulei Sui, Jiankun Hu

机构 * University of New South Wales(新南威尔士大学) Griffith University(格里菲斯大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 从信息论视角研究生成模型水印取证,通过信息轮廓确定取证阶梯各级成本,给出多用户归属和提取有效载荷的熵率定律,实验验证了相关预测常数,揭示了水印取证中的实际差距。

Comments The abstract has been shortened to comply with arXiv's length limit

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10467 2026-07-15 cs.SE cs.LG 版本更新 57%

Toward Production-Ready Federated Learning in Healthcare: Privacy, Orchestration, and Governance in MLOps

迈向医疗保健领域可投入生产的联邦学习:MLOps 中的隐私、编排与治理

Sakshi Gorkhali, Jonesh Shrestha

专题命中 隐私与版权 :trustworthy(abstract);分类 cs.LG

AI总结 研究医疗保健领域联邦学习,探讨 MLOps 实践和 FLOps 理念,回答容器化编排对联邦部署的支持、隐私机制的影响及部署后重要实践等问题,提出需集成 MLOps 架构让联邦医疗保健机器学习系统更具性能。

Comments 5 pages, 2 figures, 1 table; v2 adds the permanent arXiv identifier and DOI to the reference block. No changes to the analysis or conclusions

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12765 2026-07-15 cs.LG 版本更新 57%

Inference-Time Machine Unlearning via Gated Activation Redirection

推理时的机器去学习 via 门控激活重定向

Vinícius Conte Turani, Otávio Parraga, João Vitor Boer Abitante, Kristen K. Arguello, Joana Pasquali, Ramiro N. Barros, Flavio du Pin Calmon, Christian Mattjie, Rodrigo C. Barros, Lucas S. Kupssinskü

机构 * MALTA, Machine Learning Theory and Applications Lab, PUCRS, Porto Alegre, Brazil(MALTA机器学习理论与应用实验室,PUCRS,波士顿-阿尔格雷,巴西) Harvard University(哈佛大学) Kunumi Institute, Brazil(库努米研究所,巴西)

专题命中 隐私与版权 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种无需训练和梯度的机器去学习方法GUARD-IT,通过在推理时依赖输入的激活引导来消除特定数据集的影响,同时保持模型性能,且在量化部署下仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 26 篇

2510.13698 2026-07-15 cs.CV 版本更新 88%

Attention Misses Visual Risk: Risk-Adaptive Steering for Multimodal Safety Alignment

注意力忽视视觉风险:多模态安全对齐的风险适应性转向

Jonghyun Park, Minhyuk Seo, Chaewon Yeo, Jonghyun Choi

机构 * Seoul National University(首尔大学) KU Leuven(鲁汶大学)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract)

AI总结 本文提出MoRAS,通过简洁的视觉上下文增强关键安全区域的视觉注意力,以实现多模态安全对齐,减少推理开销并提升泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11891 2026-07-15 cs.CL cs.AI 新提交 84%

CANDI: Contextual Alignment for Niche Domains Question Answering

CANDI:特定领域问答的上下文对齐

Megha Chakraborty, Darssan L. Eswaramoorthi, Het Riteshkumar Shah, Madhur Thareja, Michelle A Ihetu, Harshul Raj Surana, Kaushik Roy, Amit Sheth

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究针对专业领域大语言模型评估问题,提出CANDI-QA数据集,含两类问答对。评估多种语言模型,给出MTSS-Net框架。揭示特定领域上下文对齐挑战及当前模型局限,为上下文感知语言模型研究提供关键基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26052 2026-07-15 cs.CL 版本更新 83%

From Prompt Risk to Response Risk: Paired Analysis of Safety Behavior of Large Language Models

从提示风险到响应风险:大型语言模型安全行为的配对分析

Mengya Hu, Qiong Wei, Sandeep Atluri

机构 * Microsoft(微软)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 本研究通过配对分析人类标注的提示和响应记录,探讨了大型语言模型在四个危害类别(性、自残、仇恨和暴力)和有序严重性级别上的安全行为,发现61%的响应比提示减少了危害,3%的响应升级了危害,并揭示了安全行为与无害性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01241 2026-07-15 cs.CY cs.AI 版本更新 81%

First, do NOHARM: a medical safety benchmark and randomized study of physician and AI teaming on clinical consultations

首先,不伤害:迈向临床安全的大语言模型

David Wu, Fateme Nateghi Haredasht, Saloni Kumar Maharaj, Priyank Jain, Jessica Tran, Matthew Gwiazdon, Arjun Rustagi, Jenelle Jindal, Jacob M. Koshy, Vinay Kadiyala, Anup Agarwal, Bassman Tappuni, Brianna French, Sirus Jesudasen, Christopher V. Cosgriff, Rebanta Chakraborty, Jillian Caldwell, Susan Ziolkowski, David J. Iberri, Robert Diep, Rahul S. Dalal, Kira L. Newman, Kristin Galetta, J. Carl Pallais, Nancy Wei, Kathleen M. Buchheit, David I. Hong, Vartan Pahalyants, Ernest Y. Lee, Allen Shih, Tamara B. Kaplan, Vishnu Ravi, Sarita Khemani, Thomas A. Buckley, April S. Liang, Daniel Shirvani, Advait Patil, Nicholas Marshall, Kanav Chopra, Joel Koh, Adi Badhwar, Anastasia Perez, Austin J. Schoeffler, Mahbuba Tusty, Chase M. Walton, Liam G. McCoy, David J. H. Wu, Yingjie Weng, Sumant Ranji, Kevin Schulman, Nigam H. Shah, Jason Hom, Arnold Milstein, Arjun K. Manrai, Adam Rodman, Jonathan H. Chen, Ethan Goh

机构 * Harvard Combined Dermatology Program(哈佛联合皮肤科项目) Department of Dermatology, Mass General Brigham(麻省总医院皮肤科) Harvard Medical School(哈佛医学院) Stanford Center for Biomedical Informatics Research(斯坦福生物医学信息学研究中心) Stanford University(斯坦福大学) Division of Hospital Medicine, Department of Medicine, Stanford University School of Medicine(斯坦福大学医学院医院医学科) Department of Medicine, Cambridge Health Alliance(剑桥健康联盟医学科) Beth Israel Deaconess Hospital–Plymouth(贝塞斯达德acons医院-普利茅斯) Department of Medicine, University of California, San Francisco(加州大学旧金山分校医学科) Department of Neurology, Stanford University School of Medicine(斯坦福大学医学院神经科) Department of Medicine, Beth Israel Deaconess Medical Center(贝塞斯达德acons医学中心医学科) Division of Cardiology, Department of Medicine, Cambridge Health Alliance(剑桥健康联盟心脏病科) Department of Cardiovascular Medicine, Summa Health System(Summa健康系统心血管医学科) Division of Allergy, Pulmonary, and Critical Care Medicine, Department of Medicine, University of Wisconsin-Madison(威斯康星大学麦迪逊分校医学科过敏、呼吸科和危重医学科) Division of Pulmonary and Critical Care Medicine, Department of Medicine, Massachusetts General Hospital(麻省总医院呼吸科和危重医学科) Center for Immunology and Inflammatory Diseases, Department of Medicine, Massachusetts General Hospital(麻省总医院免疫和炎症疾病中心) Broad Institute of MIT and Harvard(MIT和哈佛Broad研究所) Division of Pulmonary, Critical Care, and Sleep Medicine, Cambridge Health Alliance(剑桥健康联盟呼吸科、危重医学科和睡眠医学科)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.CY

AI总结 提出NOHARM基准,包含1100个初级到专科咨询案例,评估28个LLM的医疗建议安全性,发现高达22.6%的案例存在严重危害风险,其中遗漏错误占80%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12113 2026-07-15 cs.DC cs.AI 新提交 79%

Toward Trustworthy Autonomous Science: A Two-Year Community Roadmap

迈向可信自主科学:两年社区路线图

Rafael Ferreira da Silva, Milad Abolhasani, Peter Beaucage, Laura Biven, Michael Bussmann, Kyle Chard, Ryan Coffee, Stephen DeWitt, Sagar Dolas, Carrie Eckert, David Elbert, Ian Foster, Tirthankar Ghosal, Anna Giannakou, Tom Gibbs, Leslie Hamilton, Glenn Lockwood, Theresa Mayer, Ben Mintz, Raffi Nazikian, Sal Nimer, Amanda Randles, Woong Shin, Sreenivas Rangan Sukumar, Frédéric Suter, Mitra Taheri, Michela Taufer, Draguna Vrabie

机构 * U.S. Department of Energy, Office of Science, Office of Advanced Scientific Computing Research(美国能源部科学办公室高级科学计算研究办公室)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 该研究针对自主科学领域发展现状及问题,更新路线图围绕七个维度,评估原有里程碑并新增四个,规划两年发展路径,第一年聚焦接口等搭建验证框架,第二年针对联盟等,强调基层网络的互操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11892 2026-07-15 cs.CL cs.AI 新提交 73%

G-SHARE: A Guideline-Based Structured Reasoning Framework for Human-Factor Event Diagnosis

G-SHARE:一种基于指南的人为因素事件诊断结构化推理框架

Xingyu Xiao, Mao Du, Jiejuan Tong, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程重点实验室) Fujian Fuqing Nuclear Power Co., Ltd.(福建福清核电有限公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对核电站人为因素事件诊断问题,提出基于指南的结构化推理框架G-SHARE,将诊断指南转化为多阶段流程,含证据提取等步骤。通过构建数据集评估,其性能显著优于基线,证明了转化专家指南为推理流程对安全关键行业智能分析的价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12792 2026-07-15 cs.CR cs.AI 新提交 70%

Silent Alarm: A J-Space Protocol for Comparing Danger Recognition Across Models and Quantization Levels

无声警报:一种用于跨模型和量化级别比较危险识别的J空间协议

Roman Prosvirnin, Victor Minchenkov, Alexey Soldatov, Vladimir Bashun

机构 * HSE University(俄罗斯高等经济大学)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究提出JADR协议,通过J空间测量模型内部表示,不依赖外部评判模型,计算本地运行。应用于六个模型跨越三种权重表示形式,以SafetyAUC指标比较,能显著区分不同安全机制模型,捕捉量化差异。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12739 2026-07-15 cs.CL 新提交 70%

Epistemic Stance Flexibility Probing: Measuring Prompt-Conditioned Register Shift in Large Language Models

认知立场灵活性探测:测量大语言模型中提示条件下的语域转换

Binwen Liu, Yilin Ren

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL

AI总结 研究大语言模型在不同归因提示下的认知立场灵活性,引入ESFP基准,涵盖多类别多模板项目,从四个维度评估模型响应,发现认知灵活性与模型能力正交,立场内容密度信号最强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12662 2026-07-15 cs.AI cs.MA cs.SY eess.SY 新提交 70%

Internet of Agentic Things: Networked AI Agents for Closed-Loop IoT Orchestration

智能物联网络:用于闭环物联网编排的联网人工智能代理

Quanyan Zhu

机构 * New York University, Tandon School of Engineering(纽约大学坦登工程学院)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 介绍智能物联网络(IoAT)架构框架,它集成多种技术成统一闭环编排框架,由多层通过自主AI代理连接,用半形动态规划框架形式化问题,以智能建筑编排为例,还讨论了相关关键研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28583 2026-07-15 cs.CV cs.AI cs.MM 版本更新 70%

Navigating the Mirage: A Dual-Path Agentic Framework for Robust Misleading Chart Question Answering

穿越幻象:一种双路径代理框架用于鲁棒的误导图表问答

Yanjie Zhang, Yafei Li, Rui Sheng, Zixin Chen, Yanna Lin, Huamin Qu, Lei Chen, Yushi Sun

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出ChartCynics双路径框架,通过分离感知与验证,利用诊断视觉路径和OCR驱动数据路径解决图表误导问题,提升模型鲁棒性。

Comments 10pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09224 2026-07-15 cs.SE cs.AI cs.CL 版本更新 62%

Git-Assistant: Planning-Based Support for Updating Git Repositories

Git辅助工具:基于规划的Git仓库更新支持

Alfredo Garrachón Ruiz, Tomás de la Rosa, Daniel Borrajo

机构 * AI Research, JPMorganChase(人工智能研究,摩根大通)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 研究针对git工具对开发者有挑战的问题,提出结合大语言模型与自动规划的Git-Assistant,经合成和随机git环境评估,证明该方法能提升仓库管理可靠性、减少错误,展现混合人工智能方法在开发者辅助上的潜力。

Comments Pending permissions from the private company

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11198 2026-07-15 cs.CL cs.AI 版本更新 62%

Declarative by Design, Assistable Only by Convention: Benchmarking Multi-Agent Frameworks for AI-Assistability

DDL2PropBank Agent:通过一种新的关系模式映射任务评估多智能体框架的开发者体验

Shafiuddin Rehan Ahmed, Sourabh Deshpande

机构 * Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 DDL2PropBank Agent通过新的关系模式映射任务评估多智能体框架的开发者体验,揭示了不同框架在代码复杂性和AI辅助性上的差异,Agno表现出最佳性能。

Comments ACM Submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12835 2026-07-15 cs.CL 新提交 57%

Can LLMs Write Reliable Rubrics? A Meta-Evaluation for Experiment Reproduction

大语言模型能写出可靠的评分标准吗?实验复现的元评估

Hanhua Hong, Yizhi Li, Jiaoyan Chen, Luu Gia Huy, Sophia Ananiadou, Jung-jae Kim, Chenghua Lin

机构 * The University of Manchester(曼彻斯特大学) Institute for Infocomm Research (I²R), A*STAR(资讯通信研究院(I²R),新加坡科技研究局) IQuest Research(IQuest研究公司) ELLIS Manchester(ELLIS曼彻斯特) University of Information Technology, VNU(越南国家大学信息技术大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究大语言模型生成的论文复现评分标准,将其 reformulate 为清单样式,在两个骨干模型上评估四种生成设置,通过语义相似性和分数对齐进行元评估,结果显示增强设置改善下游评估对齐,同时指出其存在过于细化、偏向高分和适应性差等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12454 2026-07-15 cs.LG 新提交 57%

Exploring Zero-Shot Foundation Models for Multivariate Time Series Anomaly Detection

探索用于多变量时间序列异常检测的零样本基础模型

Martin Uray, Saverio Messineo, Roland Kwitt, Stefan Huber

机构 * Salzburg University of Applied Sciences(萨尔茨堡应用科学大学) Paris Lodron University of Salzburg(萨尔茨堡巴黎洛德龙大学)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 研究多变量时间序列异常检测,探索单变量预测基础模型TimesFM的零样本应用于工业MTSAD,评估两种策略,虽未胜过基线,但发现其在捕获时间动态上过于有效致异常难区分,不过在异常边界误差有峰值,对变化点检测有前景。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections. The Version of Record of this contribution will be published in Computer Aided Systems Theory - EUROCAST 2026, Lecture Notes in Computer Science, Springer

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12364 2026-07-15 cs.CV cs.AI 新提交 57%

Lost in Visual Translation: A VLM-Assisted Perceptual-Semantic Coherence Framework for EEG-to-Image Reconstruction

迷失在视觉翻译中:用于脑电到图像重建的基于视觉语言模型的感知语义连贯框架

Sukriti Tiwari, BHVSP Subrahmanyam, Nidhi Goyal, Sai Amrit Patnaik

机构 * Mahindra University(马欣德拉大学) MU-VT Interdisciplinary Advanced Research Centre for Transformative Technologies, Mahindra University(马欣德拉大学MU-VT变革性技术跨学科高级研究中心)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 研究脑电到图像重建中视觉保真度与语义可恢复性评估问题,引入基于四个视觉语言模型的框架,通过结构化问题评估图像对,产生宽容感知和语义对齐分数,提炼出脑机接口连贯分数,有效评估感知语义可恢复性。

Comments 27 pages, 3 figures, 13 tables. Accepted at the 5th International Workshop on Human Brain and Artificial Intelligence (HBAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏