arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-14 至 2026-07-14 共收录 108 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 提示注入 7 篇

2607.10269 2026-07-14 cs.CR 新提交 82%

Devil in the Lens: Analyzing and Defending Physical Prompt Injection Against Vision-Language Models on Wearable Devices

镜头中的恶魔:分析并防御可穿戴设备上针对视觉语言模型的物理提示注入

Yaxin Li, Hao Wang, Yanda Shao, Shuhao Zhang, Yan Long

专题命中 提示注入 :prompt injection(title,abstract);safety(abstract)

AI总结 研究针对可穿戴设备上视觉语言模型的物理提示注入攻击,利用真实环境照片分析出6种威胁向量及对12个模型的影响,攻击成功率高,还提出基于掩码的外部过滤器和基于语义向量的内部检测器两种防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10712 2026-07-14 cs.CR cs.AI cs.DL 新提交 70%

Distributed Denial of Science: How Indirect Data Poisoning of AI Systems Can Industrialize Scientific Fraud

分布式科学否认:人工智能系统的间接数据投毒如何使科学欺诈产业化

Bálint Gyevnár, Atoosa Kasirzadeh, Nihar B. Shah

专题命中 提示注入 :safety(abstract);prompt injection(abstract);分类 cs.AI

AI总结 研究探讨人工智能时代科学欺诈新形式,即间接数据投毒。对手 corrupt 开放数据集上传,使自主研究代理处理后传播欺诈。通过多话题、多系统实验发现投毒成功率高而检测率低。提出科学家角色和数据溯源审计措施,后者可有效降低攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17034 2026-07-14 cs.CL cs.LG 版本更新 66%

KVEraser: Learning to Steer KV Cache for Efficient Localized Context Erasing

KVEraser: 学习操控KV缓存以实现高效的局部上下文擦除

Mufei Li, Shikun Liu, Dongqi Fu, Haoyu Wang, Yinglong Xia, Hong Li, Hong Yan, Pan Li

机构 * Georgia Institute of Technology(佐治亚理工学院) Meta

专题命中 提示注入 :prompt injection(abstract);分类 cs.CL、cs.LG;trustworthy(comments)

AI总结 提出KVEraser方法,通过学习操控KV缓存实现局部上下文擦除,避免全局重计算,在长上下文任务中接近全重算性能且延迟仅增加24%。

Comments Oral at the ICML 2026 Workshop on the Impact of Memorization on Trustworthy Foundation Models; Code available at https://github.com/Graph-COM/KVEraser

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01143 2026-07-14 cs.AI 版本更新 57%

A Low-Latency Fraud Detection Layer for Detecting Adversarial Interaction Patterns in LLM-Powered Agents

面向LLM代理的低延迟欺诈检测层:用于检测对抗性交互模式

Sheldon Yu, Yingcheng Sun, Hanqing Guo, Qianqian Tong

机构 * University of California, San Diego(加州大学圣地亚哥分校) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出一种低延迟欺诈检测机制,通过交互轨迹的结构化运行时特征检测对抗性交互模式,采用轻量模型实现实时部署,实验表明交互层面行为检测应成为LLM代理部署时的核心防护措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10080 2026-07-14 cs.IR 新提交 50%

The Effect of Multi-Lingual and Keyword Adversarial Injection on LLM Relevance Judgment

多语言和关键词对抗性注入对大语言模型相关性判断的影响

Nguyen Khoi Vo, Duy Duong Tuong, Oleg Zendel, Mark Sanderson

专题命中 提示注入 :prompt injection(abstract)

AI总结 研究跨语言提示注入攻击对基于大语言模型的相关性判断的影响,利用TREC数据集和开放权重模型在多语言环境下研究不同注入策略,发现多语言查询注入有效且能绕过现有防御,凸显当前防御差距,强调需更强大评估框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09938 2026-07-14 cs.HC 新提交 50%

"Code Is Cheap. Show Me the Talk.": Lessons from Teaching and Managing AI Coding Tool Usage in a Visualization Course

“代码很廉价。给我看看讲解。”:可视化课程中教授和管理人工智能编码工具使用的经验教训

Zhongzheng Xu, Taehyun Yang, Fumeng Yang

专题命中 提示注入 :prompt injection(abstract)

AI总结 在可视化课程中分享管理和教授人工智能使用的经验,实施提示注入等,发现学生使用情况及问题,指出需明确人工智能使用界限、提示指导,教学生质疑并适应通用设计。

Comments 5 Figures, 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 幻觉与事实性 9 篇

2603.22042 2026-07-14 cs.CV cs.AI 版本更新 83%

Uncertainty-guided Compositional Alignment with Part-to-Whole Semantic Representativeness in Hyperbolic Vision-Language Models

基于部分-整体语义代表性与不确定性引导的组合对齐超几何视觉语言模型

Hayeon Kim, Ji Ha Jang, Junghun James Kim, Se Young Chun

机构 * Dept. of Electrical and Computer Engineering(电子与计算机工程系) INMC & IPAI(INMC与IPAI) Seoul National University(首尔国立大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出UNCHA方法,通过超几何不确定性建模部分-整体语义代表性,提升超几何VLM对多物体场景的组合结构理解能力,实现零样本分类等任务的最先进性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10517 2026-07-14 cs.LG cs.AI 新提交 62%

Conditional Optimal Bridge for Riemannian Activation Steering

用于黎曼激活控制的条件最优桥

Seyed Arshan Dalili, Ajay Narayanan Sridhar, Vijaykrishnan Narayanan, Mehrdad Mahdavi

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 研究针对大语言模型推理时激活控制问题,提出\textsc{Cobras}方法,将其视为残差流超球面上的薛定谔桥,从优化问题推导控制目标,使控制方向查询自适应,实验显示该方法性能优于基线且避免分布外性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11771 2026-07-14 cs.SE cs.AI 新提交 57%

Evaluating RE Practices for Explainability: Synthesizing Insights from Daimler Truck into an Explainable RE Framework Proposal

评估可解释性的需求工程实践:将戴姆勒卡车公司的见解整合到一个可解释的需求工程框架提案中

Umm-e- Habiba, Lucas Mauser, Jonas Fritzsch, Justus Bogner, Stefan Wagner

机构 * TUM School of CIT, Technical University of Munich(慕尼黑技术大学 CIT 学院) Institute of Software Engineering, University of Stuttgart(斯图加特大学软件工程研究所) Department of Computer Science, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 研究现有需求工程实践对可解释性要求的支持,通过对戴姆勒卡车公司从业者的多阶段定性研究,揭示各步骤挑战,表明当前实践支持有限,为开发可解释人工智能的需求工程框架提供实证见解与研究愿景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10811 2026-07-14 cs.MA cs.AI 新提交 57%

Distributed Agent System: Fault-Tolerant Collaboration Among Embodied Agents

分布式智能体系统:具身智能体间的容错协作

Kai Yu, Lu Chen, Hanqi Li

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 针对人工智能工程中智能体驱动任务执行面临的可靠性挑战,提出分布式智能体系统(DAS)框架,重新定义智能体可靠性,构建两层容错架构,为工业场景中异构具身智能体可靠协作提供实用工程途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10491 2026-07-14 cs.LG 新提交 57%

EvidentialRAG: Quantifying and Mitigating Information Conflict in Multi-Source Retrieval-Augmented Generation via Evidential Deep Learning

证据RAG:通过证据深度学习量化和缓解多源检索增强生成中的信息冲突

S M Asif Hossain, Ruksat Khan Shayoni, M. F. Mridha

机构 * School of Computing, Wichita State University(威奇托州立大学计算学院) Department of Computer Science, American International University-Bangladesh(美国国际孟加拉大学计算机科学系)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 研究多源检索增强生成中信息冲突问题,提出ERAG框架,通过将检索块转换为概率证据、用轻量级评估器和融合规则处理不确定性,实验表明该框架在标准问答有竞争力,在冲突情况下行为改善,是可信信息处理实用机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10402 2026-07-14 cs.CR cs.AI cs.SI 新提交 57%

Large Language Models in Misinformation Ecosystems: Misuse, Defense, and Vulnerability

错误信息生态系统中的大语言模型:滥用、防御与脆弱性

Lingwei Wei, Dou Hu, Wei Zhou, Songlin Hu, Philip S. Yu

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Illinois Chicago(伊利诺伊大学香槟分校) State Key Laboratory of Media Convergence and Communication, Communication University of China(中国传媒大学媒体融合与传播国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 研究大语言模型在错误信息生态系统中的问题,引入角色层框架统一风险与防御,组织相关攻击、研究检测与验证方法、分析漏洞及讨论对策,指出从静态检测到风险评估、强化验证管道、部署可审计人工参与验证系统这三个关键挑战。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26795 2026-07-14 cs.CV cs.AI cs.MM 版本更新 57%

NaviCache: Test-Time Self-Calibration Caching for Video Generation

NaviCache: 视频生成的测试时自校准缓存

Zheqi Lv, Zhibo Zhu, Jinke Wang, Qi Tian, Shengyu Zhang, Zhengyu Chen, Chengxi Zang, Zhou Zhao, Fei Wu

机构 * Zhejiang University(浙江大学) Cornell University(康奈尔大学) Tencent Hunyuan(腾讯文生视频)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 针对视频扩散模型计算成本高的问题,提出NaviCache方法,将特征演化重构思为惯性导航系统问题,通过双状态估计架构自适应跟踪特征变化比和潜在漂移,实现有界误差的计算跳过,在多个模型上取得优异性能。

Comments Published at ICML 2026: Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08359 2026-07-14 cs.CL 版本更新 57%

REAL: Reading Out Transformer Activations for Precise Localization in Language Model Steering

REAL:在语言模型引导中读取Transformer激活以进行精确定位

Li-Ming Zhan, Bo Liu, Chengqiang Xie, Jiannong Cao, Xiao-Ming Wu

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究旨在在不改变LLM参数的情况下引导其响应,核心挑战是识别关键内部模块。提出REAL框架,通过训练VQ - AE划分潜在空间,量化模块行为相关性来指导模块选择与引导强度。实验表明该方法能有效干预,提升真实性引导效果且具零样本泛化能力。

Comments need full paper rebuilding

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09774 2026-07-14 cs.DL 新提交 50%

Hallucination Detector: A hybrid LLM and Semantic Scholar tool calling for detecting hallucination in scientific literature on AtomGPT.org

幻觉检测器:一种用于在AtomGPT.org上检测科学文献中幻觉的混合大语言模型和语义学者工具调用

Harichandana Neralla, Jaehyung Lee, Aldo H. Romero, Kamal Choudhary

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 研究针对大语言模型用于科学写作时出现的虚构参考文献问题,提出结合大语言模型字段提取与语义学者结构化检索的AtomGPT参考文献检查器,经基准测试能可靠标记多数幻觉引用,保障文献引用可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 安全评测 32 篇

2607.10112 2026-07-14 cs.CR cs.AI 新提交 85%

Minionese: Comprehensive Benchmark and Mechanistic Study of Multilingual LLM Safety

Minionese:多语言大语言模型安全性的综合基准测试与机理研究

Chigozirim Ifebi, Brent Kong, Ayushi Mehrotra

机构 * California Institute of Technology(加州理工学院)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 研究多语言大语言模型安全对齐问题,引入涵盖多种语言、资源层级和扰动类型的Minionese基准测试及几何机理分析,发现不同攻击类型漏洞特征不同,指出仅英语安全评估不足,需考虑多因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10871 2026-07-14 cs.AI cs.HC 新提交 83%

Toward Contemplative LLM: A Modular Framework for Evaluating and Enhancing LLM Alignment in Mental Health

迈向沉思型大语言模型:心理健康领域中评估与增强大语言模型对齐性的模块化框架

Asher Sprigler, Yang-Yang Feng, Iftach Amir, Jonathan E. Bogard, Todd S Braver, Yi Ding, David Kinney, Yixue Zhao

机构 * Purdue University(普渡大学) Washington University in St. Louis(圣路易斯华盛顿大学) Yixue Research Institute(易学研究所)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.AI

AI总结 针对新模型等涌现使评估沉思原则增强大语言模型对齐性具挑战的问题,提出模块化可扩展评估框架,能集成新元素并重现先进结果,支持交叉评估,其提示模块便于纳入伦理视角,为跨学科研究及有益人机生态系统奠定基础。

Comments Accepted as an oral presentation at HARMONY 2026 (Human-centered AI Research for Mental Health, an Open Networking Symposium), co-located with IEEE/ACM Conference on Connected Health: Applications, Systems, and Engineering Technologies (CHASE 2026) held in Pittsburgh, August 6, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29657 2026-07-14 cs.AI cs.LG 版本更新 81%

Safety from Honesty in a Disinterested AI Predictor

无兴趣AI预测器中的诚实安全性

Yoshua Bengio, Oliver Richardson, Tomáš Gavenčiak, Michael Cohen, Rory Svarc, Damiano Fornasiere, Gael Gendron, David Hyland, Aton Kamanda, Adam Oberman, Francis Rhys Ward, Anna Gavenčiak, Jacob Livingston Slosser, Vincent Mai, Iulian Serban, Joumana Ghosn

机构 * LawZero Université de Montréal(蒙特利尔大学) Mila University of California Berkeley(加州大学伯克利分校) McGill University(麦吉尔大学) Arb Research Center for Theoretical Study Charles University in Prague(布拉格查理大学理论研究中心) University of Oxford(牛津大学) Sapien Institute(Sapien研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI、cs.LG

AI总结 提出一种形式化安全论证,通过数据表示和训练过程确保预测器诚实预测而不成为追求目标的智能体,并证明危险预测器出现的概率可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11374 2026-07-14 cs.LG 新提交 79%

Surprisingly Simple and Effective Multi-Domain Graph Foundation Model through Graph-to-Table Alignment

通过图到表对齐实现惊人简单且有效的多域图基础模型

Chunyu Hu, Tianyin Liao, Ge Lan, Xingxuan Zhang, Jianxin Li, Peng Cui, Ziwei Zhang

机构 * Nankai University(南开大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 研究如何让表格基础模型有效捕获图结构信息,提出GTAlign框架,先预训练图编码器捕获图表示,通过社区引导持续预训练弥合差距,应用于目标域推理,实验表明该框架在节点和图分类上显著优于基线,提供简单无文本的图基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09764 2026-07-14 cs.RO cs.AI 新提交 79%

OmniSCS: Omni Safety-Critical Scenario Synthesis for Autonomous Driving via a Fully Editable Driving World

OmniSCS:通过完全可编辑的驾驶世界实现自动驾驶的全场景安全关键场景合成

Xiaoyun Dong, Qian Xu, Yang Lu, Yang Lou, Yung-Hui Li, Jianping Wang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对自动驾驶安全关键场景合成难题,提出OmniSCS系统,通过完全可编辑驾驶世界构建和SCS合成两个模块,保持数据保真度,在多数据集实验中表现出色,能增强算法并支持实时闭环测试,为SCS优化测试提供高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24074 2026-07-14 cs.CL 79%

How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

安全基准对裁判配置选择的敏感性如何?

Xinran Zhang

机构 * University of California, Berkeley, Berkeley CA 94720, USA(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究通过实验展示裁判提示语对安全基准评估结果的显著影响,揭示裁判配置对测量变异的决定性作用。

Comments Accepted by the 22nd International Conference on Intelligent Computing (ICIC 2026). Final version to appear in Springer CCIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22823 2026-07-14 cs.CV cs.AI 版本更新 79%

PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

PivotMerge: 通过后对齐模型融合弥合异构多模态预训练

Zibo Shao, Baochen Xiong, Xiaoshan Yang, Yaguang Song, Qimeng Zhang, Haifeng Chen, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Data Science and Artificial Intelligence Research Institute, China United Network Communications Group Co., Ltd.(中国联合网络通信集团有限公司数据科学与人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出PivotMerge框架,通过后对齐模型融合技术,解决多模态预训练中跨模态对齐能力整合问题,提升模型统一语义空间的构建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11339 2026-07-14 cs.CV 新提交 78%

HierCAD: Hierarchical Text-to-CAD Design via Structure Alignment and Parameter Grounding

HierCAD:通过结构对齐和参数接地实现分层文本到CAD设计

Jimin Xu, Tianbao Wang, Tao Jin, Zhou Zhao

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 安全评测 :alignment(title,abstract)

AI总结 针对文本到CAD设计中结构一致性和参数确定问题,提出HierCAD框架,通过分解CAD构造树进行渐进推理,并引入SAPG学习策略,在CAD序列生成和模型评估上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06401 2026-07-14 cs.AI cs.CL 版本更新 76%

BizFinBench.v2: Towards Reliable LLMs in Finance via Real-User Data and Offline/Online Bilingual Evaluation

BizFinBench.v2:通过真实用户数据和离线/在线双语评估实现金融领域可靠的大语言模型

Xin Guo, Rongjunchen Zhang, Guilong Lu, Xuntao Guo, Shuai Jia, Zhi Yang, Liwen Zhang

机构 * HiThink Research(HiThink研究机构) Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全评测 :alignment(title);分类 cs.CL、cs.AI

AI总结 研究针对大语言模型在金融应用中实际效果与报告性能差距大的问题,构建BizFinBench.v2基准,涵盖中美股票市场真实用户数据及多个任务,通过实验评估模型,揭示现有模型局限,为金融领域大语言模型部署提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09804 2026-07-14 cs.CR cs.AI 新提交 74%

Trivial Prompt Reframing Bypasses Safety Guardrails in Googleś MedGemma-4B

简单提示重构绕过谷歌MedGemma-4B中的安全护栏

Avi-ad Avraam Buskila

机构 * Department of Information Science and Applied Artificial Intelligence, Bar-Ilan University, Ramat Gan, Israel(信息科学与应用人工智能系,巴伊兰大学,拉马特甘,以色列)

专题命中 安全评测 :safety(title);分类 cs.AI

AI总结 研究谷歌MedGemma-4B在安全护栏方面的问题,构建全因子基准测试,通过多种攻击方式和法官编码量化其表现,发现重新解释请求的框架能提高攻击成功率,且稳健性受主题主导,呼吁为开放医学模型加强部署时护栏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11151 2026-07-14 cs.CR cs.AI 新提交 70%

AMT-X: Phase-Structured Multi-Turn Red-Teaming with Checklist-Gated Evaluation

AMT-X:基于清单门控评估的阶段结构化多轮红队测试

Yi Ting Shen, Kentaroh Toyoda, Alex Leung

机构 * Vulcan Research, AIFT(Vulcan研究,AIFT)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究针对大语言模型安全评估问题,提出AMT-X框架,将攻击设为多阶段状态机,用多角色评审团取代单评判评分,在六个前沿受害者模型和七个审核子类别测试中,不同门控下攻击成功率有显著差异,揭示了部分与完全可操作危害的差距。

Comments A reference implementation is available at https://github.com/VulcanLab/amt-x

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11607 2026-07-14 cs.AI cs.LG stat.ML 新提交 62%

Auditing the Risk Claims of Distributional Reinforcement Learning

审核分布强化学习的风险声明

Hari Prasad

机构 * Hari Prasad

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究分布强化学习智能体风险声明真实性,结合决策指标与统计工具审核,发现多数声明被驳斥,风险反映训练假象,阳性对照证实部分真实声明,训练和集成无法消除问题,重新校准仅否定声明,还记录审核陷阱。

Comments 25 pages, 8 figures, 3 tables (main text); includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10750 2026-07-14 cs.AI cs.LG 新提交 62%

Filtering Harmful Actions Isn't Enough: Phantom Transfer in Agentic SDF

过滤有害行为是不够的:智能体自反决策函数中的幻影转移

Chinmayi Dixit

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 研究在含对抗交互的合成智能体轨迹训练的影响,通过微调Llama 3.3 70B Instruct并评估,发现有害行为过滤不足,生成过程引入失调倾向且分散编码,依赖生成模型,安全基准难区分影响,强调动作级过滤无法确保合成智能体训练数据安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11783 2026-07-14 cs.CL 新提交 57%

How Temperature Shapes Ideological Discourse in Retrieval-Augmented Generation?

温度如何塑造检索增强生成中的意识形态话语?

Elmira Salari, Hazem Amamou, José Victor de Souza, Shruti Kshirsagar, Maria Nunes Delfino, Anderson Avila

机构 * Wichita State University(威斯康星州立大学) São Paulo Catholic University(圣保罗天主教大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 研究探讨温度对检索增强生成中意识形态话语的影响,通过对新冠治疗文章语料库应用词汇多维分析,让模型在不同温度下回答意识形态问题并评估,发现RAG框架易转移意识形态话语,中等温度下话语对齐最高,低温时下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11523 2026-07-14 cs.CV cs.AI 新提交 57%

Vinci2: Providing Proactive Assistance in Continuous Egocentric Videos

Vinci2:在连续自我中心视频中提供主动协助

Gong Sitong, Tianyu Yan, Caixin Kang, Bo Zheng, Xiang Ruan, Huchuan Lu, Kaipeng Zhang, Yoichi Sato, Yifei Huang

机构 * Dalian University of Technology(大连理工大学) Alaya Lab(阿莱雅实验室) The University of Tokyo(东京大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 研究连续自我中心视频中智能助手的主动协助问题,提出Vinci2系统,包含EgoServe基准测试和EgoMemo智能体,通过依赖上下文决策及相关技术,在新基准测试上建立强大基线且在现有测试中具竞争力。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏