arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-08-06 至 2026-08-06 共收录 92 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 42 篇

2608.04613 2026-08-06 cs.LG 新提交 57%

Why Ranking Anomaly Detection Algorithms Isn't as Reliable as You May Think

为何异常检测算法的排名并不如你所想的可靠

Simon Klüttermann, Jérôme Rutinowski, Frederik Polachowski, Alice Kirchheim

机构 * Carnegie Mellon University(卡内基梅隆大学) TU Dortmund University(多特蒙德工业大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) iits Consulting GmbH(iits咨询有限公司) Fraunhofer Institute for Material Flow and Logistics IML(弗劳恩霍夫物流与材料流动研究所IML)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究通过分析7种算法在690个数据集上的表现,发现异常检测算法排名高度不稳定,数据集选择和超参数选择是主要影响因素,可靠基准测试需更大更多样的数据集。

Comments Accepted at the 2026 ICPR Workshop on Workshop on Reproducible Research in Pattern Recognition

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04574 2026-08-06 cs.CL 新提交 57%

When Memory Lies: An Empirical Study of Spatial Memory Staleness in VLM Agents

当记忆“说谎”:VLM智能体中空间记忆过时的实证研究

Yushi Sun, Yanjie Zhang

机构 * Tencent LIGHTSPEED(腾讯光速工作室)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究通过动态FrozenLake测试平台,探究了VLM智能体的空间记忆过时问题,发现文本可解性不代表视觉接地、信任过时记忆存在安全隐患、审核无法完全消除差距,明确了相关核心挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 57%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04505 2026-08-06 cs.CL 新提交 57%

K-EXAONE 2.0 Technical Report

K-EXAONE 2.0 技术报告

Eunbi Choi, Kibong Choi, Sehyun Chun, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Ahra Jo, Hyunjik Jo, Yeonsik Jo, Minhyeok Jung, Doyoung Kim, Heegyu Kim, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Byungoh Ko, Changhun Lee, Dohaeng Lee, Haeju Lee, Jinsik Lee, Kyungmin Lee, Minwoo Lee, Wonkee Lee, Sangha Park, Sungjune Park, Kwangrok Ryoo, Kijung Seo, Minju Seo, Yongwoo Song, Sejong Yang, Heuiyeen Yeen, Stanley Jungkyu Choi, Yemuk Choi, Yongchan Chun, Jiwon Ham, Dasol Hong, Sujeong Im, Kijeong Jeon, Gerrard Jeongwon Jo, Hyeongjun Jo, Yujin Jo, Jiyeon Jung, Naeun Kang, Daeseong Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, Chaeeun Lee, ChaeYoon Lee, Edward Hwayoung Lee, Honglak Lee, Hwansoo Lee, Minkyung Lee, Sangeun Lee, Solji Lim, Woohyung Lim, Chanwoo Moon, Jueun Mun, Jimin Park, Seojeong Park, Yongmin Park, Hyerin Seo, Donghyeon Shin, Donghyun Son, Eunyong Son, Kaehyun Um, Sihoon Yang, Chang En Yea, Sihyuk Yi, Kyungjae Yoo, Chansik Yoon

机构 * LG AI Research(LG AI研究院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该报告介绍LG AI Research开发的K-EXAONE 2.0,这是一款7500亿参数的MoE多语言基础模型,经升级前代模型而来,支持25.6万token上下文,在多类评估中表现优异,以Apache 2.0许可发布,助力AI生态发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04215 2026-08-06 cs.SE cs.AI 新提交 57%

A Unified Model for Cross-Domain Clone Detection via Model Merging

基于模型合并的跨域代码克隆检测统一模型

Palash R. Roy, Banani Roy, Kevin A. Schneider, Chanchal K. Roy

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出通过模型合并技术构建跨域代码克隆检测器,经实验验证TIES合并方法泛化性更优,合并后检测器性能优于零样本代码大模型且泛化性更强。

Comments Accepted at ASE 2026

Journal ref Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 57%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00794 2026-08-06 cs.AI 版本更新 57%

Measurement Without Validity: The Compounding Reliability Problem in Agentic AI Evaluation

无效度的测量:智能体AI评估中的复合可靠性问题

William Caban

机构 * Red Hat, Inc.(红帽公司) Alma Mater Europaea University(欧洲母校大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 该研究指出智能体AI评估存在复合可靠性问题,任务生成、LLM模拟、评分者间信度三个层面的失效相乘降低效度,提出八项心理测量学改进建议以提升评估可信度。

Comments 34 pages (review/double-spaced format), 2 figures, 5 tables. Submitted to Knowledge-Based Systems (Elsevier)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25186 2026-08-06 cs.CL 版本更新 57%

CardioBench: A Real-World Data Benchmark for Evaluating Large Language Models in Clinically Authentic Cardiovascular Care Scenarios

MyoCardBench:用于评估临床真实心血管护理场景中大型语言模型的真实世界数据基准

Xiao Li, Mouxiao Bian, Zhaodi Wu, Sijie Ren, Juechen Chen, Lu Lu, Jingru Ding, Yun Zhong, Jie Xu, Yixiu Liang, Junbo Ge

机构 * Shanghai Institute of Cardiovascular Diseases(上海市心血管病研究所) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Minhang Hospital, Fudan University(复旦大学附属闵行医院)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 该研究开发MyoCardBench真实世界基准评估大语言模型在心血管护理场景的性能,涵盖多任务数据集,经专家注释审核。7个模型在零样本设置下输出,GPT-5.4表现最佳。此基准为评估模型提供框架,助于发现优势与不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11745 2026-08-06 cs.AI 版本更新 57%

Text2GraphQuery-Bench: A Text to Graph Query Benchmark

Text2GQL-Bench: 一个文本到图查询语言基准 [实验、分析与基准]

Songlin Lyu, Lujie Ban, Zihang Wu, Tianqi Luo, Jirong Liu, Ayoub Moussaid, Oskar van Rest, Heng Lin, Chenhao Ma, Nan Tang, Shipeng Qi, Yongchao Liu, Zhan Qiu, Juelu Zhang, Jiajun Zheng

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xi'an Polytechnic University(西安理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Text2GQL-Bench是一个统一的文本到图查询语言基准,通过多领域数据集和评估方法,揭示了ISO-GQL生成中的方言差距,并展示了通过充足示例提升模型性能的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02567 2026-08-06 cs.SE cs.AI 版本更新 57%

Feedback Loops and Code Perturbations in LLM-based Software Engineering: A Case Study on a C-to-Rust Translation System

基于LLM的软件工程中的反馈循环与代码扰动:一种C到Rust翻译系统的案例研究

Martin Weiss, Jesko Hecking-Harbusch, Jochen Quante, Matthias Woehrle

机构 * Otto von Guericke University(奥托·冯·格里克大学) Bosch Research(博世研究)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文研究了反馈循环、LLM选择和代码扰动对C到Rust翻译系统性能的影响,发现反馈循环可减少模型差异并提升系统鲁棒性。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26996 2026-08-06 cs.IR 版本更新 50%

LUCid: Redefining Relevance For Lifelong Personalization

LUCid:重新定义终身个性化中的相关性

Chimaobi Okite, Anika Misra, Joyce Chai, Rada Mihalcea

专题命中 安全评测 :alignment(abstract)

AI总结 LUCid通过真实查询与交互历史的配对,评估情境用户导向的相关性,揭示现有系统在相关性定义与个性化需求间的根本矛盾,推动模型在提取情境相关用户信息上的改进。

Comments second version

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25465 2026-08-06 cs.SE 版本更新 50%

BloomAPR: A Bloom's Taxonomy-based Framework for Assessing the Capabilities of LLM-Powered APR Solutions

BloomAPR:基于布鲁姆教育目标分类学的框架,用于评估大语言模型驱动的自动程序修复(APR)方案的能力

Yinghang Ma, Jiho Shin, Leuson Da Silva, Zhen Ming, Jiang, Song Wang, Foutse Khomh, Shin Hwei Tan

专题命中 安全评测 :trustworthy(abstract)

AI总结 BloomAPR是基于布鲁姆教育目标分类学的动态评估框架,评估了ChatRepair、CigaR等APR方案在不同LLM及布鲁姆分类层级下的漏洞修复能力,发现其存在性能差异并指出基准演进的必要性。

Comments 22 pages, 7 figures, Manuscript submitted to ACM Transactions on Software Engineering and Methodology

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22874 2026-08-06 cs.CV 版本更新 50%

Deformable Medical Image Registration with KAN-based Implicit Neural Representations

基于KAN的隐式神经表示的可变形医学图像配准

Nikita Drozdov, Marat Zinovev, Dmitry Sorokin

机构 * Lomonosov Moscow State University(罗蒙诺索夫莫斯科国立大学)

专题命中 安全评测 :alignment(abstract)

AI总结 提出基于KAN的INR框架KAN-IDIR与RandKAN-IDIR,用于无需数据集级训练的逐对优化可变形医学图像配准,在多模态医学图像上实现高准确性、低开销与稳定性,适用于临床研究。

Comments Accepted at Machine Learning and Knowledge Extraction

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14006 2026-08-06 cs.CV cs.RO 版本更新 50%

ResPlan: A Large-Scale Vector-Graph Dataset of 17,000 Residential Floor Plans

ResPlan:包含17000张住宅平面图的大规模矢量图数据集

Mohamed Abouagour, Eleftherios Garyfallidis

机构 * Department of Intelligent Systems Engineering, Indiana University(智能系统工程系,印第安纳大学)

专题命中 安全评测 :alignment(abstract)

AI总结 ResPlan是含17000张住宅平面图的矢量图数据集,具备功能空间标注与四类图边,相比RPLAN、MSD有更高质量单元布局,含相关代码与三个基准任务基线,可公开获取。

Comments 11 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 1 篇

2608.04382 2026-08-06 cs.LG stat.ML 新提交 57%

Non-asymptotic implicit bias of logistic regression at early-stage gradient descent dynamics

早期梯度下降动力学下逻辑回归的非渐近隐式偏置

Han Bao

机构 * The Institute of Statistical Mathematics(统计数理研究所) Tohoku University(东北大学) RIKEN AIP(理化学研究所人工智能项目)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.LG

AI总结 本研究揭示早期梯度下降动力学中逻辑回归参数向量与最大间隔方向弱对齐的机制,给出对齐迭代次数的紧上界,为理解训练时长与泛化性能的关联提供理论支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 17 篇

2607.28881 2026-08-06 cs.AI 版本更新 85%

Fragility of Value under Imperfect Alignment

不完美对齐下价值的脆弱性

Winter Cross

专题命中 其他安全 :alignment(title,abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文针对AI系统与人类价值对齐问题,建立模型明确人类价值函数与代理条件准确度的相关条件,凸显过度优化风险,提出采用quantilizers等限制优化压力的AI设计方案。

Comments 24 pages, 7 figures Added acknowledgement of funding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04472 2026-08-06 cs.CV cs.AI cs.CL 新提交 81%

EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

EndoVLM:一种通过解剖学引导的稀疏性与渐进式对齐实现的内窥镜视觉-语言预训练模型

Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia

机构 * DAMO Academy, Alibaba Group(阿里巴巴达摩院) The First Affiliated Hospital of Zhejiang Chinese Medical University(浙江中医药大学附属第一医院) Shanghai Jiao Tong University(上海交通大学) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出了EndoVLM这一内窥镜视觉-语言预训练模型,通过解剖学引导的稀疏池化、渐进式语义感知对齐等技术,在34.8万例内窥镜检查数据上预训练,其性能优于现有基础模型且具备零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04697 2026-08-06 cs.AI 新提交 79%

Traceable LLM-Generated Hazard Scenarios for Operational Safety Analysis of Aviation Systems Using ASRS Reports

基于ASRS报告的可追踪LLM生成航空系统运行安全分析危险场景

Cristian Mascia, Roberto Pietrantuono, Daniel Rodriguez, Stefano Russo

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 该研究针对航空系统运行安全分析,提出AI辅助方法结合ASRS报告,用LLM生成可追踪危险场景,通过进化溯因优化混合变体,经评估验证了模型与提示对生成场景有效性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14190 2026-08-06 cs.LG 版本更新 79%

Contrastive Diffusion Alignment: Learning Structured Latents for Controllable Generation

对比扩散对齐:用于可控生成的结构化潜在学习

Ruchi Sandilya, Sumaira Perez, Charles Lynch, Lindsay Victoria, Benjamin Zebley, Derrick Matthew Buchanan, Mahendra T. Bhati, Nolan Williams, Timothy J. Spellman, Faith M. Gunning, Conor Liston, Logan Grosenick

机构 * Department of Psychiatry, Weill Cornell Medicine, New York, NY, USA(威立·科林斯医学中心精神科) Department of Psychiatry, Stanford University, Stanford, CA, USA(斯坦福大学精神科) Department of Neuroscience, University of Connecticut School of Medicine, Farmington, CT, USA(康涅狄格大学医学院神经科学系)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 ConDA通过对比学习在扩散模型中学习结构化潜在空间,实现可控生成和动态解释。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

Journal ref Proceedings of the 43rd International Conference on Machine Learning, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02491 2026-08-06 cs.AI 版本更新 70%

Long-term Measurements: Towards a Longitudinal Understanding of Human-AI Interactions

长期测量:迈向对人机交互的纵向理解

Nicole Mitchell, Dhruv Agarwal, Maty Bohacek, Remi Denton, Roma Patel

机构 * Google Research(谷歌研究院) Cornell University(康奈尔大学) Stanford University(斯坦福大学) Google DeepMind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 本研究针对语言模型融入生活引发的长期人机交互风险,结合社会科学测量与NLP计算方法,提出通过长期测量建模人类行为变化,实现问题行为在线检测以缓解用户长期风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14888 2026-08-06 cs.CL cs.AI cs.CV cs.LG 版本更新 67%

Reasoning Dynamics and the Limits of Monitoring Modality Reliance in Vision-Language Models

推理动态与监控模态依赖性的局限性

Danae Sánchez Villegas, Samuel Lewis-Lim, Nikolaos Aletras, Desmond Elliott

机构 * University of Copenhagen, Department of Computer Science(哥本哈根大学计算机科学系) University of Sheffield, School of Computer Science(谢菲尔德大学计算机科学学院)

专题命中 其他安全 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究分析18种VLM的推理动态,发现模型易受早期预测影响,推理训练模型在模态条件下表现出更强的纠正行为,但其效果依赖于模态条件,且CoT的可检测性因模型而异。

Comments Accepted for publication in COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04084 2026-08-06 cs.LG cs.CL cs.CV 新提交 62%

SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization

SpecDrop:无参数类别条件路由的模块化专业化方法

Boyao Wang, Zhihan Lei

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本文提出无参数类别条件路由方法SpecDrop,在视觉任务上性能优于参数匹配基线,表明路由的有效性取决于训练信号粒度与类别的对齐而非路由算法。

Comments 35 pages, 6 figures. Code: https://github.com/Beryex/SpecDrop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04719 2026-08-06 cs.AI 新提交 57%

Diagnosing Tool-Selection Reasoning in LLM Agents with Canary Tools

用金丝雀工具诊断大语言模型智能体的工具选择推理

Atul Anand, Sourav Chattaraj

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本研究引入金丝雀工具诊断LLM智能体的工具选择推理,通过多维度分类法评估8个模型,发现模型能力提升会降低易感性,分类法具能力分层性,且发布了相关框架与数据。

Comments 10 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18709 2026-08-06 cs.CL 版本更新 57%

LLMs Struggle to Measure What Distinguishes Students of Different Proficiency Levels: A Study of Item Discrimination in Reading Comprehension Assessment

LLMs难以衡量区分不同水平学生的题目:阅读理解评估中题目区分度研究

Han Chen, Ming Li, Chenguang Wang, Yijun Liang, Dawei Zhou, Hong jiao, Tianyi Zhou

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of Maryland(马里兰大学) Virginia Tech(弗吉尼亚理工大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本研究评估42个LLM在零样本设置下预测题目区分度的能力,发现直接预测与人类校准的区分度相关性弱(最高Spearman 0.152),基于CTT的响应校准相关性有限(0.241),表明LLM尚不能可靠捕捉题目区分度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04721 2026-08-06 cs.AI 版本更新 57%

AI Assistance Reduces Persistence and Hurts Independent Performance

人工智能辅助降低坚持性并损害独立表现

Grace Liu, Brian Christian, Tsvetomira Dumbalska, Michiel A. Bakker, Rachit Dubey

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Oxford(牛津大学) Massachusetts Institute of Technology(麻省理工学院) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 研究发现人工智能辅助虽短期提升表现,但降低用户坚持性并损害独立完成任务的能力,尤其在数学推理和阅读理解等任务中表现显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03079 2026-08-06 cs.CL 版本更新 57%

Learning to Diagnose and Correct Moral Errors: Beyond Shallow Heuristics in Moral Alignment

学习诊断和纠正错误:大型语言模型中的道德敏感性获取

Bocheng Chen, Xi Chen, Han Zi, Haitao Mao, Zimo Qi, Xitong Zhang, Kristen Johnson, Guangliang Liu

机构 * University of Mississippi(密西根州立大学) Nanyang Technological University(南洋理工大学) Northeastern University(东北大学) AWS AI Labs(AWS AI实验室) Johns Hopkins University(约翰霍普金斯大学) Qualcomm(高通) Michigan State University(密西根州立大学) Indiana University Indianapolis(印第安纳大学印第安纳波利斯分校)

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 提出一种实用推理方法,通过让大型语言模型诊断和纠正道德错误来获取道德敏感性,并在多个任务上验证了其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09915 2026-08-06 cs.LG 57%

Physics-informed Machine Learning for Battery Pack Thermal Management

基于物理的机器学习用于电池组热管理

Zheng Liu, Yuan Jiang, Yumeng Li, Pingfeng Wang

专题命中 其他安全 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种基于物理的机器学习方法,用于更高效地估计电池组温度分布,相比传统数据驱动方法提升了15%的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15395 2026-08-06 cs.AI 版本更新 57%

Corrigibility Transformation: Constructing Goals That Accept Updates

可修正性转换:构建接受更新的目标

Rubi Hudson

机构 * University of Toronto(多伦多大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 该研究提出一种可修正性转换方法,可在不牺牲性能的情况下将几乎任何目标转换为可修正版本,能诱导AI产生可修正行为,为AI安全提供了关键的可修正目标方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 50%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 其他安全 :alignment(abstract)

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04483 2026-08-06 cs.CV 新提交 50%

Not All Redundant Tokens Are Alike: Analyzing Visual Token Pruning through Token Roles

并非所有冗余视觉标记都相同:通过标记角色分析视觉标记剪枝

Hyeonyu Kim, Sehwan Lim, Youngwon Choi, Taeyoun Kwon, Jaejin Kim

机构 * Maum AI Inc.(Maum AI公司)

专题命中 其他安全 :alignment(abstract)

AI总结 本研究针对视觉-语言模型(VLMs)的视觉标记剪枝问题,通过EmbedLens分析标记角色,发现代表性剪枝方法存在标记角色偏差但与下游性能无直接关联,优化角色分配后表明保留非活跃标记可维持或提升性能,为剪枝方法优化提供了新视角。

Comments Accepted to ECCV 2026 workshop, UniWorld

详情

展开后加载摘要…

URL PDF HTML 收藏