arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-24 至 2026-03-24 共收录 116 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 43 篇

2512.16523 2026-03-24 cs.CV cs.AI 57%

TTP: Test-Time Padding for Adversarial Detection and Robust Adaptation on Vision-Language Models

TTP: 视觉-语言模型上的对抗检测与鲁棒适应的测试时填充

Zhiwei Li, Yitian Pang, Weining Wang, Zhenan Sun, Qi Li

机构 * NLPR & MAIS, Institute of Automation, Chinese Academy of Sciences(神经网络与模式识别实验室及自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Department of Automation, Tsinghua University(清华大学自动化系)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出TTP框架,通过测试时填充实现对抗检测与鲁棒适应,提升视觉-语言模型在对抗攻击下的鲁棒性而不影响清洁准确性。

Comments Accepted to the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14977 2026-03-24 cs.RO cs.AI 57%

SVBRD-LLM: Self-Verifying Behavioral Rule Discovery for Autonomous Vehicle Identification

SVBRD-LLM:自主车辆识别的自验证行为规则发现

Xiangyu Li, Tianyi Wang, Junfeng Jiao, Christian Claudel, Zhaomiao Guo

机构 * Fariborz Maseeh Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程学院) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出SVBRD-LLM框架,通过零样本大语言模型提取可解释的行为规则,用于自主车辆识别,实现了90.0%的准确率和93.3%的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24358 2026-03-24 cs.SE cs.CL 57%

Automatically Benchmarking LLM Code Agents through Agent-Driven Annotation and Evaluation

通过代理驱动的标注和评估自动评估代码代理

Lingyue Fu, Bolun Zhang, Hao Guan, Yaoming Zhu, Lin Qiu, Weiwen Liu, Xuezhi Cao, Xunliang Cai, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出代理驱动的基准构建流程,引入PRDBench包含50个真实Python项目,通过专门模型提升评估准确性,验证了框架的可扩展性和鲁棒性。

Comments Accepted by AAMAS 2026

Journal ref Proc. of the 25th International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2026), Paphos, Cyprus, May 25-29, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24302 2026-03-24 cs.LG 57%

LEAF: Language-EEG Aligned Foundation Model for Brain-Computer Interfaces

LEAF:语言-脑电对齐的基础模型用于脑机接口

Muyun Jiang, Shuailei Zhang, Zhenjie Yang, Mengjun Wu, Weibang Jiang, Zhiwei Guo, Wei Zhang, Rui Liu, Shangen Zhang, Yong Li, Yi Ding, Cuntai Guan

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Shanghai Jiao Tong University, China(上海交通大学,中国) University of Science and Technology Beijing, China(北京科技大学,中国) Southeast University, China(东南大学,中国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 LEAF通过整合语义指导生成结构化的脑电嵌入,提升解码鲁棒性和迁移性,实现语言与脑电信号的对齐,取得12个数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05909 2026-03-24 cond-mat.mtrl-sci cs.LG 57%

Learning Magnetic Order Classification from Large-Scale Materials Databases

从大规模材料数据库中学习磁序分类

Ahmed E. Fahmy

机构 * Department of Physics, The Ohio State University(俄亥俄州立大学物理系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文通过训练机器学习分类器,从实验验证的MAGNDATA磁性材料中识别磁序,提出传播向量分类器在92%准确率下优于现有方法,揭示了材料数据库中的铁磁偏见。

Comments Main Text: 10 pages + 10 Figures & 3 Supplementary Tables. (Under Review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.12739 2026-03-24 cs.CL 57%

Edu-Values: Towards Evaluating the Chinese Education Values of Large Language Models

Edu-Values:面向评估大型语言模型的中国教育价值观

Peiyi Zhang, Yazhou Zhang, Bo Wang, Lu Rong, Prayag Tiwari, Jing Qin

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出Edu-Values基准,评估大型语言模型的中国教育价值观,包含七个核心价值,通过1418道题测试,发现中文LLM在教育文化差异下表现更优,且利用Edu-Values构建外部知识库可提升对齐效果。

Comments The authors are withdrawing this paper to make substantial revisions and improvements before future submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21447 2026-03-24 cs.CY 57%

Deliberative multi-agent large language models improve clinical reasoning in ophthalmology

协商式多智能体大语言模型提升眼科临床推理

Ehsan Misaghi, Sean T Berkowitz, Bing Yu Chen, Qingyu Chen, Renaud Duval, Pearse A Keane, Danny A Mammo, Ariel Yuhan Ong, Mertcan Sevgi, Sumit Sharma, Sunil K Srivastava, Yih Chung Tham, Fares Antaki

专题命中 安全评测 :safety(abstract);分类 cs.CY

AI总结 本研究比较了多智能体协商系统与单一模型在眼科临床推理中的表现,发现协商系统在准确性和安全性上均优于单一模型,且能减少有害错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21231 2026-03-24 cs.CR cs.AI 57%

When Convenience Becomes Risk: A Semantic View of Under-Specification in Host-Acting Agents

当便利成为风险:主机作用代理中的语义视角下的不足规范

Di Lu, Yongzhi Liao, Xutong Mu, Lele Zheng, Ke Cheng, Xuewen Dong, Yulong Shen, Jianfeng Ma

机构 * School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文探讨主机作用代理中因目标规范不足导致的安全问题,提出语义威胁模型和风险完成模式分类,并通过案例研究分析如何通过明确执行边界来防御风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11721 2026-03-24 cs.AI 57%

When OpenClaw Meets Hospital: Toward an Agentic Operating System for Dynamic Clinical Workflows

当OpenClaw遇见医院:迈向动态临床工作流的智能操作系统

Wenxian Yang, Hanzheng Qiu, Bangqun Zhang, Chengquan Li, Zhiyong Huang, Xiaobin Feng, Rongshan Yu, Jiahong Dong

机构 * Independent Researcher(独立研究者) National Institute for Data Science in Health and Medicine, Xiamen University, Xiamen, China(健康医学数据科学国家研究院,厦门大学,厦门,中国) Yue’erwan Internet Hospital Co., Ltd.(悦尔湾互联网医院有限公司) School of Biomedical Engineering, Tsinghua University, Beijing, China(生物医学工程学院,清华大学,北京,中国) National University of Singapore, Singapore(新加坡国立大学) Yttrium-90 Precision Interventional Radiotherapy Center of Liver Cancer, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝癌钇-90精准介入放射治疗中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国) Hepatobiliary and Pancreatic Centre, Beijing Tsinghua Changgung Hospital, School of Clinical Medicine, Tsinghua University, Beijing, China(肝胆胰中心,北京清华大学昌平医院,临床医学学院,清华大学,北京,中国)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出一种适应医院环境的LLM代理架构,通过受限执行环境、文档导向交互模型、分页索引内存架构和可组合医疗技能库,实现临床工作流的协调,保障安全、透明和可审计性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07496 2026-03-24 cs.CR cs.AI 57%

From Thinker to Society: Security in Hierarchical Autonomy Evolution of AI Agents

从思考者到社会:AI智能体分层自主性演化的安全问题

Xiaolei Zhang, Lu Zhou, Xiaogang Xu, Jiafei Wu, Tianyu Du, Heqing Huang, Hao Peng, Zhe Liu

机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Collaborative Innovation Center of Novel Software Technology and Industrialization(新型软件技术与产业化协同创新中心) The Chinese University of Hong Kong(香港中文大学) The University of Hong Kong(香港大学) Zhejiang University(浙江大学) Independent Researcher(独立研究者) Zhejiang Normal University(浙江师范大学) School of Software Technology, Zhejiang University(浙江大学软件学院) Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 研究探讨了AI智能体分层自主性演化中的安全挑战,提出三级安全框架并分析现有防御措施的不足,旨在指导可信AI智能体系统的多层防御架构设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13925 2026-03-24 cs.CV cs.AI 57%

Segmenting Visuals With Querying Words: Language Anchors For Semi-Supervised Image Segmentation

通过查询词进行视觉分割:用于半监督图像分割的语言锚点

Numair Nadeem, Saeed Anwar, Muhammad Hamza Asad, Abdul Bais

机构 * University of Regina, Canada(里嘉大学) The University of Western Australia, Australia(西澳大学) University Canada West, Canada(加拿大西大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出HVLFormer,通过生成多尺度文本查询和引入跨视角一致性正则化,提升视觉与文本对齐,以实现更准确的半监督图像分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20572 2026-03-24 cs.LG 57%

LJ-Bench: Ontology-Based Benchmark for U.S. Crime

LJ-Bench:基于本体的美国犯罪评估基准

Hung Yun Tseng, Wuzhen Li, Blerina Gkotse, Grigorios Chrysos

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 LJ-Bench是首个基于本体的全面基准,用于评估LLM对多种非法活动的鲁棒性,揭示LLM在不同犯罪类别中的脆弱性。

Comments Accepted at Transactions on Machine Learning Research in March, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20537 2026-03-24 cs.AI 57%

LLM-Driven Heuristic Synthesis for Industrial Process Control: Lessons from Hot Steel Rolling

基于大语言模型的启发式合成在工业过程控制中的应用:来自热轧的启示

Nima H. Siboni, Seyedreza Kiamousavi, Emad Scharifi

机构 * Institute of Metal Forming, RWTH Aachen(RWTH亚琛大学金属成形研究所)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种基于大语言模型的启发式合成框架,用于热轧过程控制,通过可解释的Python控制器生成和自动审计流程,结合结构化战略构思和可执行代码生成,实现对轧制高度、间歇时间和轧制速度的控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20354 2026-03-24 cs.MM cs.AI 57%

Leum-VL Technical Report

Leum-VL 技术报告

Yuxuan He, Chaiming Huang, Yifan Wu, Hongjun Wang, Chenkui Shen, Jifan Zhang, Long Li

机构 * Hainan Sihe Data Technology Co., Ltd.(海南世和数据技术有限公司)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出SV6D框架,通过六维结构化表示解析视频内容,构建Leum-VL-8B模型,在多个基准测试中取得优异成绩,强调视频AI需关注结构表示而非像素生成。

Comments 27 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20270 2026-03-24 cs.AI 57%

FactorSmith: Agentic Simulation Generation via Markov Decision Process Decomposition with Planner-Designer-Critic Refinement

FactorSmith: 通过马尔可夫决策过程分解实现代理模拟生成

Ali Shamsaddinlou, Morteza NourelahiAlamdari

机构 * Ali Shamsaddinlou(阿里·沙姆萨丁卢) Morteza NourelahiAlamdari(莫尔塔扎·努尔埃拉希阿尔马达里)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出FactorSmith框架,通过分解POMDP实现从文本描述生成可执行模拟,结合分解策略与分层代理工作流提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08157 2026-03-24 cs.RO cs.AI cs.MA 57%

Risk-Bounded Multi-Agent Visual Navigation via Iterative Risk Allocation

基于迭代风险分配的有界多智能体视觉导航

Viraj Parimi, Brian C. Williams

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文提出风险有界多智能体路径规划框架,通过动态分配风险预算提升多智能体在高风险环境中的导航效率与安全性。

Comments Published at ICAPS '26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16753 2026-03-24 cs.CL 57%

GAICo: A Deployed and Extensible Framework for Evaluating Diverse and Multimodal Generative AI Outputs

GAICo:一个用于评估多样化和多模态生成式人工智能输出的部署和可扩展框架

Nitin Gupta, Pallav Koppisetti, Kausik Lakkaraju, Biplav Srivastava

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 GAICo提供统一框架,支持多种参考指标,用于评估生成式AI输出,提升评估标准化和可复现性,加速AI系统开发。

Comments 11 pages, 7 figures; accepted at IAAI/AAAI 2026; (updated) extended version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22212 2026-03-24 cs.CV 50%

Omni-WorldBench: Towards a Comprehensive Interaction-Centric Evaluation for World Models

Omni-WorldBench:迈向全面的交互导向的世界模型评估

Meiqi Wu, Zhixin Cai, Fufangchen Zhao, Xiaokun Feng, Rujing Dang, Bingze Song, Ruitian Tian, Jiashu Zhu, Jiachen Lei, Hao Dou, Jing Tang, Lei Sun, Jiahong Wu, Xiangxiang Chu, Zeming Liu, Kaiqi Huang

机构 * School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, CASIA(复杂系统认知与决策智能重点实验室) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) State Key Laboratory of Networking and Switching Technology, BUPT(网络与交换技术国家重点实验室) AMAP, Alibaba Group(阿里妈妈实验室,阿里巴巴集团)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出Omni-WorldBench,一个针对4D世界模型交互响应能力的综合评估基准,通过Omni-WorldSuite和Omni-Metrics评估交互动作对状态转移的影响,分析现有模型的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21986 2026-03-24 cs.CV 50%

Speed by Simplicity: A Single-Stream Architecture for Fast Audio-Video Generative Foundation Model

速度与简洁:一种单流架构用于快速音频视频生成基础模型

SII-GAIR, Sand. ai, :, Ethan Chern, Hansi Teng, Hanwen Sun, Hao Wang, Hong Pan, Hongyu Jia, Jiadi Su, Jin Li, Junjie Yu, Lijie Liu, Lingzhi Li, Lyumanshan Ye, Min Hu, Qiangang Wang, Quanwei Qi, Steffi Chern, Tao Bu, Taoran Wang, Teren Xu, Tianning Zhang, Tiantian Mi, Weixian Xu, Wenqiang Zhang, Wentai Zhang, Xianping Yi, Xiaojie Cai, Xiaoyang Kang, Yan Ma, Yixiu Liu, Yunbo Zhang, Yunpeng Huang, Yutong Lin, Zewei Tao, Zhaoliang Liu, Zheng Zhang, Zhiyao Cen, Zhixuan Yu, Zhongshu Wang, Zhulin Hu, Zijin Zhou, Zinan Guo, Yue Cao, Pengfei Liu

机构 * SII-GAIR

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出daVinci-MagiHuman模型,通过单流Transformer实现同步视频音频生成,支持多语言语音生成,生成256p视频仅需2秒,自动评估中视觉质量和文本对齐最佳,语音识别错误率最低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21939 2026-03-24 cs.CV cs.MM 50%

FeatDistill: A Feature Distillation Enhanced Multi-Expert Ensemble Framework for Robust AI-generated Image Detection

FeatDistill: 一种结合特征蒸馏的多专家集成框架,用于鲁棒的AI生成图像检测

Zhilin Tu, Kemou Li, Fengpeng Li, Jianwei Fei, Jiamin Zhang, Haiwei Wu

机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) State Key Laboratory of Internet of Things for Smart City, University of Macau(澳门大学物联网智能城市国家重点实验室) PRADA Lab, King Abdullah University of Science and Technology(科学与技术王国大学PRADA实验室) Department of Information Engineering, University of Florence(佛罗伦萨大学信息工程系)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出FeatDistill框架,结合特征蒸馏与多专家集成,解决深度伪造图像检测中的退化干扰、特征表示不足和泛化能力有限问题,通过四主干Vision Transformer集成和两阶段训练提升检测鲁棒性和泛化能力。

Comments 6th place (6/507) technical report at the NTIRE 2026: Robust AI-Generated Image Detection in the Wild Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09161 2026-03-24 eess.IV cs.CV 50%

From Explanations to Architecture: Explainability-Driven CNN Refinement for Brain Tumor Classification in MRI

从解释到架构:基于可解释性的CNN细化用于MRI中脑肿瘤分类

Rajan Das Gupta, Md Imrul Hasan Showmick, Lei Wei, Mushfiqur Rahman Abir, Shanjida Akter, Md. Yeasin Rahat, Md. Jakir Hossen

机构 * American International Brac University Faculty of Psychology University-Bangladesh(美国国际布拉大学心理学学院(孟加拉国)) Shinawatra University Department of Computer Science(辛纳瓦特大学计算机科学系) American International North South University(美国国际北南大学) American International University–Bangladesh Department of Computer Science(美国国际大学–孟加拉国计算机科学系) Multimedia University Department of Computer Science(多媒体大学计算机科学系)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文提出一种可解释性驱动的CNN框架,通过Grad-CAM量化层间相关性以去除低贡献层,提升模型透明度并保持分类精度,实验证明在多类脑MRI数据集上达到高准确率,支持更可信的脑肿瘤分类。

Comments This is the preprint version of the manuscript. It is currently being prepared for submission to an academic conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20348 2026-03-24 cs.CV 50%

Toward a Multi-View Brain Network Foundation Model: Cross-View Consistency Learning Across Arbitrary Atlases

迈向多视角脑网络基础模型:跨视角一致性学习在任意脑图谱上的应用

Jiaxing Xu, Jingying Ma, Xin Lin, Yuxiao Liu, Kai He, Qika Lin, Yiping Ke, Yang Li, Dinggang Shen, Mengling Feng

机构 * Saw Swee Hock School of Public Health at National University of Singapore(国立新加坡大学 Saw Swee Hock 公共卫生学院) School of Biomedical Engineering & State Key Laboratory of Advanced Medical Materials and Devices, ShanghaiTech University(上海科技大学 生物医学工程学院及先进医学材料与设备国家重点实验室) College of Computing and Data Science, Nanyang Technological University(南洋理工大学 计算与数据科学学院) School of Automation Science and Electrical Engineering, Beihang University(北航自动化科学与电气工程学院) State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北航虚拟现实技术与系统国家重点实验室) Shanghai United Imaging Intelligence(上海联合影像智能有限公司) Shanghai Clinical Research and Trial Center(上海临床研究与试验中心)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出MV-BrainFM多视角脑网络基础模型,通过跨视角一致性学习在任意脑图谱上学习通用且可扩展的表示,提升跨图谱的鲁棒性和一致性,实验表明其在20000+受试者数据集上优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. AI治理与伦理 7 篇

2603.21435 2026-03-24 cs.AI econ.GN q-fin.EC 79%

Behavioural feasible set: Value alignment constraints on AI decision support

行为可行集:人工智能决策支持中的价值对齐约束

Taejin Park

机构 * Bank for International Settlements(国际清算银行)

专题命中 AI治理与伦理 :alignment(title,abstract);分类 cs.AI

AI总结 研究探讨了人工智能决策支持系统中价值对齐约束对行为可行集的影响,通过实验显示对齐显著压缩了推荐范围,并揭示了组织在选择供应商时面临的价值导向问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21340 2026-03-24 cs.AI cs.DC 77%

ARYA: A Physics-Constrained Composable & Deterministic World Model Architecture

ARYA:一种受物理约束的可组合且确定性世界模型架构

Seth Dobrin, Lukasz Chmiel

机构 * ARYA Labs(ARYA实验室)

专题命中 AI治理与伦理 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文提出ARYA,一种基于五项原则的可组合、受物理约束且确定性世界模型架构,通过层级系统实现高效能与计算效率的平衡,展示其在六个基准测试中的卓越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 71%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 AI治理与伦理 :alignment(title)

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07775 2026-03-24 cs.CL cs.AI cs.CY 67%

Must Read: A Comprehensive Survey of Computational Persuasion

必须阅读:计算说服的全面综述

Nimet Beyza Bozdag, Shuhaib Mehri, Xiaocheng Yang, Hyeonjeong Ha, Zirui Cheng, Esin Durmus, Jiaxuan You, Heng Ji, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文综述了计算说服的三个视角:AI作为说服者、被说服者和评判者,探讨了AI生成内容的有效性及伦理挑战。

Comments Accepted to ACM Computing Surveys

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20235 2026-03-24 cs.CY cs.AI cs.HC 62%

Writing literature reviews with AI: principles, hurdles and some lessons learned

用AI撰写文献综述:原则、障碍与一些经验教训

Saadi Lahlou, Annabelle Gouttebroze, Atrina Oraee, Julian Madera

机构 * London School of Economics and Political Science(伦敦政治经济学院) Paris Institute for Advanced Study(巴黎高级研究学院)

专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY

AI总结 本文通过比较不同AI辅助程度下的文献综述,揭示了AI生成内容的偏见、主流化倾向及局限性,强调了在使用AI撰写综述时需注意的防范措施。

Comments 31 pages and 193 pages of Appendices, including 6 different versions of the literature review, and complete chat with the LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20214 2026-03-24 cs.CY cs.AI cs.HC 62%

Beyond Detection: Governing GenAI in Academic Peer Review as a Sociotechnical Challenge

超越检测:将生成式人工智能在学术同行评审中的治理视为一个社会技术挑战

Tatiana Chakravorti, Pranav Narayanan Venkit, Sourojit Ghosh, Sarah Rajtmajer

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Salesforce AI Research(Salesforce AI研究) University of Washington(华盛顿大学)

专题命中 AI治理与伦理 :prompt injection(abstract);分类 cs.AI、cs.CY

AI总结 本文通过混合方法研究,探讨生成式人工智能在学术同行评审中的社会技术风险,发现核心评估应由人类承担,同时提出保留问责机制的治理建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21386 2026-03-24 cs.CV 50%

Mitigating Objectness Bias and Region-to-Text Misalignment for Open-Vocabulary Panoptic Segmentation

缓解对象性偏差和区域到文本对齐问题以实现开放词汇全景分割

Nikolay Kormushev, Josip Šarić, Matej Kristan

机构 * University of Ljubljana(卢布尔雅那大学) ETH Zurich(苏黎世联邦理工学院) University of Zagreb(扎格reb大学) Faculty of Comp. and Inf. Science(计算机与信息科学系) Dept. of Computer Science(计算机科学系) Faculty of Elec. Eng. and Computing(电子工程与计算科学系)

专题命中 AI治理与伦理 :alignment(abstract)

AI总结 本文提出OVRCOAT框架,通过CLIP条件对象性调整和开放词汇掩码到文本细化,解决开放词汇全景分割中的对象性偏差和区域对齐问题,提升分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他安全 27 篇

2603.21584 2026-03-24 cs.LG cs.CV 79%

SSAM: Singular Subspace Alignment for Merging Multimodal Large Language Models

SSAM:奇异子空间对齐用于融合多模态大语言模型

Md Kaykobad Reza, Ameya Patil, Edward Ayrapetian, M. Salman Asif

机构 * University of California Riverside(加州大学河滨分校) Amazon(亚马逊)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 SSAM通过参数空间对齐融合多模态大语言模型,无需训练数据实现跨模态统一,提升性能并降低资源消耗。

Comments 25 Pages, 9 Figures, 5 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏