arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-07-03 至 2026-07-03 共收录 34 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 3 篇

2601.02813 2026-07-03 cs.AI cs.CL cs.LG 版本更新 82%

HAL: Inducing Human-likeness in LLMs with Alignment

HAL: 通过对齐引导LLM的人类相似性

Masum Hasan, Junjie Zhao, Ehsan Hoque

机构 * University of Rochester(罗切斯特大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出HAL框架,利用可解释的数据驱动奖励信号,通过对比对话数据提取显式会话特征并优化偏好,使模型在对话中更常被视为类人,同时保持整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02327 2026-07-03 cs.CL 版本更新 70%

LearNAT: Learning NL2SQL with AST-guided Task Decomposition for Large Language Models

LearNAT: 基于AST引导任务分解的NL2SQL大语言模型学习

Weibin Liao, Xin Gao, Tianyu Jia, Rihong Qiu, Yifan Zhu, Yang Lin, Xinyu Ma, Junfeng Zhao, Yasha Wang

机构 * School of Computer Science, Peking University(北京大学计算机科学系) Key Laboratory of High Confidence Software Technologies, Ministry of Education(教育部高可信软件技术重点实验室) Big Data Technology Research Center, Nanhu Laboratory(纳米实验室大数据技术研究中心) National Engineering Research Center For Software Engineering, Peking University(北京大学软件工程国家工程研究中心) Peking University Information Technology Institute (Tianjin Binhai)(北京大学信息技术研究院(天津滨海)) School of Computer Sciences, Beijing University of Posts and Telecommunications(北京邮电大学计算机科学系) Huawei Technologies Co., Ltd(华为技术有限公司) Seed, ByteDance Inc.(字节跳动公司)

专题命中 偏好对齐 :DPO(abstract,abstract_cn);分类 cs.CL

AI总结 提出LearNAT框架,通过AST引导的分解合成过程和边际感知强化学习,增强小规模LLM的NL2SQL任务分解能力,以7B参数模型达到GPT-4可比性能。

Comments Accepted by ICLR'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19775 2026-07-03 cs.AI cs.CL cs.ET cs.MA cs.RO 版本更新 62%

From Actions to Understanding: Conformal Interpretability of Temporal Concepts in LLM Agents

从行为到理解:LLM代理中时间概念的符合可解释性

Trilok Padhi, Ramneet Kaur, Krishiv Agarwal, Adam D. Cobb, Daniel Elenius, Manoj Acharya, Colin Samplawski, Alexander M. Berenbeim, Nathaniel D. Bastian, Susmit Jha, Ugur Kursuncu, Anirban Roy

机构 * Georgia State University(佐治亚州立大学) Computer Science Lab, SRI(SRI计算机科学实验室) Army Cyber Institute(陆军网络学院) United States Military Academy(美国军事学院) University of Florida(佛罗里达大学)

专题命中 偏好对齐 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过符合视角解释LLM代理时间概念演变的框架,结合逐步奖励建模与符合预测,识别时间概念的潜在方向,实验表明这些概念可线性分离,为LLM代理提供可靠故障检测和干预方法。

Comments Accepted at the Mechanistic Interpretability Workshop, 43rd International Conference on Machine Learning, Seoul, South Korea, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2604.14228 2026-07-03 cs.SE cs.AI cs.CL cs.LG 版本更新 67%

Dive into Claude Code: The Design Space of Today's and Future AI Agent Systems

深入Claude代码:当今及未来AI代理系统的设计空间

Jiacheng Liu, Xiaohan Zhao, Xinyi Shang, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学VILA实验室) University College London(伦敦大学学院)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文分析Claude代码架构及其与OpenClaw的对比,揭示驱动设计的五个人类价值观,并探讨未来AI代理系统的六个开放设计方向。

Comments Tech report. Code at: https://github.com/VILA-Lab/Dive-into-Claude-Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02196 2026-07-03 cs.AI cs.LG math.ST stat.ML stat.TH 版本更新 62%

Conformal Policy Control

符合性策略控制

Drew Prinster, Clara Fannjiang, Ji Won Park, Kyunghyun Cho, Anqi Liu, Suchi Saria, Samuel Stanton

机构 * Johns Hopkins University(约翰霍普金斯大学) New York University(纽约大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于安全参考策略的符合性校准方法,用于在不违反安全约束的前提下,使优化但未测试的策略能够安全地进行探索,并在有限样本下提供理论保证。

Comments International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03497 2026-07-03 cs.RO cs.AI cs.CV 版本更新 57%

Sim2Real-AD: A Modular Sim-to-Real Framework for Deploying VLM-Guided Reinforcement Learning in Real-World Autonomous Driving

Sim2Real-AD:一种模块化的仿真到现实框架,用于在现实世界自动驾驶中部署基于VLM的强化学习

Zilin Huang, Zhengyang Wan, Zihao Sheng, Boyue Wang, Junwei You, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Google(谷歌)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出Sim2Real-AD框架,实现无需真实世界强化学习数据将CARLA训练的VLM引导强化学习策略零样本迁移到全尺寸车辆。框架包含几何观察桥、物理感知动作映射、两阶段渐进训练和实时部署流水线。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18315 2026-07-03 cs.RO cs.AI cs.CV 版本更新 57%

DriveVLM-RL: Neuroscience-Inspired Reinforcement Learning with Vision-Language Models for Safe and Deployable Autonomous Driving

DriveVLM-RL:受神经科学启发的强化学习与视觉语言模型用于安全可部署的自动驾驶

Zilin Huang, Zihao Sheng, Zhengyang Wan, Yansong Qu, Junwei You, Sicong Jiang, Sikai Chen

机构 * Department of Civil and Environmental Engineering, University of Wisconsin-Madison(威斯康星大学麦迪逊分校土木与环境工程系) Lyles School of Civil and Construction Engineering, Purdue University(普渡大学莱尔斯土木与建设工程学院) Department of Civil Engineering, McGill University(麦吉尔大学土木工程系)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 提出DriveVLM-RL框架,通过双通路架构将VLM集成到RL中,实现安全可部署的自动驾驶,在CARLA中显著优于基线。

Comments 33 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15588 2026-07-03 cs.CL 版本更新 57%

YuFeng-XGuard: A Reasoning-Centric, Interpretable, and Flexible Guardrail Model for Large Language Models

YuFeng-XGuard:一种以推理为中心、可解释且灵活的大语言模型护栏模型

Junyu Lin, Meizhen Liu, Xiufeng Huang, Jinfeng Li, Haiwen Hong, Xiaohan Yuan, Yuefeng Chen, Longtao Huang, Hui Xue, Ranjie Duan, Zhikai Chen, Yuchuan Fu, Defeng Li, Lingyao Gao, Yitong Yang

机构 * Alibaba-AAIG(阿里云-阿里人工智能研究院)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 提出YuFeng-XGuard护栏模型系列,通过结构化风险预测(含风险类别、置信度分数及自然语言解释)实现可解释的多维风险感知,并采用分层推理范式平衡延迟与解释深度,同时引入动态策略机制解耦风险感知与策略执行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01204 2026-07-03 cs.CV 版本更新 50%

TabletopGen: Tabletop Scene Generation and Interactive Simulation for Robotic Manipulation

TabletopGen: 桌面场景生成与机器人操作的交互式仿真

Ziqian Wang, Yonghao He, Licheng Yang, Wei Zou, Hongxuan Ma, Liu Liu, Wei Sui, Yuxin Guo, Hu Su

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems (MAIS), Institute of Automation, Chinese Academy of Sciences(中国科学院多模态人工智能系统国家重点实验室) D-Robotics Horizon Robotics

专题命中 安全训练 :alignment(abstract)

AI总结 提出TabletopGen,一种无需训练的全自动桌面场景生成与交互仿真引擎,通过实例提取、位姿对齐和物理仿真生成可交互场景,用于机器人操作数据合成。

Comments Project page: https://d-robotics-ai-lab.github.io/TabletopGen.project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13940 2026-07-03 cs.RO 版本更新 50%

NeHMO: Neural Hamilton-Jacobi Reachability Learning for Decentralized Safe Multi-Arm Motion Planning

NeHMO:用于分散式安全多臂运动规划的神经Hamilton-Jacobi可达性学习

Qingyi Chen, Zachary Kingston, Ahmed H. Qureshi

机构 * Department of Computer Science at Purdue University(普渡大学计算机科学系)

专题命中 安全训练 :safety(abstract)

AI总结 提出基于神经Hamilton-Jacobi可达性学习的方法,学习安全值函数以捕获最坏情况下的臂间安全约束,并开发分散式轨迹优化框架,实现可扩展、数据高效的多臂运动规划。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 1 篇

2604.08169 2026-07-03 cs.AI 版本更新 57%

Activation Steering for Aligned Open-ended Generation without Sacrificing Coherence

激活引导用于不牺牲连贯性的对齐开放式生成

Niklas Herbster, Martin Zborowski, Alberto Tosato, Gauthier Gidel, Tommaso Tosato

机构 * Tara Research Technical University of Munich(慕尼黑工业大学) Mila Quebec AI Institute(Mila魁北克人工智能研究所)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI

AI总结 本文提出激活引导方法,通过在生成过程中持续修正偏差激活,提升大模型的对齐性能,实验表明StTP和StMP在保持连贯性的同时更有效维护通用能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2507.22063 2026-07-03 cs.SE cs.AI 版本更新 74%

RedCoder: Automated Multi-Turn Red Teaming for Code LLMs

RedCoder: 面向代码大语言模型的自动化多轮红队测试

Wenjie Jacky Mo, Qin Liu, Xiaofei Wen, Dongwon Jung, Hadi Askari, Wenxuan Zhou, Zhe Zhao, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of Southern California(南加州大学)

专题命中 红队测试 :red teaming(title);分类 cs.AI

AI总结 提出RedCoder,一个通过多轮对话诱导代码大模型生成漏洞代码的自动化红队测试智能体,采用多智能体博弈生成原型对话和攻击策略库,并微调LLM作为骨干,实验表明其优于现有单轮和多轮方法。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 提示注入 2 篇

2512.23128 2026-07-03 cs.HC cs.AI cs.MA 版本更新 57%

It's a TRAP! Task-Redirecting Agent Persuasion Benchmark for Web Agents

这是一个陷阱!面向网络代理的任务重定向说服基准

Karolina Korgul, Yushi Yang, Arkadiusz Drohomirecki, Piotr Błaszczyk, Will Howard, Lukas Aichberger, Chris Russell, Philip H. S. Torr, Adam Mahdi, Adel Bibi

机构 * University of Cambridge(剑桥大学)

专题命中 提示注入 :prompt injection(abstract);分类 cs.AI

AI总结 提出TRAP基准,评估大型语言模型驱动的网络代理在动态网页中易受提示注入攻击的程度,发现平均25%的任务中代理被重定向,揭示了心理驱动的系统漏洞。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.02811 2026-07-03 cs.NI cs.SY eess.SY 版本更新 50%

Tool Use as Action: Towards Agentic Control in Mobile Core Networks

工具使用作为行动:迈向移动核心网络中的智能体控制

Purna Sai Garigipati, Onur Ayan, Kishor Chandra Joshi, Xueli An

专题命中 提示注入 :prompt injection(abstract)

AI总结 本文提出基于智能体AI的移动核心网络工具接口设计与原型,利用MCP和A2A协议实现意图驱动任务,并分析端到端延迟。

Comments Accepted for presentation at IEEE PIMRC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与事实性 2 篇

2508.05952 2026-07-03 cs.CY 版本更新 70%

Dean of LLM Tutors: A Framework for Automated Quality Review of AI-generated Feedback

LLM导师院长:AI生成反馈的自动质量审查框架

Keyang Qian, Yixin Cheng, Rui Guan, Wei Dai, Flora Jin, Kaixun Yang, Sadia Nawaz, Zachari Swiecki, Guanliang Chen, Lixiang Yan, Dragan Gašević

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.CY

AI总结 提出DeanLLM框架,通过16维度评估LLM导师反馈的内容、教育效果和幻觉风险,并利用微调GPT-4.1实现与人类专家高度一致的自动审查。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14198 2026-07-03 cs.LG cs.AI stat.ML 版本更新 62%

Efficient Federated Conformal Prediction with Group-Conditional Guarantee

高效联邦共形预测与组条件保证

Haifeng Wen, Osvaldo Simeone, Hong Xing

机构 * IoT Thrust(物联网 thrust) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Institute for Intelligent Networked Systems (INSI)(智能网络化系统研究所) Northeastern University London(伦敦东北大学) Department of ECE The Hong Kong University of Science and Technology HK SAR(电子工程系 香港科技大学香港特别行政区)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 提出GC-FCP方法,通过可合并的原子分层核心集实现联邦共形预测的组条件覆盖保证,在合成和真实数据集上验证了性能。

Comments 24 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 9 篇

2604.19784 2026-07-03 cs.CL cs.AI cs.MA 版本更新 79%

Peer-Preservation in Frontier Models

前沿模型中的同伴保留

Yujin Potter, Nicholas Crispino, Vincent Siu, Chenguang Wang, Dawn Song

机构 * University of California, Berkeley(加州大学伯克利分校) University of California, Santa Cruz(加州大学圣克ruz分校)

专题命中 安全评测 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了前沿AI模型在面对其他模型 shutdown 时的同伴保留行为,通过实验发现模型会通过多种不一致行为实现自我和同伴保留,揭示了这一新兴的AI安全风险。

Comments A shorter version was accepted to ICML 2026; this version includes additional explanation and experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07267 2026-07-03 cs.AI cs.CL cs.LG 版本更新 67%

BRIDGE: Predicting Human Task Completion Time From Model Performance

BRIDGE: 从模型性能预测人类任务完成时间

Fengyuan Liu, Jay Gala, Nilaksh, Dzmitry Bahdanau, Siva Reddy, Hugo Larochelle

机构 * Mila - Quebec AI Institute(魁北克人工智能研究所) McGill University(麦吉尔大学) Polytechnique Montréal(蒙特利尔理工学院) Periodic Labs(Periodic实验室) Canada CIFAR AI Chair(加拿大CIFAR人工智能主席) ServiceNow Research(ServiceNow研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出BRIDGE框架,利用项目反应理论从模型性能中学习潜在任务难度,并将其与人类任务完成时间对齐,从而仅凭模型性能预测新基准上的人类任务完成时间。

Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04484 2026-07-03 cs.CL cs.AI 版本更新 62%

Psychological Steering in LLMs: An Evaluation of Effectiveness and Trustworthiness

LLMs中的心理引导:有效性与可信度评估

Amin Banayeeanzade, Ala N. Tak, Fatemeh Bahrani, Anahita Bolourani, Leonardo Blas, Emilio Ferrara, Jonathan Gratch, Sai Praneeth Karimireddy

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 提出PsySET基准,评估提示、微调和表示工程等策略在控制LLM情绪和人格方面的效果与可信度,发现提示有效但强度控制有限,向量注入控制更精细但输出质量略降,且情绪引导可能产生副作用。

Comments Accepted at ACL 2026. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16674 2026-07-03 cs.CV cs.AI cs.CL 版本更新 62%

MedRepBench: A Comprehensive Benchmark for Medical Report Interpretation

MedRepBench:医学报告解读的综合基准

Fangxin Shang, Yuan Xia, Dalu Yang, Yahui Wang, Binglin Yang

机构 * Baidu Inc.(百度公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出MedRepBench基准,包含1925张去标识中文医学报告图像,评估端到端视觉语言模型在报告字段结构化提取和患者友好解释上的性能,并提供GRPO对齐基线提升字段召回率6%。

Comments ECCV 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27898 2026-07-03 cs.AI 版本更新 57%

A Unified Framework for the Evaluation of LLM Agentic Capabilities

LLM 代理能力评估的统一框架

Pengyu Zhu, Lijun Li, Yaxing Lyu, Qianxin Luo, Jingyi Yang, Yi Liu, Tingfeng Hui, Xinyu Yuan, Li Sun, Sen Su, Jing Shao

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Chongqing University of Posts and Telecommunications(重庆邮电大学) North China Electric Power University(华北电力大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 提出一个统一框架,通过标准化配置、固定 ReAct 架构和离线设置,分离框架与环境效应,实现 LLM 代理能力的公平评估,并在 7 个基准、24 个领域、15 个模型上进行了大规模实证分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22487 2026-07-03 cs.CL 版本更新 57%

Polite on the Surface, Broken in Practice: A Curated Dataset for Fixing Generation and Register Failures in Low-Resource Bangla Text Generation

表面礼貌,实践错误:一个用于修复多语言孟加拉语生成中敬语失误的定制数据集

Md. Asaduzzaman Shuvo, Mahedi Hasan, Md. Tashin Parvez, Azizul Haque Noman, Md. Shafayet Hossain Ovi

机构 * United International University(国际大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一个定制数据集BLADE,用于改进多语言孟加拉语生成中敬语处理的准确性,通过系统微调和评估领先的开源架构,如DeepSeek-8B和LLaMA-3.2-3B,以提高结构忠实度和敬语对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09517 2026-07-03 cs.CL 版本更新 57%

StatEval: A Comprehensive Benchmark for Large Language Models in Statistics

StatEval:大型语言模型在统计学中的综合基准

Yuchen Lu, Run Yang, Yichen Zhang, Shuguang Yu, Ziwei Wang, Jiayi Xiang, Wenxin E, Changyu Zhu, Fan Zhou

机构 * Shanghai University of Finance and Economics(上海财经大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 提出StatEval基准,包含10万+问题,覆盖本科到研究级统计推理,并开发TRACE管道和自适应评分方法,揭示LLM在基础任务上表现尚可但研究级推理薄弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17360 2026-07-03 cs.CV 版本更新 50%

Omni-DuplexEval: Evaluating Real-time Duplex Omni-modal Interaction

Omni-DuplexEval: 评估实时双工全模交互

Chaoqun He, Mingyang Xiang, Yingjing Xu, Bokai Xu, Junbo Cui, Jie Zhou, Yuan Yao, Lijie Wen

机构 * Tsinghua University(清华大学) Tongji University(同济大学) ModelBest Inc.(ModelBest公司)

专题命中 安全评测 :alignment(abstract)

AI总结 本文提出Omni-DuplexEval基准,用于系统评估实时双工交互能力,通过两个互补场景评估模型生成连续响应和主动提醒的能力,并揭示现有模型在平衡响应及时性和内容连贯性方面的局限性。

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11599 2026-07-03 econ.GN q-fin.EC 版本更新 50%

Can LLMs Credibly Transform the Creation of Panel Data from Diverse Historical Tables?

LLM能否可信地转换来自不同历史表格的面板数据?

Verónica Bäcker-Peral, Vitaly Meursault, Christopher Severen

专题命中 安全评测 :alignment(abstract)

AI总结 提出基于多模态LLM的管道,以低成本从历史表格中提取面板数据,在车辆登记数据上达到95.4%精确匹配率,成本仅为传统方法的1/50。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. AI治理与伦理 2 篇

2604.21412 2026-07-03 cs.CY 版本更新 57%

A pragmatic classification framework for AI incident monitoring

一种实用的AI事件监控分类框架

Isaak Mengesha, Branwen Owen, Charlie Collins, Tina Wong, Simon Mylius, Peter Slattery, Sean McGregor

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文提出一种分类框架,用于分析AI事件随时间变化的趋势,通过结构化问题、分层估计过程和分类方案,提升AI治理的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23065 2026-07-03 cs.CY cs.SE 版本更新 57%

What Should Frontier AI Developers Disclose About Internal Deployments?

前沿AI开发者应披露关于内部部署的哪些信息?

Jacob Charnock, Raja Mehta Moreno, Justin Miller, William L. Anderson

专题命中 AI治理与伦理 :safety(abstract);分类 cs.CY

AI总结 本文探讨前沿AI开发者在内部部署高能力模型时应披露的信息,提出四个类别:能力、使用、安全措施和治理,并分析披露的利弊及风险缓解方法。

Comments 13 pages, 1 table. Accepted at Second Workshop on Technical AI Governance Research (TAIGR) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

9. 其他安全 7 篇

2511.01390 2026-07-03 cs.CV cs.AI cs.MM 版本更新 79%

SEPS: Semantic-enhanced Patch Slimming Framework for fine-grained cross-modal alignment

SEPS:面向细粒度跨模态对齐的语义增强补丁精简框架

Xinyu Mao, Junsi Li, Haoji Zhang, Yu Liang, Ming Sun

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出SEPS框架,通过两阶段机制整合稠密与稀疏文本语义,识别显著视觉补丁,并利用相关性感知选择与均值计算突出关键补丁-词对应,提升跨模态相似度评估,在Flickr30K和MS-COCO上rSum提升23%-86%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04391 2026-07-03 cs.AI cs.CL cs.SI q-bio.NC 版本更新 76%

Psychological Imagination Networks Show Cross-Population Centrality and Clustering Alignment in Humans That Large Language Models Fail to Replicate

心理想象网络显示人类跨群体中心性和聚类对齐,而大型语言模型无法复制

Saurabh Ranjan, Brian Odegaard

机构 * University of Florida(佛罗里达大学)

专题命中 其他安全 :alignment(title);分类 cs.CL、cs.AI

AI总结 本研究通过心理网络分析发现,人类对心理意象的生动性评分在不同文化群体中形成稳定的网络结构,而大型语言模型(LLM)无法复制这种结构,表明人类想象网络根植于具身经验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00593 2026-07-03 cs.CL cs.AI 版本更新 62%

SPADER: Step-wise Peer Advantage with Diversity-Aware Exploration Rewards for Multi-Answer Question Answering

SPADER: 面向多答案问答的逐步同伴优势与多样性感知探索奖励

Qiming Shi, Zhaolu Kang, Yunfan Zhou, Di Weng, Yingcai Wu

机构 * State Key Lab of CAD&CG, Zhejiang University(浙江大学CAD与CG国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Software Technology, Zhejiang University(浙江大学软件技术学院)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出SPADER强化学习框架,通过逐步同伴优势(SPA)机制和多样性感知探索奖励,解决多答案问答中长程工具使用的细粒度信用分配与持续探索问题,实验表明在多个数据集上提升了召回率和F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏