arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9311 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9311 篇

2602.01086 2026-07-17 cs.AI cs.CR cs.DB cs.DC cs.SE 版本更新 79%

MedBeads: An AI-Native Clinical Context Graph Built from Immutable Beads and Reconstructable Clinical Links

MedBeads:面向可信医疗AI的智能体原生不可变数据基底

Takahito Nakajima

机构 * Diagnostic Imaging and Interventional Radiology, Institute of Medicine, University of Tsukuba(东京大学医学研究院诊断影像与介入放射学部) Center for Cyber Medicine Research, University of Tsukuba(东京大学计算机医学研究中心)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 针对医疗AI中电子病历与智能体间的上下文不匹配问题,提出基于Merkle有向无环图的不可变数据架构MedBeads,通过确定性图遍历替代概率检索,实现可审计、防篡改的临床上下文提供。

Comments 23 pages, 5 figures, 3 tables. Reference implementation and reproducible Docker demo available at https://github.com/medbeads/medbeads

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12113 2026-07-15 cs.DC cs.AI 新提交 79%

Toward Trustworthy Autonomous Science: A Two-Year Community Roadmap

迈向可信自主科学:两年社区路线图

Rafael Ferreira da Silva, Milad Abolhasani, Peter Beaucage, Laura Biven, Michael Bussmann, Kyle Chard, Ryan Coffee, Stephen DeWitt, Sagar Dolas, Carrie Eckert, David Elbert, Ian Foster, Tirthankar Ghosal, Anna Giannakou, Tom Gibbs, Leslie Hamilton, Glenn Lockwood, Theresa Mayer, Ben Mintz, Raffi Nazikian, Sal Nimer, Amanda Randles, Woong Shin, Sreenivas Rangan Sukumar, Frédéric Suter, Mitra Taheri, Michela Taufer, Draguna Vrabie

机构 * U.S. Department of Energy, Office of Science, Office of Advanced Scientific Computing Research(美国能源部科学办公室高级科学计算研究办公室)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 该研究针对自主科学领域发展现状及问题,更新路线图围绕七个维度,评估原有里程碑并新增四个,规划两年发展路径,第一年聚焦接口等搭建验证框架,第二年针对联盟等,强调基层网络的互操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11374 2026-07-14 cs.LG 新提交 79%

Surprisingly Simple and Effective Multi-Domain Graph Foundation Model through Graph-to-Table Alignment

通过图到表对齐实现惊人简单且有效的多域图基础模型

Chunyu Hu, Tianyin Liao, Ge Lan, Xingxuan Zhang, Jianxin Li, Peng Cui, Ziwei Zhang

机构 * Nankai University(南开大学) Beihang University(北京航空航天大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 研究如何让表格基础模型有效捕获图结构信息,提出GTAlign框架,先预训练图编码器捕获图表示,通过社区引导持续预训练弥合差距,应用于目标域推理,实验表明该框架在节点和图分类上显著优于基线,提供简单无文本的图基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09764 2026-07-14 cs.RO cs.AI 新提交 79%

OmniSCS: Omni Safety-Critical Scenario Synthesis for Autonomous Driving via a Fully Editable Driving World

OmniSCS:通过完全可编辑的驾驶世界实现自动驾驶的全场景安全关键场景合成

Xiaoyun Dong, Qian Xu, Yang Lu, Yang Lou, Yung-Hui Li, Jianping Wang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对自动驾驶安全关键场景合成难题,提出OmniSCS系统,通过完全可编辑驾驶世界构建和SCS合成两个模块,保持数据保真度,在多数据集实验中表现出色,能增强算法并支持实时闭环测试,为SCS优化测试提供高效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24074 2026-07-14 cs.CL 79%

How Sensitive Are Safety Benchmarks to Judge Configuration Choices?

安全基准对裁判配置选择的敏感性如何?

Xinran Zhang

机构 * University of California, Berkeley, Berkeley CA 94720, USA(加州大学伯克利分校)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 研究通过实验展示裁判提示语对安全基准评估结果的显著影响,揭示裁判配置对测量变异的决定性作用。

Comments Accepted by the 22nd International Conference on Intelligent Computing (ICIC 2026). Final version to appear in Springer CCIS

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22823 2026-07-14 cs.CV cs.AI 版本更新 79%

PivotMerge: Bridging Heterogeneous Multimodal Pre-training via Post-Alignment Model Merging

PivotMerge: 通过后对齐模型融合弥合异构多模态预训练

Zibo Shao, Baochen Xiong, Xiaoshan Yang, Yaguang Song, Qimeng Zhang, Haifeng Chen, Changsheng Xu

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,中国科学院自动化研究所) Pengcheng Laboratory(鹏城实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Data Science and Artificial Intelligence Research Institute, China United Network Communications Group Co., Ltd.(中国联合网络通信集团有限公司数据科学与人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出PivotMerge框架,通过后对齐模型融合技术,解决多模态预训练中跨模态对齐能力整合问题,提升模型统一语义空间的构建效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08038 2026-07-10 cs.AI 新提交 79%

A safety-oriented hypothetico-deductive framework for AI-assisted differential diagnosis

一种用于人工智能辅助鉴别诊断的面向安全的假设-演绎框架

Fan Ma, Mauro Giuffrè, Donald Wright, Kent McCann, Mark Iscoe, Lingfei Qian, Mingyang Jiang, Chi Wing Ng, Na Hong, Huan He, Cathy Shyr, Qingyu Chen, Lee Schwamm, Lucila Ohno-Machado, Hua Xu

机构 * Yale School of Medicine, Yale University(耶鲁大学医学院,耶鲁大学) Università degli Studi di Trieste(的里雅斯特大学) Vanderbilt University(范德堡大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究针对诊断错误威胁,提出AegisDx框架,通过协调LLM组件进行鉴别诊断、筛查危险情况、验证推理等。经多层面评估,该框架在诊断准确率及安全评分等方面表现优于独立LLM,为急性护理提供更优床边决策支持

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07758 2026-07-10 cs.LG 新提交 79%

Scalable and Trustworthy Earth Observation Foundation Models

可扩展且可信的地球观测基础模型

Syed Usama Imtiaz, Mitra Nasr Azadani, Nasrin Alamdari

机构 * Department of Civil and Environmental Engineering, Florida State University(土木与环境工程系,佛罗里达州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 研究地球观测基础模型,指出其因数据特性需特定领域适配。回顾相关设计原则,综合模型格局等内容,纳入基准证据说明评估问题,通过案例展示实践原则,提出应从多方面评估下一代遥感基础模型。

Comments (Preprint, in review) Elsevier Book Chapter: Next-Generation Remote Sensing Methods

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07762 2026-07-10 cs.LG math.OC 新提交 79%

Trustworthy Machine Learning through the Lens of Combinatorial Optimization: Survey and Research Perspectives

从组合优化视角看可信机器学习:综述与研究展望

Thibaut Vidal, Julien Ferry

机构 * CIRRELT & SCALE-AI Chair in Data-Driven Supply Chains, Department of Mathematics and Industrial Engineering, Polytechnique Montreal(CIRRELT与数据驱动供应链的SCALE-AI主席、数学与工业工程系,蒙特利尔大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 探讨如何从组合优化视角实现可信机器学习,回顾并综合其与组合优化交叉领域进展,涵盖训练及训练后多任务,指出组合优化公式比纯启发式方法更具优势,虽有挑战,但在可信机器学习系统设计和部署中作用将增大。

Comments 67 pages, 16 mathematical highlights

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07097 2026-07-09 cs.AI cs.CR cs.MA 新提交 79%

Operational Reframing and Approval-Framed Delegation in Multi-Agent LLM Safety

多智能体大语言模型安全中的操作重构与批准框架委托

Lifei Liu, Haoran Yu, Xiaochong Jiang, Su Wang, Pin Qian, Yihang Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 研究多智能体大语言模型安全评估,引入五条件控制对比设计分离有害意图、规划器与执行器行为等因素,发现汇总管道安全非稳定架构属性,操作重构是关键风险信号,还揭示各因素对安全的影响及模型排名与实际行为的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05055 2026-07-07 cs.AI 新提交 79%

Toward Trustworthy Large Language Model Agents in Healthcare

迈向医疗保健领域值得信赖的大语言模型智能体

Hadi Hasan, Safaa Salman, Adam Tai Abou Dargham, Ammar Mohanna, Ali Chehab

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI

AI总结 针对医疗预约调度瓶颈,提出CareConnect智能体,利用大语言模型函数调用等技术,协调工具支持预约操作,设安全护栏。经评估有高任务完成率、安全合规性及成本效益,能自动化复杂医疗工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01793 2026-07-07 cs.AI 新提交 79%

Safety Testing LLM Agents at Scale: From Risk Discovery to Evidence-Grounded Verification

大规模安全测试LLM智能体:从风险发现到基于证据的验证

Yunhao Feng, Ruixiao Lin, Ming Wen, Qinqin He, Yanming Guo, Yifan Ding, Yutao Wu, Jialuo Chen, Zhuoer Xu, Xiaohu Du, Jianan Ma, Zixing Chen, Xingjun Ma, Yunhao Chen, Xinhao Deng

机构 * AntGroup(蚂蚁集团) Zhejiang University(浙江大学) Fudan University(复旦大学) Alibaba Group(阿里巴巴集团) Hunan Institute of Advanced Technology(湖南先进技术研究院) Deakin University(迪肯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出Vera框架,通过文献驱动的风险发现、组合生成可执行安全用例和自适应执行与证据验证三阶段流水线,实现端到端自动化安全测试,在四个生产级智能体框架上发现严重漏洞,平均攻击成功率93.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15579 2026-07-07 cs.SE cs.AI cs.CR 版本更新 79%

Don't Make Models Guess Security and Safety: Symbolic Guardrails for Domain-Specific AI Agents

领域特定智能体的符号护栏:在不牺牲效用的情况下提供更强的安全性和安全性保证

Yining Hong, Yining She, Eunsuk Kang, Christopher S. Timperley, Christian Kästner

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了符号护栏在提高AI智能体安全性和安全性方面的有效性,通过系统回顾80个最新基准测试,发现74%的政策要求可通过符号护栏实现,从而在不牺牲效用的情况下提升安全性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20629 2026-07-07 cs.LG 版本更新 79%

QEDBENCH: Quantifying the Alignment Gap in Automated Evaluation of University-Level Mathematical Proofs

QEDBENCH:量化大学水平数学证明自动评估中的对齐差距

Santiago Gonzalez, Alireza Amiri Bavandpour, Peter Ye, Edward Zhang, Ruslans Aleksejevs, Todor Antić, Polina Baron, Sujeet Bhalerao, Shubhrajit Bhattacharya, Zachary Burton, John Byrne, Hyungjun Choi, Nujhat Ahmed Disha, Koppany István Encz, Yuchen Fang, Robert Joseph George, Ebrahim Ghorbani, Alan Goldfarb, Jing Guo, Meghal Gupta, Stefano Huber, Annika Kanckos, Minjung Kang, Hyun Jong Kim, Dino Lorenzini, Levi Lorenzo, Tianyi Mao, Giovanni Marzenta, Ariane M. Masuda, Lukas Mauth, Ana Mickovic, Andres Miniguano-Trujillo, Antoine Moulin, Wenqi Ni, Tomos Parry, Kevin Ren, Hossein Roodbarani, Mathieu Rundström, Manjil Saikia, Detchat Samart, Rebecca Steiner, Connor Stewart, Dhara Thakkar, Jeffrey Tse, Vasiliki Velona, Yunhai Xiang, Sibel Yalçın, Jun Yan, Ji Zeng, Arman Cohan, Quanquan C. Liu

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 研究大语言模型自动评估的可靠性,引入QEDBench基准,通过对比特定课程评分标准与专家常识标准,测量与人类专家的对齐情况,揭示部分前沿评估器偏差及离散领域推理差距,还发布该基准用于评估改进AI裁判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10733 2026-07-07 cs.RO cs.LG 79%

BaTCAVe: Trustworthy Explanations for Robot Behaviors

BaTCAVe:机器人行为的可信解释

Som Sagar, Aditya Taparia, Harsh Mankodiya, Pranav Bidare, Yifan Zhou, Ransalu Senanayake

机构 * School of Computing and Augmented Intelligence, Arizona State University(计算与增强智能学院,亚利桑那州立大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出基于人类可理解的高层概念的可信可解释机器人技术,通过匹配神经网络激活与可视化来提供带有不确定性评分的解释,验证了其作为事后人类友好的机器人诊断工具的有效性。

Comments 19 pages, 26 figures

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), Hangzhou, China, 2025, pp. 13867-13874

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09126 2026-07-07 cs.SE cs.LG 79%

Towards Trustworthy AI Software Development Assistance

迈向可信AI软件开发辅助

Daniel Maninger, Krishna Narasimhan, Mira Mezini

机构 * Technische Universität Darmstadt(德累斯顿技术大学) Hessian Center for Artificial Intelligence (hessian.AI)(黑森人工智能中心) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文提出可信AI软件开发助手的架构,通过基础LLM训练、图表示和模块化框架提升代码质量和安全性。

Comments 6 pages, 1 figure; to be published in New Ideas and Emerging Results (ICSE-NIER'24), April 14-20, 2024, Lisbon, Portugal; updated version to reflect the information provided by ACM

Journal ref NIER@ICSE (2024) 112-116

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00218 2026-07-02 cs.CV cs.AI 新提交 79%

EgoSafetyBench: A Diagnostic Egocentric Video Benchmark for Evaluating Embodied VLMs as Runtime Safety Guards

EgoSafetyBench:用于评估具身VLM作为运行时安全卫士的诊断性自我中心视频基准

Siddhant Panpatil, Arth Singh, Mijin Koo, Chaeyun Kim, Haon Park, Dasol Choi

机构 * AIM Intelligence(AIM智能研究所) Seoul National University(首尔国立大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出EgoSafetyBench,一个包含1200个机器人视角场景的自我中心视频基准,用于评估视觉语言模型在流式安全监控中的能力,通过情景和视觉通道两个轨道测试模型识别危险和应对误导性文本的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31589 2026-07-01 cs.SE cs.LG 新提交 79%

From Failure to Alignment: A Requirements Engineering Framework for Machine Learning Systems

从失败到对齐:机器学习系统的需求工程框架

Amel Bennaceur, Gopi Krishnan Rajbahadur, Prince Mercy, Bashar Nuseibeh, Faeq Alrimawi

机构 * The Open University, United Kingdom(英国开放大学) University of Limerick, Ireland(爱尔兰利默里克大学)

专题命中 安全评测 :alignment(title);trustworthy(abstract);分类 cs.LG

AI总结 提出REAL框架,通过需求工程方法,结合数据、模型和系统需求,利用失败驱动探索替代需求,实现迭代可追溯的MLS需求细化,以对齐利益相关者需求。

Comments 12 pages

Journal ref RE 2026 - the 34th IEEE International Requirements Engineering Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29685 2026-06-30 cs.LG 79%

CAREBench: A Child-Safety Risk Benchmark for Language Models

CAREBench:语言模型的儿童安全风险基准

Kaavya Krishna-Kumar, Elaine Lau, Vaughn Robinson, Jay Caldwell, Sheriff Issaka, Skyler Wang, Francisco Guzmán, Steven Kelling, Jonas Mueller

机构 * Handshake AI University of California, Los Angeles(加州大学洛杉矶分校) McGill University(麦吉尔大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 提出CAREBench基准,包含500个提示和12个风险类别,评估语言模型在儿童安全风险升级前的识别与应对能力,发现前沿模型失败率2%-58%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29464 2026-06-30 cs.CV cs.AI 79%

Rank-Aware Hyperbolic Alignment for Vision-Language Dataset Distillation

秩感知双曲对齐用于视觉-语言数据集蒸馏

Jongoh Jeong, Sun-Kyung Lee, Kuk-Jin Yoon

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI

AI总结 提出RAHA方法,利用双曲几何和显式对齐容量控制,通过非对称目标优化蒸馏对,在共享范围强制测地线对齐并正则化残差子空间,提升跨模态检索和迁移鲁棒性。

Comments Accepted for publication at ECCV 2026. Project Page: https://andyj1.github.io/raha

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29049 2026-06-30 cs.LG 79%

MOSAIC: Orchestrating Collaborative Knowledge Tracing with Hierarchical Semantic Alignment

MOSAIC: 通过层次语义对齐编排协作知识追踪

Xinjin Li, Mengyue Wang, Yuzhen Lin, Pengbin Feng, Ziqi Sha, Yeyang Zhou, Yu Ma

机构 * Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) School of Information Systems and Management, Carnegie Mellon University(信息系统与管理学院,卡内基梅隆大学) Department of Mathematics, University of Southern California(数学系,南加州大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Computer Science Department, UC San Diego(计算机科学系,UCSD)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出MOSAIC框架,利用冻结LLM生成动态嵌入和层次预测提示,结合跨粒度一致性目标,在协作知识追踪中实现多粒度掌握估计,在多个数据集上取得SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26185 2026-06-26 cs.LG 新提交 79%

Necessary but Not Sufficient: Temperature Control and Reproducibility in LLM-as-Judge Safety Evaluations

必要但不充分:LLM作为评判者的安全评估中的温度控制与可重复性

Hiroki Tamba

机构 * Tamba Research Academy(Tamba研究学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 研究LLM评判者在安全评估中温度设置对结果可重复性的影响,发现温度未设置或设为0仍无法完全消除判决翻转,建议将评判者分歧作为首要健康指标。

Comments 7 pages, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05738 2026-06-25 cs.CL 版本更新 79%

MedLayBench-V: A Large-Scale Benchmark for Expert-Lay Semantic Alignment in Medical Vision Language Models

MedLayBench-V:面向医学视觉语言模型中专家与普通人语义对齐的大规模基准

Han Jang, Junhyeok Lee, Heeseong Eum, Kyu Sung Choi

机构 * Seoul National University(首尔国立大学) Seoul National University College of Medicine(首尔国立大学医学院) Department of Radiology, Seoul National University Hospital(首尔国立大学医院放射科) Healthcare AI Research Institute, Seoul National University Hospital(首尔国立大学医院健康人工智能研究所) The Advanced Imaging and Computational Neuroimaging (AICON) Laboratory(先进影像与计算神经影像实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出首个大规模多模态基准MedLayBench-V,通过结构化概念基础精炼管道实现专家-普通人语义对齐,用于训练和评估能弥合医患沟通鸿沟的医学视觉语言模型。

Comments Findings of ACL 2026. 9 pages, 5 figures, 11 tables, plus appendix

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pages 18375-18394

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22375 2026-06-23 cs.AI cs.CE cs.IR 新提交 79%

ARIA: A Causal-Aware Framework for Rescuing LLM Reasoning in Trustworthy Materials Discovery

ARIA: 一种用于在可信材料发现中拯救LLM推理的因果感知框架

Yi Cao, Liaoyaqi Wang, Jieneng Chen, Benjamin Van Durme, Alan Yuille, Paulette Clancy

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 提出ARIA框架,通过因果感知的三级级联(直接因果推理、物理类比迁移、参数回退)解决LLM在材料发现中的上下文隧道问题,提升物理可信性。

Comments Accepted to the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining (KDD 2026)

Journal ref Proceedings of the 32nd ACM SIGKDD Conference on Knowledge Discovery and Data Mining V.2 (KDD '26), August 09--13, 2026, Jeju Island, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21939 2026-06-23 cs.CL 新提交 79%

Beyond Value Benchmarks: Measuring Value-Structure Alignment in Large Language Models via Symmetric Q-Sorts

超越价值基准:通过对称Q分类测量大型语言模型中的价值结构对齐

Jingting Zheng, Yuqi Ren, Linhao Yu, Yongqi Leng, Deyi Xiong

机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 提出基于Q方法的对称人机评估框架,通过140项道德陈述的强制分布排序,测量LLM价值结构对齐,发现跨家族异质性和局部错位。

Comments 32 pages, 8 figures, 16 tables; accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21415 2026-06-23 cs.LG 新提交 79%

One Size does not Fit All: Heterogeneous Latent Space Alignment for Unsupervised Domain Adaptation

一种尺寸并不适合所有情况:无监督域适应的异构潜在空间对齐

Evangelia Koskinioti, Yi Shen, Georgios Stamou, Michael M. Zavlanos

机构 * Duke University(杜克大学) National Technical University of Athens(雅典国家技术大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出ADualVUOT框架,结合双编码器VAE与连续归一化流增强潜在表达,利用非平衡最优传输(GGW距离)对齐域,并引入对抗增强提升鲁棒性,在医学图像分割中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20686 2026-06-23 cs.RO cs.AI 新提交 79%

JPPD: Joint Prediction_Planning Diffusion with Differentiable Safety Guidance for Dynamic Obstacle Avoidance in Intelligent Transportation Systems

JPPD:具有可微安全引导的联合预测-规划扩散框架用于智能交通系统中的动态障碍物规避

Jiahao Wu, Shengwen Yu

机构 * The University of Hong Kong(香港大学) Guangzhou College of Commerce(广州商学院)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 提出联合预测-规划扩散框架,将参与者预测与机器人规划视为条件轨迹生成问题,通过可微安全势引导和条件流匹配提升共享空间中的安全性与效率。

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.03579 2026-06-23 cs.RO cs.LG 版本更新 79%

Intent-Handover: Grounding Language in Human-Usage Regions for Trustworthy Robot-to-Human Handovers

Intent-Handover:在人类使用区域中接地语言以实现可信的机器人到人交接

Hanxin Zhang, Abdulqader Dhafer, Hongbiao Dong, Zhou Daniel Hao

机构 * DANiLab, University of Leicester(莱斯特大学DANiLab) University of Leicester(莱斯特大学) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院) School of Metallurgy and Materials, University of Birmingham(伯明翰大学冶金与材料学院)

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.LG

AI总结 提出Intent-Handover方法,通过视觉语言模型识别目标物体和人类使用区域,结合抓取优化和人体姿态跟踪,实现安全、可信的机器人到人物体交接。

Comments Accepted at the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16357 2026-06-19 cs.CY cs.SE 版本更新 79%

Beyond Grading Accuracy: Exploring Alignment of TAs and LLMs

超越评分准确性:探索助教与LLMs的一致性

Matthijs Jansen op de Haar, Nacir Bouali, Faizan Ahmed

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本文提出一个评估管道,通过定量研究92个UML类图,比较助教与六个开源LLMs在单个评分标准上的表现,发现开源LLMs在评分准确性上接近助教,为混合主动评分系统提供了可能。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17846 2026-06-18 cs.RO cs.CV cs.LG 新提交 79%

Qwen-RobotManip Technical Report: Alignment Unlocks Scale for Robotic Manipulation Foundation Models

Qwen-RobotManip 技术报告:对齐解锁机器人操作基础模型的规模

Haoqi Yuan, Zhixuan Liang, Anzhe Chen, Ye Wang, Haoyang Li, Pei Lin, Yiyang Huang, Zixing Lei, Tong Zhang, Jiazhao Zhang, Jie Zhang, Jingyang Fan, Gengze Zhou, Qihang Peng, Chenxu Lv, Xiaoyue Chen, An Yang, Fei Huang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(Qwen团队)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 提出 Qwen-RobotManip,通过统一的对齐框架(表示、运动和行为维度)实现多源异构操作数据的大规模协同训练,构建约38,100小时预训练语料,在零样本指令跟随、跨本体迁移等泛化能力上超越先前模型。

Comments 44 pages

详情

展开后加载摘要…

URL PDF HTML 收藏