arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-10 至 2026-03-10 共收录 20 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 20 篇

2603.06722 2026-03-10 cs.LG cs.AI 81%

ProtAlign: Contrastive learning paradigm for Sequence and structure alignment

ProtAlign: 用于序列和结构对齐的对比学习范式

Aditya Ranganath, Hasin Us Sami, Kowshik Thopalli, Bhavya Kailkhura, Wesam Sakla

机构 * Center for Applied Scientific Computing, Lawrence Livermore National Laboratory(应用科学计算中心,劳伦斯利弗莫尔国家实验室)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 ProtAlign通过对比学习范式,统一了蛋白质序列与结构的表示,提升跨模态检索和下游预测性能。

Comments 5 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17788 2026-03-10 cs.CV cs.AI 79%

From 2D Alignment to 3D Plausibility: Unifying Heterogeneous 2D Priors and Penetration-Free Diffusion for Occlusion-Robust Two-Hand Reconstruction

从二维对齐到三维合理性:统一异构二维先验和无穿透扩散以实现抗遮挡的双手重建

Gaoge Han, Yongkang Cheng, Zhe Chen, Shaoli Huang, Tongliang Liu

机构 * AgiBot Mohamed bin Zayed University of Artificial Intelligence The University of Sydney La Trobe University

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出统一异构二维先验和无穿透扩散模型,以实现抗遮挡的双手重建,提升交互对齐和穿透抑制性能。

Comments Accepted by CVPR 2026 Main, Project: https://gaogehan.github.io/A2P/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07329 2026-03-10 cs.AI cs.CL cs.CY 67%

The Third Ambition: Artificial Intelligence and the Science of Human Behavior

第三项雄心:人工智能与人类行为的科学

W. Russell Neuman, Chad Coleman

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出利用大型语言模型作为研究人类行为、文化及道德推理的科学工具,探讨其在社会科学中的应用与方法论创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08425 2026-03-10 cs.AI cs.HC cs.LG cs.MA cs.SY eess.SY 62%

IronEngine: Towards General AI Assistant

IronEngine:迈向通用AI助手

Xi Mo

机构 * NiusRobotLab(尼乌斯机器人实验室)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IronEngine通过统一编排核心实现通用AI助手,具备多阶段流程、智能工具路由和高效执行能力,适用于个人助手和自动化框架。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10110 2026-03-10 cs.RO cs.AI cs.LG 62%

IMPACT: Intelligent Motion Planning with Acceptable Contact Trajectories via Vision-Language Models

IMPACT: 通过视觉-语言模型实现可接受接触轨迹的智能运动规划

Yiyang Ling, Karan Owalekar, Oluwatobiloba Adesanya, Erdem Bıyık, Daniel Seita

机构 * Thomas Lord Department of Computer Science, Viterbi School of Engineering, University of Southern California(托马斯·劳德计算机科学系,维特里比工程学院,南加州大学)

专题命中 其他安全 :safety(abstract);分类 cs.AI、cs.LG

AI总结 IMPACT通过视觉-语言模型实现高效的接触丰富运动规划,在杂乱环境中优于其他方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08544 2026-03-10 cs.RO cs.LG 57%

The Neural Compass: Probabilistic Relative Feature Fields for Robotic Search

神经罗盘:基于概率相对特征场的机器人搜索

Gabriele Somaschini, Adrian Röfer, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出ProReFF模型,通过概率相对特征场实现机器人搜索任务中的高效物体定位,实验表明其在模拟环境中比基线方法更高效,接近人类水平性能。

Comments 9 pages, 7 figures, 2 tables, submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08436 2026-03-10 cs.CV cs.CL 57%

Can Vision-Language Models Solve the Shell Game?

视觉-语言模型能解决贝壳游戏吗?

Tiedong Liu, Wee Sun Lee

专题命中 其他安全 :alignment(abstract);分类 cs.CL

AI总结 本文提出SGCoT方法,通过生成对象轨迹解决VLMs在视觉跟踪中的根本限制,实现超过90%的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05437 2026-03-10 cs.CV cs.AI 57%

SAIL: Similarity-Aware Guidance and Inter-Caption Augmentation-based Learning for Weakly-Supervised Dense Video Captioning

SAIL:基于相似性感知引导和跨字幕增强学习的弱监督密集视频字幕生成

Ye-Chan Kim, SeungJu Cha, Si-Woo Kim, Minju Jeon, Hyungee Kim, Dong-Jin Kim

机构 * Hanyang University(翰阳大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SAIL通过跨模态对齐和大语言模型增强策略,提升弱监督密集视频字幕生成的准确性和语义感知能力。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08165 2026-03-10 cs.SE cs.AI 57%

An explainable hybrid deep learning-enabled intelligent fault detection and diagnosis approach for automotive software systems validation

一种可解释的混合深度学习智能故障检测与诊断方法用于汽车软件系统验证

Mohammad Abboush, Ehab Ghannoum, Andreas Rausch

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的混合深度学习方法,用于汽车软件系统验证中的故障检测与诊断,通过可解释AI技术提升模型适应性和根本原因分析能力。

Comments 20 pages

Journal ref Knowledge-Based Systems Volume 334, 15 February 2026, 114922

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07335 2026-03-10 cs.AI 57%

VisualScratchpad: Inference-time Visual Concepts Analysis in Vision Language Models

VisualScratchpad: 视觉语言模型推理时的视觉概念分析

Hyesu Lim, Jinho Choi, Taekyung Kim, Byeongho Heo, Jaegul Choo, Dongyoon Han

机构 * KAIST AI(韩国科学技术院人工智能研究所) NAVER AI Lab(NAVER人工智能实验室)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 VisualScratchpad通过交互式界面分析视觉语言模型推理过程中的视觉概念,揭示三种未被充分探索的失败模式,帮助理解模型内部机制并改进调试。

Comments Accetped at ICLR 2026 Turstworthy AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07241 2026-03-10 cs.LG cs.IR 57%

Rethinking Deep Research from the Perspective of Web Content Distribution Matching

从网页内容分布匹配视角重新思考深度研究

Zixuan Yu, Zhenheng Tang, Tongliang Liu, Chengqi Zhang, Xiaowen Chu, Bo Han

机构 * School of Computer science and engineering, Sun Yat-sen University(计算机科学与工程学院,中山大学) CSE, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Data Science and Artificial Intelligence, The Hong Kong Polytechnic University(数据科学与人工智能系,香港理工大学) DSA Thrust, The Hong Kong University of Science and Technology (GuangZhou)(数据科学与技术 thrust,香港科学与技术大学(广州)) TMLR Group, Department of Computer Science, Hong Kong Baptist University(TMLR 组,计算机科学系,香港 Baptist 大学)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 WeDas通过引入网页内容分布感知机制,改进深度搜索代理的查询-结果对齐能力,提升子目标完成和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.16987 2026-03-10 cs.LG 57%

From Model Explanation to Data Misinterpretation: A Cautionary Analysis of Post Hoc Explainers in Business Research

从模型解释到数据误读:对事后解释器在商业研究中使用的警示分析

Tong Wang, Ronilo Ragodos, Lu Feng, Yu, Hu

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文警示事后解释器在商业研究中用于假设检验的不足,指出其作为探索性工具生成而非验证实质性见解的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08611 2026-03-10 cs.CV cs.RO 50%

FOMO-3D: Using Vision Foundation Models for Long-Tailed 3D Object Detection

FOMO-3D:利用视觉基础模型进行长尾3D目标检测

Anqi Joyce Yang, James Tu, Nikita Dvornik, Enxu Li, Raquel Urtasun

机构 * Waabi University of Toronto(多伦多大学)

专题命中 其他安全 :safety(abstract)

AI总结 FOMO-3D通过利用视觉基础模型的丰富先验知识和多模态融合设计,提升长尾3D目标检测的性能。

Comments Published at 9th Annual Conference on Robot Learning (CoRL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08520 2026-03-10 cs.CR cs.SE 50%

SCAFFOLD-CEGIS: Preventing Latent Security Degradation in LLM-Driven Iterative Code Refinement

SCAFFOLD-CEGIS: 防止由LLM驱动的迭代代码精炼中的潜在安全退化

Yi Chen, Yun Bian, Haiquan Wang, Shihao Li, Zhe Cui

专题命中 其他安全 :safety(abstract)

AI总结 SCAFFOLD-CEGIS通过多智能体协作架构,将安全约束显式化,有效降低LLM驱动迭代代码精炼中的潜在安全退化率至2.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15205 2026-03-10 cs.CV 50%

Leveraging Hallucinations to Reduce Manual Prompt Dependency in Promptable Segmentation

利用幻觉减少可提示分割中的手动提示依赖

Jian Hu, Jiayi Lin, Junchi Yan, Shaogang Gong

机构 * Queen Mary University of London(伦敦大学玛丽女王学院) Shanghai Jiao Tong University(上海交通大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出ProMaC框架,通过利用MLLM幻觉挖掘任务相关信息,提升分割精度与遮罩生成效果。

Comments NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07952 2026-03-10 cs.CV 50%

VisualAD: Language-Free Zero-Shot Anomaly Detection via Vision Transformer

VisualAD: 通过视觉变换器实现无语言零样本异常检测

Yanning Hou, Peiyuan Li, Zirui Liu, Yitong Wang, Yanran Ruan, Jianfeng Qiu, Ke Xu

机构 * State Key Laboratory of Opto-Electronic Information Acquisition and Protection Technology, Anhui University, Hefei, China(光电信息采集与防护技术国家重点实验室,安徽大学,合肥,中国) School of Artificial Intelligence, Anhui University, Hefei, China(人工智能学院,安徽大学,合肥,中国) College of Intelligence Science and Technology, National University of Defense Technology, Changsha, China(智能科学与技术学院,国防科技大学,长沙,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 VisualAD通过纯视觉变换器实现无语言零样本异常检测,引入可学习标记和空间感知模块,提升异常检测性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07562 2026-03-10 cs.CV 50%

Brain-WM: Brain Glioblastoma World Model

Brain-WM: 脑部胶质瘤世界模型

Chenhui Wang, Boyun Zheng, Liuxin Bao, Zhihao Peng, Peter Y. M. Woo, Hongming Shan, Yixuan Yuan

专题命中 其他安全 :alignment(abstract)

AI总结 Brain-WM通过统一治疗预测与MRI生成,实现了肿瘤与治疗的共进化动态建模,提升了治疗计划的准确率和MRI生成的质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11108 2026-03-10 eess.IV cs.CV 50%

UltraUPConvNet: A UPerNet- and ConvNeXt-Based Multi-Task Network for Ultrasound Tissue Segmentation and Disease Prediction

UltraUPConvNet:一种基于UPerNet和ConvNeXt的多任务网络,用于超声组织分割和疾病预测

Zhi Chen, Le Zhang

机构 * School of Engineering, College of Engineering and Physical Sciences, University of Birmingham, Birmingham, UK(工程学院,工程与物理科学学院,伯明翰大学,伯明翰,英国)

专题命中 其他安全 :safety(abstract)

AI总结 UltraUPConvNet是一种结合UPerNet和ConvNeXt的多任务网络,用于超声组织分割和疾病预测,通过高效计算实现高精度性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06986 2026-03-10 cs.HC cs.CV 50%

ADAS-TO: A Large-Scale Multimodal Naturalistic Dataset and Empirical Characterization of Human Takeovers during ADAS Engagement

ADAS-TO:大规模多模态自然数据集及ADAS参与期间人类接管的实证分析

Yuhang Wang, Yiyao Xu, Jingran Sun, Hao Zhou

机构 * Department of Civil and Environmental Engineering, University of South Florida(土木与环境工程系,佛罗里达州立大学)

专题命中 其他安全 :safety(abstract)

AI总结 ADAS-TO数据集通过多模态分析揭示了ADAS参与期间人类接管的运动特征及视觉预警潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06842 2026-03-10 cs.RO 50%

RoboCritics: Enabling Reliable End-to-End LLM Robot Programming through Expert-Informed Critics

RoboCritics: 通过专家指导的批评者实现可靠的端到端LLM机器人编程

Callie Y. Kim, Nathan Thomas White, Evan He, Frederic Sala, Bilge Mutlu

机构 * Department of Computer Sciences University of Wisconsin--Madison(计算机科学系威斯康星大学麦迪逊分校)

专题命中 其他安全 :safety(abstract)

AI总结 RoboCritics通过专家指导的批评者提升LLM在机器人编程中的可靠性与用户参与度。

Comments 10 pages, 5 figures, Proceedings of the 21st ACM/IEEE International Conference on Human Robot Interaction (HRI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏