arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-31 至 2026-03-31 共收录 109 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 31 篇

2603.26804 2026-03-31 cs.CV cs.AI 57%

The Language of Touch: Translating Vibrations into Text with Dual-Branch Learning

触觉的语言:通过双分支学习将振动转化为文本

Jin Chen, Yifeng Lin, Chao Zeng, Si Wu, Tiesong Zhao

机构 * Fujian Key Lab for Intelligent Processing and Wireless Transmission of Media Information, Fuzhou University(福州大学福建省媒体信息智能处理与无线传输重点实验室) Fujian Science and Technology Innovation Laboratory for Optoelectronic Information of China(福建省光电信息科学与技术创新实验室) School of Artificial Intelligence, Hubei University(湖北大学人工智能学院) Key Laboratory of Intelligent Sensing System and Security, Hubei University and Ministry of Education(湖北大学及教育部智能感知系统与安全重点实验室) School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 本文首次尝试解决触觉描述生成问题,提出ViPAC方法,通过双分支策略和动态融合机制处理触觉数据的周期性和非周期性特性,构建首个触觉-文本配对数据集LMT108-CAP,实验表明其在词汇准确性和语义对齐方面优于基线方法。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28686 2026-03-31 cs.SE 50%

C2RustXW: Program-Structure-Aware C-to-Rust Translation via Program Analysis and LLM

C2RustXW: 通过程序分析和LLM实现的程序结构感知的C到Rust翻译

Yanyan Yan, Yang Feng, Jiangshan Liu, Di Liu, Zixi Liu, Hao Teng, Baowen Xu

专题命中 其他安全 :safety(abstract)

AI总结 本文提出C2RustXW工具,通过程序分析与LLM结合,实现结构感知的C到Rust翻译,提高代码正确性和可维护性,实验显示在CodeNet和GitHub上达到高语法正确率和代码压缩效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10997 2026-03-31 cond-mat.mtrl-sci 50%

Data-driven Prediction of Ionic Conductivity in Solid-State Electrolytes with Machine Learning and Large Language Models

基于机器学习和大语言模型的固态电解质离子导电性数据驱动预测

Haewon Kim, Taekgi Lee, Seongeun Hong, Kyeong-Ho Kim, Yongchul G. Chung

专题命中 其他安全 :safety(abstract)

AI总结 本文提出利用机器学习和大语言模型预测固态电解质离子导电性,通过结合几何描述符和结构标签数据,提升预测精度并实现可解释的结构-性质分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28366 2026-03-31 cs.CV 50%

AutoCut: End-to-end advertisement video editing based on multimodal discretization and controllable generation

AutoCut:基于多模态离散化和可控生成的端到端广告视频编辑

Milton Zhou, Sizhong Qin, Yongzhi Li, Quan Chen, Peng Jiang

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出AutoCut框架,通过多模态离散化和可控生成实现广告视频编辑,提升一致性和可控性,降低生产成本和迭代时间。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27993 2026-03-31 cs.CV 50%

Progressive Prompt-Guided Cross-Modal Reasoning for Referring Image Segmentation

逐步引导的跨模态推理用于指代图像分割

Jiachen Li, Hongyun Wang, Jinyu Xu, Wenbo Jiang, Yanchun Ma, Yongjian Liu, Qing Xie, Bolong Zheng

机构 * School of Computer Science and Artificial Intelligence, Wuhan University of Technology(武汉理工大学计算机科学与人工智能学院) School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) University of Electronic Science and Technology of China(电子科技大学) Wuhan Vocational College of Software and Engineering(武汉软件工程职业学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出PPCR框架,通过语义理解-空间定位-实例分割流程,改进指代图像分割中语言描述与视觉表示的连接,提升分割精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03619 2026-03-31 cs.CV 50%

LAMP: Language-Assisted Motion Planning for Controllable Video Generation

LAMP:语言辅助运动规划用于可控视频生成

Muhammed Burak Kizil, Enes Sanli, Niloy J. Mitra, Erkut Erdem, Aykut Erdem, Duygu Ceylan

机构 * Koç University(科奇大学) University College London(伦敦大学学院) Hacettepe University(哈斯特帕大学) Adobe Research(Adobe研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 LAMP通过大语言模型生成3D轨迹,实现基于自然语言的视频生成,提升运动可控性和用户意图对齐。

Comments CVPR 2026. Project Page: https://cyberiada.github.io/LAMP/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17209 2026-03-31 cs.CV 50%

Scaling Self-Supervised and Cross-Modal Pretraining for Volumetric CT Transformers

基于体素CT的自监督与跨模态预训练的扩展

Cris Claessens, Christiaan Viviers, Giacomo D'Amicantonio, Egor Bondarev, Fons van der Sommen

机构 * Eindhoven University of Technology(埃因霍温理工大学) ARIA Lab(ARIA实验室) AIMS Lab(AIMS实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 SPECTRE通过可扩展的3D视觉Transformer架构和现代自监督与视觉-语言预训练策略,学习通用CT表示,克服了体素CT的极端标记扩展、几何各向异性及临床监督弱的问题,实现了大规模3D注意力计算。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 50%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27690 2026-03-31 cs.CV 50%

Customized Visual Storytelling with Unified Multimodal LLMs

基于统一多模态大语言模型的定制化视觉叙事

Wei-Hua Li, Cheng Sun, Chu-Song Chen

机构 * National Taiwan University(国立台湾大学) NVIDIA(英伟达)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出VstoryGen框架,整合文本描述与角色背景参考,实现定制化故事生成。通过参数高效提示微调电影数据,增强电影多样性。建立两个新基准测试,评估多模态叙事的连贯性、文本-视觉对齐和镜头类型控制。

Comments Paper accepted to the CVPR 2026 Workshop on Generative AI for Storytelling (CVPRW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 50%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 其他安全 :alignment(abstract)

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27014 2026-03-31 cs.CV 50%

GUIDED: Granular Understanding via Identification, Detection, and Discrimination for Fine-Grained Open-Vocabulary Object Detection

GUIDED: 通过识别、检测和辨别实现细粒度理解的细粒度开放词汇物体检测

Jiaming Li, Zhijia Liang, Weikai Chen, Lin Ma, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Meituan(美团) GuangDong Province Key Laboratory of Information Security Technology(广东省信息安全技术重点实验室) Research Institute, Sun Yat-sen University(中山大学深圳研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 GUIDED通过分解框架解决细粒度提示中主体与属性的语义纠缠问题,通过分离定位与识别任务提升细粒度开放词汇物体检测性能。

Comments NIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08021 2026-03-31 cs.RO cs.CV 50%

AffordGrasp: Cross-Modal Diffusion for Affordance-Aware Grasp Synthesis

AffordGrasp:跨模态扩散用于感知意识抓取合成

Xiaofei Wu, Yi Zhang, Yumeng Liu, Yuexin Ma, Yujiao Shi, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出AffordGrasp,通过跨模态扩散模型生成准确反映物体几何和用户指令的抓取姿态,提升AR/VR和具身AI中的手-物交互质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05097 2026-03-31 cs.RO 50%

AIM-SLAM: Dense Monocular SLAM via Adaptive and Informative Multi-View Keyframe Prioritization with Foundation Model

AIM-SLAM:基于自适应和信息丰富的多视图关键帧优先级的密集单目SLAM

Jinwoo Jeon, Dong-Uk Seo, Eungchang Mason Lee, Hyun Myung

机构 * KAIST (Korea Advanced Institute of Science and Technology)(韩国科学技术院(KAIST)) KAIST InnoCORE LLM, KAIST(韩国科学技术院 InnoCORE LLM)

专题命中 其他安全 :alignment(abstract)

AI总结 AIM-SLAM通过自适应多视图关键帧优先级提升单目SLAM的密集重建性能,结合视觉几何基础模型实现更准确的位姿估计和一致的多视图对齐。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22674 2026-03-31 cs.CV 50%

VisionTrim: Unified Vision Token Compression for Training-Free MLLM Acceleration

VisionTrim: 一种用于无训练多模态大语言模型加速的统一视觉标记压缩方法

Hanxun Yu, Wentong Li, Xuan Qu, Song Wang, Junbo Chen, Jianke Zhu

机构 * State Key Lab of CAD & CG, Zhejiang University(浙江大学CAD&CG国家重点实验室) NUAA(南京航空航天大学) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出VisionTrim,通过整合DVTS和TGVC模块,有效减少视觉标记,提升多模态大语言模型在高分辨率和视频场景中的计算效率。

Comments ICLR2026, Code Link: https://github.com/hanxunyu/VisionTrim

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22950 2026-03-31 cs.CV cs.RO 50%

RobotSeg: A Model and Dataset for Segmenting Robots in Image and Video

RobotSeg: 一种用于图像和视频中分割机器人的模型和数据集

Haiyang Mei, Qiming Huang, Hai Ci, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学Show Lab)

专题命中 其他安全 :safety(abstract)

AI总结 本文提出RobotSeg模型和数据集,解决机器人分割的挑战,通过结构增强的记忆关联器、机器人提示生成器和标签高效训练策略,实现结构感知、自动化的高效分割。

Comments CVPR 2026. Project page: https://github.com/showlab/RobotSeg

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21798 2026-03-31 eess.SP 50%

Adaptive Multipath-Based SLAM for Distributed MIMO Systems

自适应多径基于的分布式MIMO系统SLAM

Xuhong Li, Benjamin J. B. Deutschmann, Erik Leitinger, Florian Meyer

专题命中 其他安全 :safety(abstract)

AI总结 本文提出一种基于贝叶斯的多径SLAM方法,用于分布式MIMO系统,解决现有方法在非凸几何环境中融合多径信息的限制,通过自适应检测概率和软射线追踪策略提升定位和建图性能。

Comments 32 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18500 2026-03-31 cs.HC 50%

Personalization in Serious Games and Gamification for Healthcare: A Three-Tiered Review of Models, Methods and Opportunities

严肃游戏与健康医疗领域的个性化:模型、方法与机遇的三级综述

Stéphanie Carlier, Femke De Backere, Filip De Turck

专题命中 其他安全 :safety(abstract)

AI总结 本文综述了严肃游戏与健康医疗领域个性化方法的模型、方法及机遇,提出三级分类框架以指导更模块化、可比性和临床一致性的个性化SGG发展。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26909 2026-03-31 cs.HC 50%

Unseen City Canvases: Exploring Blind and Low Vision People's Perspectives on Urban and Public Art Accessibility

未见城市画卷:探索视障和低视力人士对城市及公共艺术可及性的视角

Lucy Jiang, Amy Seunghyun Lee, Jon E. Froehlich, Leah Findlater

专题命中 其他安全 :safety(abstract)

AI总结 研究探讨视障人士对城市公共艺术的可及性需求,通过访谈发现他们偏好自发探索、多感官互动及详细描述,提出七维设计框架和HCI研究扩展方向。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26822 2026-03-31 physics.soc-ph math.DS q-bio.PE 50%

Modularity, asymmetry, and polarization shape consensus speed in the voter model

模ularity、asymmetry和polarization如何影响voter模型中的共识速度

Madi Yerlanov, Zachary Kilpatrick, Nancy Rodriguez

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨了模ularity、asymmetry和polarization如何影响voter模型中共识形成速度,通过分析双群体结构下的意见扩散过程,揭示了共识形成中的快慢阶段及影响因素。

Comments 23 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏