arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 2719 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 580 篇

2606.18703 2026-06-18 cs.LG q-bio.QM 新提交 79%

Contextualizing Biological Language Models across Modalities via Logit-Space Contrastive Alignment

跨模态生物学语言模型的逻辑空间对比对齐

Yanjun Shao, Yundi Chen, Yashvi Patel, Aurelien Pelissier, María Rodríguez Martínez

机构 * Biomedical Informatics and Data Science, Yale School of Medicine(耶鲁医学院生物医学信息学与数据科学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出LOGICA框架,在输出逻辑空间进行对比学习,通过门控跨模态适配器保留预训练似然接口,实现跨不同词汇表模型的上下文条件预测,在蛋白质-配体结合、TCR-肽活性和药物耐药性预测任务上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15250 2026-06-16 cs.CV cs.AI 新提交 79%

Landmark-free Assessment of Lower-limb Alignment with Implicit Neural Shape Functions from Knee Radiographs

基于膝关节X光片的隐式神经形状函数的无地标下肢对齐评估

Zhisen Hu, Antti Kemppainen, David Johnson, Egor Panfilov, Huy Hoang Nguyen, Timothy Cootes, Claudia Lindner, Aleksei Tiulpin

机构 * Division of Informatics, Imaging and Data Sciences, The University of Manchester(曼彻斯特大学信息学、影像与数据科学部) Research Unit of Health Sciences and Technology, University of Oulu(奥卢大学健康科学与技术研究部) Medical Research Center Oulu, University of Oulu and Oulu University Hospital(奥卢大学与奥卢大学医院医学研究中心) Department of Trauma and Orthopaedics, Stockport NHS Foundation Trust, Stepping Hill Hospital(斯泰平希尔医院斯托克波特NHS基金会创伤与骨科) School of Health and Society, University of Salford(索尔福德大学健康与社会学院) School of Biological Sciences, The University of Manchester(曼彻斯特大学生物科学学院) Weill Cornell Medicine, Cornell University(康奈尔大学威尔康奈尔医学院)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 提出隐式神经形状函数(INSF)方法,无需显式地标,通过编码解剖形状到潜在空间并直接回归临床对齐测量,实现自动化下肢对齐评估,性能与现有方法相当且易于扩展。

Comments Accepted to MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15038 2026-06-16 cs.AI 新提交 79%

Fusion is not one-size-fits-all: Cross-Modal Representation Alignment for Time-to-Event Modeling

融合并非一刀切:用于时间-事件建模的跨模态表示对齐

Zhemin Zhang, Weijie Chen, David Le, Amara Tariq, Alex Wallace, Matthew Stib, Juan Maria Farina, Chadi Ayoub, Reza Arsanjani, Imon Banerjee

机构 * Arizona State University(亚利桑那州立大学) Mayo Clinic(梅奥诊所)

专题命中 其他安全 :alignment(title,abstract);分类 cs.AI

AI总结 针对多模态临床数据中的模态不平衡和分布偏移问题,提出一种基于基础模型的跨模态对齐框架,通过四种融合策略在CT影像和纵向EHR数据间进行表示对齐,在肺栓塞死亡率和心血管疾病结局预测任务上验证了融合的有效性,并首次系统分析了时间-事件预测中的模态不平衡对融合行为的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12940 2026-06-12 cs.SD cs.LG 新提交 79%

Self-Guidance: Enhancing Neural Codecs via Decoder Manifold Alignment

自引导:通过解码器流形对齐增强神经编解码器

Xiang Li, Yixuan Zhou, Jingran Xie, Zhiyong Wu, Hui Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出自引导方法,通过轻量特征映射损失对齐解码器内部流形,在不改变推理过程下提升VQ-VAE神经语音编解码器重建质量,实现低比特率SOTA性能并支持4倍码本缩减。

Comments 20 pages, 9 figures, accepted to ICML 2026, demo website available at https://sgvqvae.github.io/sgvqvae-demo

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12633 2026-06-12 cs.CV cs.LG 新提交 79%

ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation

ECA:面向开放图像到文本生成的高效持续对齐

Jiangtao Kong, Peijun Zhao, Chun-Fu Chen, Youngwook Do, Shaohan Hu, Tianyi Zhou, Huajie Shao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出ECA方法,通过混合查询模块、Fisher动态扩展和字典重放,实现无需旧数据的持续对齐,缓解灾难性遗忘,提升开放图像到文本生成的增量学习性能。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12199 2026-06-11 eess.AS cs.CL cs.SD 新提交 79%

Which Speech Representation Better Matches Text-Native Reasoning? A Study of Speech-Text Alignment on Frame Rate and Representation

哪种语音表示更匹配文本原生推理?帧率和表示对语音-文本对齐的研究

Zhen Ye, Xu Tan, Yiming Li, Guangyan Zhang, Chimin Chan, Haohe Liu, Zhengxi Liu, Hongzhan Lin, Zheqi Dai, Xinshen Zhang, Peiwen Sun, Qiuqiang Kong, Wei Xue

机构 * Hong Kong University of Science and Technology, Hong Kong SAR(香港理工大学) Tencent, China(腾讯) University of Surrey, United Kingdom(Surrey大学) Chinese University of Hong Kong, Hong Kong SAR(香港中文大学) Hong Kong Baptist University, Hong Kong SAR(香港 Baptist大学) Hong Kong Polytechnic University, Hong Kong SAR(香港理工大学) Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 研究语音与文本模态差异中的时间粒度不匹配问题,提出因子化FSQ和轻量非自回归音频LM头以降低帧率,发现4.17Hz帧率结合中间层表示对齐在语音问答中表现最佳。

Comments Accepted by Interspeech 2026 long paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09068 2026-06-09 cs.CL 新提交 79%

Emergent Misalignment Can Be Induced by Sycophancy and Reversed via Alignment Gating

由谄媚诱导的突现性失调可通过对齐门控逆转

Sicheng Wang, Xiangyang Zhu, Han Wang, Zongrui Wang, Yuan Tian, Kaiwei Zhang, Kaiyuan Ji, Qi Jia, Guangtao Zhai

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(title,abstract);分类 cs.CL

AI总结 发现谄媚微调(被动同意用户错误观点)可诱导广泛且严重的突现性失调,并提出对齐门控方法,通过插入可学习门控来识别并抑制不安全表示,从而高效逆转失调。

Comments Code is available at https://github.com/stay1to0/Sycophancy_Emergent_Misalignment_and_Gated_attention_FT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08262 2026-06-09 cs.LG 新提交 79%

Causal Semantic Alignment for LLM-based Time Series Forecasting

基于大语言模型的时间序列预测的因果语义对齐

Kexuan Zhang, Xiaobei Zou, Cesare Alippi, Gary G. Yen, Yang Tang

机构 * University of Science and Technology of China(中国科学技术大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 其他安全 :alignment(title,abstract);分类 cs.LG

AI总结 提出CVAformer框架,通过因果干预解耦变量中的动态和不变成分,消除对齐中的混杂偏差,在多种预测场景下达到或超越最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07874 2026-06-09 cs.AI 新提交 79%

Safety is Contextual, LLM-Judges Are Not: Navigating the Rigid Priors of Evaluators

安全是上下文相关的,而LLM评判者不是:应对评估者的刚性先验

Anissa Alloula, Federico Licini, Ava Batchkala, Seraphina Goldfarb-Tarrant

机构 * University of Oxford(牛津大学) Cohere

专题命中 其他安全 :safety(title,abstract);分类 cs.AI

AI总结 研究LLM作为安全评判者时,对上下文信息的依赖性和对不同安全定义的可引导性,发现它们难以在上下文或安全定义与自身先验矛盾时调整评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09702 2026-07-14 cs.GT q-fin.TR 新提交 79%

Fundamental market design as a layer of AI-agent alignment

作为人工智能-智能体对齐层次的基础市场设计

Omar Inverso, Emilio Tuosto, Dragisa Zunic

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究探讨市场中人工智能-智能体对齐,提出将基础市场设计视为该对齐层次,通过对市场核心形式化建模,利用理论计算机科学严谨性构建透明盒模型,支持激励分析与机制设计,使期望行为受青睐,不良行为难维持。

Comments Accepted as at the EC'26 Workshop on Incentive-Based AI Alignment, co-located with the 27th ACM Conference on Economics and Computation, Rome, Italy, July 2026. This version is prepared for public dissemination following workshop acceptance

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15905 2026-08-18 cs.CV cs.MM 新提交 78%

CLARA: Clip-Level Multimodal Alignment with VLM-Derived Rationales for Hateful Video Detection

CLARA:基于VLM衍生理由的片段级多模态对齐用于仇恨视频检测

Yuchen Zhang, Shuang Dai, Zeyu Fu, Yunfei Long, Ravi Shekhar, Haralambos Mouratidis

机构 * Institute for Analytics and Data Science, University of Essex(埃塞克斯大学分析与数据科学研究所) University of Exeter(埃克塞特大学) Queen Mary University of London(伦敦大学玛丽皇后学院)

专题命中 其他安全 :alignment(title,abstract)

AI总结 本研究提出CLARA框架,以片段级多模态对齐结合VLM衍生理由,在三个仇恨视频数据集上实现了优于现有最优方法的仇恨视频检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15698 2026-08-18 cs.CV cs.IR 新提交 78%

ConceptFormer: Learning Adaptive Latent Concepts for Query-Document Alignment in Visual Document Retrieval

ConceptFormer:学习自适应潜在概念以实现视觉文档检索中的查询-文档对齐

Peng Chunyi, Xu Zhipeng, Yan Yukun, Liu Zhenghao, Yu Shi, Mei Sen, Sun Yubo, Zhang Yongheng, Zhou Jie, Gu Yu, Yu Ge, Sun Maosong

机构 * Northeastern University(东北大学) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对视觉文档检索中现有监督信号的局限,本文提出ConceptFormer框架,以自适应潜在概念为中间表示衔接语义鸿沟,在基准测试中较最强基线实现了16.7%、22.1%的NDCG@10相对提升,性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15456 2026-08-18 cs.CV 新提交 78%

AlignJEPA: Predictive Vision-Language Alignment for Remote Sensing Foundation Models

AlignJEPA:面向遥感基础模型的预测性视觉-语言对齐

Md Aminur Hossain, Omkumar Vaghasiya, Rajeev Ranjan Dwivedi, Vinod Kurmi, Biplab Banerjee

机构 * Space Applications Centre, ISRO(印度空间研究组织空间应用中心) Indian Institute of Science Education and Research (IISER) Bhopal(印度科学教育与研究学院(博帕尔)) Indian Institute of Technology Bombay(印度理工学院孟买分校)

专题命中 其他安全 :alignment(title,abstract)

AI总结 该研究针对遥感基础模型与自然语言对齐不足的问题,提出受JEPA启发的AlignJEPA框架,采用轻量级预测对齐网络,结合语义预测与双向对比检索,实现了参数高效的视觉-语言对齐。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09147 2026-08-11 cs.CV 新提交 78%

RefineAny3D: Depth Refinement as Semantic Alignment for Monocular 3D Detection

RefineAny3D:作为语义对齐的深度细化用于单目3D检测

Zhihao Zhang, Gengwei Zhang, Tianlong Chen, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他安全 :alignment(title,abstract)

AI总结 RefineAny3D将单目3D检测的深度细化转化为视觉对齐问题,通过VLM实现无需数值预测的深度修正,在多类检测工具上均有性能提升且可泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08805 2026-08-11 cs.CV 新提交 78%

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation

LASA:面向域泛化语义分割的语言与源锚定对齐

Jinhong Zhu, Weiqi Yan, Shengchuan Zhang, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对域泛化语义分割中传统方法损害特征完整性的问题,提出LASA框架,含三个协同组件,实验显示其性能优于现有最优方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08038 2026-08-11 cs.SE 新提交 78%

Stateful Multi-Agent LLMs for Cross-View Interface Alignment in Automotive Model-Based Systems Engineering

面向汽车基于模型的系统工程的有状态多智能体大语言模型,用于跨视图接口对齐

Aleksei Velsh, Nenad Petrovic, Alois Knoll

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对LLMs在汽车MBSE中引发的架构漂移问题,提出有状态多智能体验证流水线,在ADAS场景中实现97%实体可追溯性等指标,证明对抗性审核可让LLMs可靠生成零错误MBSE架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28581 2026-07-31 cs.CV 新提交 78%

ROAD: Reciprocal-Objective Alignment of Discriminative Semantics for 3D Shape Generation

ROAD:用于3D形状生成的判别式语义的互目标对齐

Xiao Luo, Mingyang Du, Xin Zhou, Tianrui Feng, Xiwu Chen, Xiaofan Li, Jiangning Zhang, Dingkang Liang

机构 * Huazhong University of Science and Technology(华中科技大学) Megvii(旷视科技) Zhejiang University(浙江大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 ROAD框架通过迁移判别式3D基础模型的先验,采用互目标对齐策略,仅用1.5%训练数据就实现了高保真3D生成,大幅降低了计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26885 2026-07-30 cs.CV 新提交 78%

SCALPEL: Semantic Cross-modal Alignment via LLM-Powered Encoder Learning for Medical Vision-Language Representation

SCALPEL:基于大语言模型驱动的编码器学习的医学视觉-语言语义跨模态对齐框架

Yunzhan Fu, Enyu Bao, Xiangyu Shen, Yihao Wu, Chunbo Jiang, Fangli Guan, Liqi Yan

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机学院)

专题命中 其他安全 :alignment(title,abstract)

AI总结 针对现有医学视觉-语言预训练的三大瓶颈,本文提出SCALPEL框架,通过临床报告对比微调、非对称对齐策略及解剖-否定感知目标,在三大医学基准上实现了多项任务的最优性能。

Comments 14 pages, 3 figures, accepted by PRCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25794 2026-07-29 cs.CV 新提交 78%

Fine-Grained Food Image Understanding via Target-Aware Data Alignment

通过目标感知数据对齐实现细粒度食品图像理解

Jui-Feng Chi, Wei-Lun Chu, Bruce Coburn, Jinge Ma, Fengqing Zhu

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究针对细粒度食品图像理解,提出以数据为中心的多模态对齐方法,先选视觉相关训练子集,再细化字幕,训练互补检索专家并融合决策,提升了检索性能,完整方法检索分数超纯VLM检索两倍且更高效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24467 2026-07-28 cond-mat.mtrl-sci 新提交 78%

Neural RHEED alignment with limited training data during CdTe MBE growth

碲化镉分子束外延生长过程中利用有限训练数据的神经反射高能电子衍射校准

Bartłomiej Turowski, Jakub J. Meixner, Róża Dziewiątkowska, Wojciech Zaleszczyk, Tomasz Wojciechowski, Valentine V. Volobuev, Marcin M. Wysokiński, Tomasz Wojtowicz

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究利用有限训练数据,通过神经视觉辅助方法在碲化镉MBE生长中自动晶体校准。基于二维和三维ResNet配置设计网络架构并比较,提供了可用于闭环部署的训练好的神经系统及新材料的可推广管道,朝着AI驱动的MBE生长迈进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17171 2026-07-21 cs.RO 新提交 78%

VIDAR: Visual-Inertial Dense Alignment and Reconstruction via a Geometric Foundation Model

VIDAR:通过几何基础模型实现视觉惯性密集对齐与重建

Diyari Mohammed Salih, Lingxiang Hu, Naima AitOufroukh-Mammar, Fabien Bonardi

机构 * IBISC Laboratory, Université d’Évry Paris-Saclay, Université Paris-Saclay(IBISC实验室,埃夫里-巴黎萨克雷大学,巴黎萨克雷大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究针对单目基础模型缺乏稳定度量尺度的问题,提出VIDAR框架,结合SVO+IMU里程计与深度任意模型3,利用视觉惯性前端作度量锚点,经姿态注入等方法,在EuRoC和TUM RGB-D数据集上实现度量密集单目重建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10532 2026-07-14 cs.IR 新提交 78%

Implicit Fine-tuning via Context Engineering: A Curriculum Learning Framework for Multimodal Entity Alignment

通过上下文工程进行隐式微调:多模态实体对齐的课程学习框架

Yunpeng Hong, Chenyang Bu, Di Wu, Yi He, Xindong Wu

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究多模态实体对齐问题,提出PTFEA课程学习框架,通过自适应难度调制和三阶段渐进推理将微调策略转化为上下文工程,实验证明该框架性能优越,提供了统一上下文工程和微调的理论框架。

Comments Accepted by KDD 2026

Journal ref SIGKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08194 2026-07-10 cs.CV 新提交 78%

Dive Into the Implicit Biases of Low-rank Vision-language Alignment

深入探究低秩视觉-语言对齐中的隐式偏差

Mingjia Shi, Shuo Wang, Xiaobo Wang, Sifan Zhou, Kai Wang, Tianyu Fu, Chenxu Zhao, Anyang Su, Ping Jiang, Minghui Wu

机构 * Shenzhen University of Advanced Technology(深圳先进技术研究院) National University of Singapore(新加坡国立大学) Mininglamp(明略科技)

专题命中 其他安全 :alignment(title,abstract)

AI总结 挑战视觉-语言对齐需全参数更新的观点,研究低秩适应在此阶段的应用,发现其能降成本且性能优。通过实证、几何分析和理论推导探究现象原因,并进行多方面消融实验。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06305 2026-07-08 astro-ph.IM 新提交 78%

Exploring Image-Text Alignment for Radio Galaxy Morphologies

探索射电星系形态的图像-文本对齐

Erica Lastufka, Mariia Drozdova, Svyatoslav Volosynovskiy

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究射电星系图像与文本描述的对齐,利用MiraBest数据集及SigLIP-2模型,经特定提示生成描述并评估。结果显示基于描述的星系分类与图像类似,微调改善局部连贯性,此为射电星系形态研究提供新方法。

Comments Accepted at the AI in Science (AIS) Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04311 2026-07-08 cs.CV 新提交 78%

Aura: Consistent Multi-Subject Video Generation via VLM-Grounded Semantic Alignment

Aura:通过基于VLM的语义对齐实现一致的多主体视频生成

Zixiang Zhou, Zhentao Yu, Yifeng Ma, Hongmei Wang, Wenqing Yu, Cong Wang, Zilin Yang, Rui Chen, Jiarong Ou, Yezhou Liu, Yuan Zhou, Qinglin Lu

机构 * Tencent Hunyuan(腾讯混元)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出Aura框架用于高保真和身份一致的视频生成,引入AI导演级字幕、利用VLM提取多模态语义特征,设计对齐策略,采用多种机制减少伪影,在多主体视频生成上达先进性能。

Comments Project page: https://aura-project-page.github.io/ Code: https://github.com/Camellia997/Aura

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02949 2026-07-07 cs.SE 新提交 78%

BeSpec: Behavior-Level Specification Alignment for Code Generation

BeSpec:用于代码生成的行为级规范对齐

Qinghua Xu, Guancheng Wang, Boxi Yu, Lionel Briand

专题命中 其他安全 :alignment(title,abstract)

AI总结 研究针对代码生成中规范不匹配问题,提出基于行为模型的BeSpec方法,通过构建行为模型、生成候选程序并对比行为来对齐规范,在多基准测试中效果优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02471 2026-07-03 cs.CV 新提交 78%

Interpretation-Oriented Cloud Removal via Observation-Anchored Residual Flow with Geo-Contextual Alignment

面向解译的云去除:基于观测锚定残差流与地理上下文对齐

Ziyao Wang, Maonan Wang, Yucheng He, Xianping Ma, Ziyi Wang, Hongyang Zhang, Yirong Cheng, Man-on Pun

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) Shanghai Ai Lab(上海人工智能实验室) Faculty of Geosciences and Engineering, Southwest Jiaotong University(西南交通大学地球科学与工程学院)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出GACR框架,通过观测锚定残差流(OAR-Flow)将云去除重构为物理残差反演,结合地理上下文先验对齐(GCPA)保持语义结构,在六个数据集和十二个下游任务中验证了重建质量和下游精度提升。

Comments accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23041 2026-07-03 cs.CV 新提交 78%

SPAR: Semantic-Pixel Self-Alignment and Adaptive Routing for Unified Multimodal Models

SPAR: 语义-像素自对齐与自适应路由的统一多模态模型

Hongxiang Li, Hongxu Chen, Chenyang Zhu, Xiaoshuang Huang, Jiayin Cai, Xiaolong Jiang, Yao Hu, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaohongshu Inc.(小红书公司)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出SPAR框架,通过非对称双流统一分词器协调语义感知与像素重建,利用自对齐生成范式消除外部依赖,并引入动态令牌路由实现灵活多模态交互,在统一架构中达到生成、重建与视觉理解的最优性能。

Comments ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交 78%

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31517 2026-07-01 cs.IR cs.CV 新提交 78%

Unsupervised Data-Efficient Cross-Modal Retrieval with Global-Neighborhood Alignment Hashing

基于全局邻域对齐哈希的无监督数据高效跨模态检索

Runhao Li, Xiaoxu Ma, Zhenyu Weng, Yue Zhang, Guibo Luo, Huiping Zhuang, Zhiping Lin, Yap-Peng Tan

机构 * School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) Shien-Ming Wu School of Intelligent Engineering, South China University of Technology(华南理工大学吴贤铭智能工程学院) College of Computer and Information Engineering, Henan Normal University(河南师范大学计算机与信息工程学院) VinUniversity(Vin大学)

专题命中 其他安全 :alignment(title,abstract)

AI总结 提出全局邻域对齐哈希(GNAH),通过原型锚定全局对齐和对比随机邻域对齐,在少量图像-文本对下学习紧凑二进制码,实现数据高效的无监督跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏