arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 1394 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 310 篇

2512.10607 2026-07-16 cs.CV 版本更新 50%

Track and Caption Any Motion: Open-Vocabulary Spatiotemporal Captioning via Trajectory-Conditioned Generation

跟踪并描述任何运动:通过轨迹条件生成实现开放词汇时空字幕

Bishoy Galoaa, Sarah Ostadabbas

机构 * Northeastern University(东北大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究提出TCAM框架,无需文本查询和区域提示,通过字幕感知重采样器在点粒度结合跟踪与语言,用现有分割注释训练,能描述视频中运动、定位时间及轨迹,优于密集视频字幕基线,匹配相关方法,为运动驱动视频理解提供新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08072 2026-07-15 cs.CV cs.RO 版本更新 50%

Post-Training in End-to-End Autonomous Driving

端到端自动驾驶中的训练后处理

Ruining Yang, Muxing Wang, Yixiao Chen, Tongfei Guo, Yi Xu, Can Cui, Zichong Yang, Yitian Zhang, Ziran Wang, Yun Fu, Lili Su

机构 * Northeastern University(东北大学) Purdue University(普渡大学)

专题命中 其他安全 :safety(abstract)

AI总结 探讨端到端自动驾驶中训练后处理技术,针对传统方法不足,将现有文献按监督形式分四类,阐述各分类的能力、局限与挑战,助力系统理解该领域并推动相关研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11470 2026-07-15 cs.CV 版本更新 50%

Sat2RealCity: Geometry-Aware and Appearance-Controllable 3D Urban Generation from Satellite Imagery

Sat2RealCity:基于卫星图像的几何感知与外观可控的3D城市生成

Xinliang Wang, Yijie Kang, Zhenyu Wu, Yifeng Shi

机构 * KE Holdings Inc.(KE控股公司) Beijing, China(中国北京)

专题命中 其他安全 :alignment(abstract)

AI总结 针对卫星图像3D城市生成问题,Sat2RealCity框架利用对象级3D生成先验,通过分解城市为地理定位建筑实体,结合构建的数据集,引入空间定位策略、设计外观引导机制及构建语义管道,实现良好的地理对齐、风格一致和资产合成。

Comments The first two authors contributed equally. The fourth author is the corresponding author

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12721 2026-07-14 cs.CR 版本更新 50%

Robust hardware Trojan detection leveraging dual-domain features and stacked ensemble learning

利用双域特征和堆叠集成学习进行鲁棒的硬件木马检测

Sefatun-Noor Puspa, Abyad Enan, Reek Majumdar, M Sabbir Salek, Gurcan Comert, Mashrur Chowdhury

专题命中 其他安全 :safety(abstract)

AI总结 研究硬件木马检测问题,核心方法是结合时域和频域特征,评估六种人工智能模型并通过堆叠集成分类器集成,主要贡献是提出的框架能准确鲁棒检测硬件木马,无需可信参考IC,宏平均ROC-AUC达0.987。

Comments This version supersedes the original arXiv submission and reflects the peer-reviewed journal publication under a new title, 21 pages, 10 figures. Revised and peer-reviewed version. Published in Cybersecurity. Previously posted under the title "An AI-Enabled Side Channel Power Analysis Based Hardware Trojan Detection Method for Securing the Integrated Circuits in Cyber-Physical Systems"

Journal ref Cybersecurity, Vol. 9, Article 111 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21309 2026-07-13 cs.CV 版本更新 50%

Test-Time Adaptation via Cache Personalization for Facial Expression Recognition in Videos

基于缓存个性化的时间测试适应用于视频面部表情识别

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔工程学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与信息工程系,蒙特利尔工程学院,加拿大)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出TTA-CaP方法,通过缓存实现高效视频面部表情识别的模型个性化,减少计算开销并提升跨主体和环境变化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01388 2026-07-10 cs.CV 版本更新 50%

LESV: Language Embedded Sparse Voxel Fusion for Open-Vocabulary 3D Scene Understanding

LESV: 语言嵌入稀疏体素融合用于开放词汇3D场景理解

Fusang Wang, Nathan Piasco, Moussab Bennehar, Luis Roldão, Dzmitry Tsishkou, Fabien Moutarde

机构 * Huawei Noah's Ark Lab(华为诺亚方舟实验室) CAOR, Mines Paris-PSL, France(法国巴黎高科矿业学院CAOR实验室)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出LESV框架,通过稀疏体素 rasterization 解决3D场景理解中空间和语义模糊问题,利用AM-RADIO实现密集对齐,提升细粒度查询性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16456 2026-07-10 cs.CV 版本更新 50%

PhyMAGIC: Physical Motion-Aware Generative Inference with Confidence-guided LLM

PhyMAGIC:基于置信度引导的大语言模型的物理运动感知生成推理

Siwei Meng, Yawei Luo, Ping Liu

机构 * Department of Computer Science \& Engineering, University of Nevada, Reno, USA School of Software Technology, Zhejiang University, China

专题命中 其他安全 :alignment(abstract)

AI总结 针对3D内容生成中动态模型物理一致性问题,PhyMAGIC提出无需训练的框架,整合图像到视频扩散模型、大语言模型置信度引导推理及可微物理模拟器,通过迭代优化和模拟反馈生成物理一致的运动,性能优于现有方法。

Comments This work is accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06445 2026-07-09 cs.CV 版本更新 50%

What if? Emulative Simulation with World Models for Situated Reasoning

如果呢?基于世界模型的仿真模拟用于情境推理

Ruiping Liu, Yufan Chen, Yuheng Zhang, Junwei Zheng, Kunyu Peng, Chengzhi Wu, Chenguang Huang, Di Wen, Jiaming Zhang, Kailun Yang, Rainer Stiefelhagen

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Hunan University(湖南大学) ETH Zürich(苏黎世联邦理工学院) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) RAI Institute(RAI研究所)

专题命中 其他安全 :safety(abstract)

AI总结 提出WanderDream数据集,利用世界模型进行心理探索的仿真模拟,使代理无需主动探索即可回答空间假设问题,实验证明心理探索对情境推理至关重要。

Comments Accepted at ECCV 2026. The data and code are available at: https://github.com/RuipingL/WanderDream

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02401 2026-07-08 cs.CV 版本更新 50%

Superman: Unifying Skeleton and Vision for Human Motion Perception and Generation

超人:统一骨骼与视觉用于人体运动感知与生成

Xinshun Wang, Peiming Li, Ziyi Wang, Zhongbin Fang, Zhichao Deng, Songtao Wu, Jason Li, Mengyuan Liu

机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School(通用人工智能国家重点实验室,北京大学深圳研究生院) Sony R&D Center(索尼研发中心) Nanyang Technological University(南洋理工大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对人体运动分析范式碎片化问题,提出Superman统一框架,通过视觉引导运动分词器创建跨模态运动词汇,训练单一MLLM架构处理多任务,实验表明该方法在运动任务中性能领先或具竞争力,为运动分析提供高效可扩展路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10547 2026-07-08 cs.SD 版本更新 50%

HeartMuLa: A Family of Open Sourced Music Foundation Models

HeartMuLa:一个开源音乐基础模型家族

Dongchao Yang, Yuxin Xie, Yuguo Yin, Zheyu Wang, Xiaoyu Yi, Gongxi Zhu, Xiaolong Weng, Zihan Xiong, Yingzhe Ma, Dading Cong, Jingliang Liu, Zihang Huang, Jinghan Ru, Rongjie Huang, Haoran Wan, Peixu Wang, Kuoxi Yu, Helin Wang, Liming Liang, Xianwei Zhuang, Yuanyuan Wang, Dingdong Wang, Haohan Guo, Junjie Cao, Zeqian Ju, Songxiang Liu, Yuewen Cao, Heming Weng, Yuexian Zou

机构 * HeartMuLa Teams(HeartMuLa团队)

专题命中 其他安全 :alignment(abstract)

AI总结 介绍开源音乐基础模型家族HeartMuLa,含四个组件及两种特殊模式,能跨任务和模态推动音乐理解与生成,扩展到7B参数时有显著改进,可重现商业级系统,为未来研究提供基线并促进多模态应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02211 2026-07-07 cs.CV 版本更新 50%

TexTailor: Inference-Time Textual Guidance Tailoring for Multimodal Diffusion Transformers

TexTailor:用于多模态扩散变压器的推理时文本引导剪裁

Binglei Li, Mengping Yang, Zhiyu Tan, Junping Zhang, Hao Li

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究基于变压器的扩散模型中不同模块与文本条件的交互。通过系统管道分析各模块功能,提出推理时逐块文本引导剪裁方法,提升文本图像对齐,有多种下游应用,实验表明优于基线。

Comments To appear in ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03463 2026-07-07 cs.SE 版本更新 50%

The Impact of Critique on LLM-Based Model Generation from Natural Language: The Case of Activity Diagrams

批判对基于大语言模型的自然语言模型生成的影响:以活动图为例

Parham Khamsepour, Mark Cole, Ish Ashraf, DaYuan Tan, Sandeep Puri, Mehrdad Sabetzadeh, Shiva Nejati

专题命中 其他安全 :alignment(abstract)

AI总结 研究基于大语言模型从自然语言描述自动化生成模型,提出LADEX流程,经批判-改进循环,设计变体研究其影响,用两种匹配器评估,实验表明循环可提升结构有效性等,算法结构检查更能实现结构一致性。

Comments Accepted in the Empirical Software Engineering (EMSE) Journal (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29341 2026-07-03 cs.IR 版本更新 50%

Monosemanticity in Recommender Systems

推荐系统中的单语义性

Yagel Alfasi, Eden Rzezak, Eadan Schechter

专题命中 其他安全 :alignment(abstract)

AI总结 研究矩阵分解嵌入的层次稀疏表示,用Matryoshka稀疏自编码器提取可解释特征,通过元数据对齐和LLM标注验证语义一致性,并干预性别相关神经元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10710 2026-07-03 cs.CV 版本更新 50%

From One-to-One to Many-to-Many: Dynamic Cross-Layer Injection for Deep Vision-Language Fusion

从一对一到多对多:面向深度视觉-语言融合的动态跨层注入

Cheng Chen, Yuyu Guo, Pengpeng Zeng, Jingkuan Song, Peng Di, Hang Yu, Lianli Gao

机构 * Tongji University(同济大学) Ant Group(蚂蚁集团) Shanghai Innovation Institute(上海创新研究院) Independent Researcher(独立研究者)

专题命中 其他安全 :alignment(abstract)

AI总结 提出跨层注入框架,通过自适应多投影模块和自适应门控融合机制实现视觉层与LLM的动态多对多连接,显著提升多模态理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.11925 2026-07-02 cs.CV 版本更新 50%

Continuous Speculative Decoding for Autoregressive Image Generation

连续推测解码用于自回归图像生成

Zili Wang, Zheng Zhang, Kun Ding, Qi Yang, Fei Li, Shiming Xiang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) JD.COM Inc(京东集团股份有限公司) China Tower Corporation Limited(中国铁塔股份有限公司)

专题命中 其他安全 :alignment(abstract)

AI总结 提出连续推测解码方法,通过近似准则、去噪轨迹对齐和接受-拒绝采样,加速连续视觉自回归模型,实现2倍以上加速且保持生成质量。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.03722 2026-07-02 eess.SP 版本更新 50%

GRN-Transformer: Enhancing Motion Artifact Detection in PICU Photoplethysmogram Signals

GRN-Transformer:增强PICU光电容积脉搏波信号中的运动伪影检测

Thanh-Dung Le, Clara Macabiau, Kévin Albert, Philippe Jouvet, Rita Noumeir

专题命中 其他安全 :safety(abstract)

AI总结 提出GRN-Transformer,通过门控残差网络正则化标准Transformer,在小型不平衡PICU PPG数据集上以5%标注数据达到98%准确率,显著提升召回率并保持高精度,训练速度快2.7倍,适合资源受限的儿科临床部署。

Comments Under preparation to submit to IEEE for possible publications

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09919 2026-07-01 cs.CV 版本更新 50%

MetricHMSR:Metric Human Mesh and Scene Recovery from Monocular Images

MetricHMSR:基于单目图像的度量人体网格与场景恢复框架

Chentao Song, He Zhang, Haolei Yuan, Haozhe Lin, Jianhua Tao, Hongwen Zhang, Tao Yu

机构 * Tsinghua University(清华大学) Beijing Normal University(北京师范大学) Beihang University(北京航空航天大学)

专题命中 其他安全 :alignment(abstract)

AI总结 本文提出MetricHMSR框架,通过引入bounding camera ray map和HumanMoE模型,实现人体网格和场景的度量恢复,提升单目深度估计的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09930 2026-07-01 cs.CV cs.IR 版本更新 50%

Fine-grained Motion Retrieval via Joint-Angle Motion Images and Token-Patch Late Interaction

基于关节角度运动图像与令牌-补丁后期交互的细粒度运动检索

Yao Zhang, Zhuchenyang Liu, Yanlan He, Thomas Ploetz, Yu Xiao

机构 * Aalto University(阿尔托大学) Fudan University(复旦大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出一种可解释的关节角度运动表示,结合预训练视觉Transformer和令牌级后期交互机制,实现文本与3D运动之间的细粒度对齐,在HumanML3D和KIT-ML上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 50%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 其他安全 :alignment(abstract)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20653 2026-07-01 cs.SE cs.SY eess.SY 版本更新 50%

SysVCoder: An LLM-Driven Framework for Systematic Generation of System-Level Design

SysVCoder: 一种LLM驱动的系统级设计系统性生成框架

Jian Zuo, Junzhe Liu, Xianyong Wang, Chen Liang, Navya Goli, Umamaheswara Rao Tida, Zhenge Jia, Zhaoyan Shen, Mengying Zhao

专题命中 其他安全 :alignment(abstract)

AI总结 提出SysVCoder框架,通过两阶段生成流水线、规则对齐机制和领域特定检索增强生成策略,提升Verilog系统级设计的生成质量与效率,在功能正确性上优于现有方法。

Comments This paper is accepted at APPT'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14271 2026-06-29 cs.CV 版本更新 50%

Let Language Constrain Geometry: Vision-Language Models as Semantic and Spatial Critics for 3D Generation

让语言约束几何:视觉-语言模型作为3D生成的语义和空间评判者

Weimin Bai, Yubo Li, Weijian Luo, Zeqiang Lai, Yequan Wang, Wenzheng Chen, He Sun

机构 * Peking University(北京大学) hi-lab, Xiaohongshu Inc.(小红书科技公司 hi-lab) MMLab, CUHK(香港中文大学 MMLab) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 提出VLM3D框架,利用视觉-语言模型作为可微分的语义和空间评判者,通过双查询评判信号改善文本到3D生成的语义对齐和几何一致性。

Comments arXiv admin note: substantial text overlap with arXiv:2509.15772

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28197 2026-06-26 cs.RO cs.CV 版本更新 50%

OmniRobotHome: A Multi-Camera Home Platform for Real-Time Human-Robot Interaction

OmniRobotHome:一个多摄像头平台用于实时多对多人机交互

Junyoung Lee, Inhee Lee, Sookwan Han, Jeonghwan Kim, Kyungwon Cho, Mingi Choi, Lee Chae-Yeon, Wonjung Woo, Gunhee Kim, Jisoo Kim, Jeonghyeon Na, Hanbyul Joo

机构 * Seoul National University(首尔国立大学) RLWRLD

专题命中 其他安全 :safety(abstract)

AI总结 OmniRobotHome通过多摄像头和双Franka机械臂实现多对多人机协作的实时3D感知与协同动作,解决了近距离交互中的遮挡和状态变化问题,为多对多协作实验提供了可行平台。

Comments Project Page: https://junc0ng.github.io/omnirobothome

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17621 2026-06-26 cs.CV 版本更新 50%

PathFLIP: Fine-grained Language-Image Pretraining for Versatile Computational Pathology

PathFLIP:面向多功能计算病理学的细粒度语言-图像预训练

Fengchun Liu, Songhan Jiang, Linghan Cai, Ziyue Wang, Yongbing Zhang

机构 * Harbin Institute of Technology, Shenzhen, School of Computer Science and Technology(哈尔滨工业大学(深圳)计算机科学与技术学院) National University of Singapore, Department of Electronic and Computer Engineering(新加坡国立大学电子与计算机工程系)

专题命中 其他安全 :alignment(abstract)

AI总结 提出PathFLIP框架,通过将幻灯片级描述分解为区域级子描述并生成文本条件区域嵌入,实现细粒度视觉-语言对齐,在多个基准上优于现有模型且训练数据更少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15347 2026-06-26 eess.IV cs.MM 版本更新 50%

Symmetric Entropy-Constrained Video Coding for Machines

面向机器的对称熵约束视频编码

Yuxiao Sun, Meiqin Liu, Chao Yao, Qi Tang, Jian Jin, Weisi Lin, Frederic Dufaux, Yao Zhao

专题命中 其他安全 :alignment(abstract)

AI总结 提出SEC-VCM框架,通过双向熵约束机制对称对齐视频编解码器与视觉骨干网络,保留语义并丢弃无关信息,结合语义-像素双路径融合提升机器视觉任务性能,在多项任务上显著优于H.266/VVC。

Comments Accepted by IEEE Transactions on Image Processing. This is the author's accepted manuscript (AAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17916 2026-06-26 cs.CV 版本更新 50%

EndoUFM: Utilizing Foundation Models for Monocular depth estimation of endoscopic images

EndoUFM:利用基础模型进行内窥镜图像的单目深度估计

Xinning Yao, Bo Liu, Bojian Li, Jingjing Wang, Jinghua Yue, Fugen Zhou

机构 * Image Processing Center, Beihang University(北京航空航天大学图像处理中心) State Key Laboratory of High-Efficiency Reusable Aerospace Transportation Technology(高效可重复航天运输技术国家重点实验室)

专题命中 其他安全 :safety(abstract)

AI总结 提出EndoUFM框架,通过双基础模型和自适应微调策略(RVLoRA和Res-DSC)提升内窥镜图像单目深度估计性能,在多个数据集上达到最优。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12024 2026-06-25 cs.RO 版本更新 50%

Adaptive-Horizon Conflict-Based Search for Closed-Loop Multi-Agent Path Finding

自适应视界冲突搜索用于闭环多智能体路径规划

Jiarui Li, Federico Pecora, Runyu Zhang, Gioele Zardini

机构 * Laboratory for Information and Decision Systems, Massachusetts Institute of Technology(信息与决策系统实验室,麻省理工学院) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 其他安全 :safety(abstract)

AI总结 提出ACCBS算法,通过动态调整规划视界和重用约束树,在有限计算预算下快速生成高质量可行解,兼具渐近最优性和扰动适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11197 2026-06-24 cs.CV 版本更新 50%

MedP-CLIP: Medical CLIP with Region-Aware Prompt Integration

MedP-CLIP:具有区域感知提示集成的医学CLIP

Jiahui Peng, He Yao, Jingwen Li, Yanzhou Su, Sibo Ju, Yujie Lu, Jin Ye, Hongchun Lu, Xue Li, Lincheng Jiang, Min Zhu, Junlong Cheng

机构 * Sichuan University(四川大学) Xinjiang University(新疆大学) Alibaba Group(阿里巴巴集团) Fuzhou University(福州大学) Shanghai AI Laboratory(上海人工智能实验室) Southwest Jiaotong University(西南交通大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出MedP-CLIP,一种区域感知医学视觉语言模型,通过特征级区域提示集成机制,支持多种提示形式,在保持全局上下文的同时聚焦局部区域,在零样本识别、交互式分割等任务中显著优于基线方法。

Comments Accepted by Medical Image Analysis (MedIA)

Journal ref Medical Image Analysis, 113 (2026), 104193

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11121 2026-06-24 cs.CV eess.IV 版本更新 50%

Generative Manifold Distillation: Aligning Restoration Trajectories with Natural Image Prior

生成式流形蒸馏:将恢复轨迹与自然图像先验对齐

Yuyang Hu, Mojtaba Sahraee-Ardakan, Arpit Bansal, Kangfu Mei, Chenyang Qi, Peyman Milanfar, Mauricio Delbracio

机构 * Google(谷歌) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出生成式流形蒸馏(GMD),通过几何流形对齐实现无配对域自适应,利用冻结文本到图像基础模型的流匹配动力学将离流形恢复投影到自然图像流形,并引入质量门控滤波器和源锚定轨迹正则化,无需架构修改或推理延迟即可提升感知质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12683 2026-06-23 cs.CV q-bio.NC 版本更新 50%

Brain-DiT: A Universal Multi-state fMRI Foundation Model with Metadata-Conditioned Pretraining

Brain-DiT:一种基于元数据条件预训练的通用多状态fMRI基础模型

Junfeng Xia, Wenhao Ye, Xuanye Pan, Xinke Shen, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology, China(南方科技大学生物医学工程系,中国) School of Biomedical Engineering, Shenzhen University, China(深圳大学生物医学工程学院,中国)

专题命中 其他安全 :alignment(abstract)

AI总结 提出Brain-DiT,一种基于扩散Transformer和元数据条件预训练的通用多状态fMRI基础模型,在24个数据集上预训练,通过生成式预训练学习多尺度表示,在7个下游任务中优于重建和对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20475 2026-06-23 cs.CV 版本更新 50%

CREG: Compass Relational Evidence Graph for Characterizing Directional Structure in VLM Spatial-Reasoning Attribution

CREG: 用于表征VLM空间推理归因中方向性结构的指南针关系证据图

Kaizhen Tan, Yang Feng, Heqing Du

机构 * Carnegie Mellon University(卡内基梅隆大学) Columbia University(哥伦比亚大学)

专题命中 其他安全 :alignment(abstract)

AI总结 提出CREG框架,将令牌级归因转换为以参考为中心的指南针分布并测量方向对齐,揭示当前归因方法的方向性结构有限且常与图像布局混合,任务准确率提升不保证方向归因改善。

详情

展开后加载摘要…

URL PDF HTML 收藏