arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 1439 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 跨模态检索 87 篇

2604.20623 2026-06-16 cs.CV cs.AI 版本更新 62%

RSRCC: A Remote Sensing Regional Change Comprehension Benchmark Constructed via Retrieval-Augmented Best-of-N Ranking

RSRCC:通过检索增强的最佳N排序构建的遥感区域变化理解基准

Roie Kazoom, Yotam Gigi, George Leifman, Tomer Shekel, Genady Beryozkin

机构 * Google Research(谷歌研究)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV、cs.AI

AI总结 提出RSRCC基准,包含12.6万个细粒度遥感变化问答对,采用层次化半监督流程结合最佳N排序解决歧义,实现局部语义变化推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06212 2026-06-16 cs.CV cs.AI 版本更新 62%

Akasha 2: Hamiltonian State Space Duality and Visual-Language Joint Embedding Predictive Architectur

Akasha 2: 哈密顿状态空间对偶与视觉-语言联合嵌入预测架构

Yani Meziani

机构 * Independent AI Researcher(独立AI研究员) Québec (QC), Canada(魁北克(QC),加拿大)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出 Akasha 2 多模态架构,结合哈密顿状态空间对偶与视觉-语言联合嵌入预测,通过稀疏混合哈密顿专家和哈密顿流匹配实现超低延迟视频预测与合成,在保持能量守恒下取得 SOTA 性能。

Comments No supporting claims were validated in this automated agentic R&D research run

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24181 2026-06-09 cs.CV cs.AI 版本更新 62%

A Mixed Diet Makes DINO An Omnivorous Vision Encoder

混合饮食使DINO成为杂食视觉编码器

Rishabh Kabra, Maks Ovsjanikov, Drew A. Hudson, Ye Xia, Skanda Koppula, Andre Araujo, Joao Carreira, Niloy J. Mitra

机构 * Google DeepMind(谷歌DeepMind) University College London(伦敦大学学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对DINOv2等预训练视觉编码器在不同视觉模态间特征对齐差的问题,提出杂食视觉编码器,通过后训练框架学习模态无关特征空间,实现跨模态鲁棒理解。

Comments CVPR 2026 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.19504 2026-06-09 cs.AI cs.CL cs.IR 版本更新 62%

TQA-Bench: Evaluating LLMs for Multi-Table Question Answering

TQA-Bench:评估大语言模型在多表问答中的表现

Zipeng Qiu, Chenyue Li, You Peng, Guangxin He, Binhang Yuan, Chen Wang

机构 * Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

专题命中 跨模态检索 :multi-modal(abstract);分类 cs.CL、cs.AI

AI总结 提出TQA-Bench基准,通过长上下文多表问答任务评估LLM,揭示其在复杂数据驱动环境中的挑战与机遇。

Comments Accepted by IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17782 2026-08-14 cs.CV 版本更新 57%

Subject-Aware Multi-Granularity Alignment for Zero-Shot EEG-to-Image Retrieval

面向主体的多粒度对齐用于零样本EEG到图像检索

Lin Jiang, Qingshan She, Jiale Xu, Haiqi Xu, Duanpo Wu, Zhenzhong Kuang

机构 * School of Automation, Hangzhou Dianzi University(杭州电子科技大学自动化学院) Zhejiang Provincial Key Laboratory of Brain Computer Collaborative Intelligence Technology and Applications, Hangzhou, Zhejiang(浙江省脑机协同智能技术与应用重点实验室,杭州,浙江) College of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出SAMGA框架,通过多粒度对齐解决EEG到图像检索中主体依赖性和多尺度信息的问题,提升检索精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05506 2026-08-07 cs.CV 版本更新 57%

Robust Scene Transfer for PointGoal Navigation via Privileged Sensor Guided Contrastive Learning

基于特权传感器引导对比学习的点目标导航鲁棒场景迁移

Amirhossein Zhalehmehrabi, Tiziano Tezze, Alberto Castelini, Alessandro Farinelli

机构 * University of Padua(帕多瓦大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出一种传感器引导的自适应对比学习框架,利用特权LiDAR传感器在训练时引导视觉编码器学习导航相关结构,并通过解耦表征学习与策略优化以及跨阶段域不匹配来提升策略级场景迁移能力。

Comments 8 pages, Accepted to IEEE Robotics and Automation Letters (RA-L)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22850 2026-08-05 cs.CV 版本更新 57%

What is the Right Embedding Space for Contrastive Learning in REC?

REC中对比学习的合适嵌入空间是什么?

Kostas Triaridis, Panagiotis Kaliosis, E-Ro Nguyen, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(斯通布鲁克大学) EPFL(苏黎世联邦理工学院)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 该研究针对REC任务现有对比学习策略的局限,提出视觉嵌入空间的C-REX框架,作为即插即用模块提升REC及类别无关计数任务性能,在REC上MAE最高提升28%、RMSE提升24.5%。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.15267 2026-07-17 cs.CR cs.CL 版本更新 57%

When Machine Unlearning Meets Retrieval-Augmented Generation (RAG): Keep Secret or Forget Knowledge?

当模型遗忘遇上检索增强生成(RAG):保守秘密还是遗忘知识?

Shang Wang, Tianqing Zhu, Dayong Ye, Wanlei Zhou

机构 * School of Computer Science, University of Technology Sydney(悉尼科技大学计算机科学学院) Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CL

AI总结 研究大语言模型训练中敏感信息保留问题,提出基于检索增强生成(RAG)技术的轻量级行为遗忘框架,通过修改外部知识库模拟遗忘,经实验验证该方法符合五个关键遗忘标准,还可扩展到多模态模型和智能体。

Comments This paper is accepted by IEEE Transactions on Dependable and Secure Computing 2025. The source code is available at \url{https://github.com/shihe98/RAG_Unlearning}

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13533 2026-07-07 cs.CV 版本更新 57%

Language-guided Medical Image Segmentation with Target-informed Multi-level Contrastive Alignments

基于目标感知多级对比对齐的语言引导医学图像分割

Mingjian Li, Mingyuan Meng, Shuchang Ye, Mingye Zou, Michael Fulham, Lei Bi, Jinman Kim

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Institute of Translational Medicine, Shanghai Jiao Tong University(上海交通大学转化医学研究院) Zhongguancun Academy & Zhongguancun Institute of Artificial Intelligence, Beijing, China(北京中关村学院及中关村人工智能研究院) Department of Molecular Imaging, Royal Prince Alfred Hospital(皇家珀斯阿尔弗雷德医院分子成像部)

专题命中 跨模态检索 :image-text(abstract);分类 cs.CV

AI总结 研究针对医学图像分割,提出目标感知多级对比对齐框架,通过引入目标敏感语义距离模块、多级对比对齐策略和语言引导目标增强模块,弥合图文模态差距,实现细粒度文本引导,实验证明性能优于现有方法。

Comments Published in Expert Systems with Applications (ESWA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00813 2026-06-26 cs.CV 版本更新 57%

Generating a Paracosm for Training-Free Zero-Shot Composed Image Retrieval

生成一个Paracosm用于免训练零样本组合图像检索

Tong Wang, Yunhan Zhao, Shu Kong

机构 * University of Macau(澳门大学) UC Irvine(伊丽莎白女王大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出Paracosm方法,通过大多模态模型直接生成“心理图像”并构建合成域,实现免训练的零样本组合图像检索,在多个基准上达到最优性能。

Comments Accepted to ECCV 2026. Website and code: https://leowangtong.github.io/Paracosm/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13731 2026-06-25 cs.CV 版本更新 57%

GeoRanker: Distance-Aware Ranking for Worldwide Image Geolocalization

GeoRanker:面向全球图像地理定位的距离感知排序

Pengyue Jia, Seongheon Park, Song Gao, Xiangyu Zhao, Sharon Li

机构 * Department of Data Science, City University of Hong Kong(城市大学数据科学系) Department of Computer Sciences, University of Wisconsin-Madison(威斯康星大学麦迪逊分校计算机科学系) Department of Geography, University of Wisconsin-Madison(威斯康星大学麦迪逊分校地理系)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出GeoRanker框架,利用大视觉语言模型联合编码查询-候选交互并预测地理邻近性,引入多阶距离损失以建模结构化空间关系,在IM2GPS3K和YFCC4K基准上达到最优。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08819 2026-06-23 cs.IR cs.AI 版本更新 57%

Beyond Relevance: On the Relationship Between Retrieval and RAG Information Coverage

超越相关性:检索与RAG信息覆盖之间的关系

Saron Samuel, Alexander Martin, Eugene Yang, Andrew Yates, Dawn Lawrie, Ian Soboroff, Laura Dietz, Benjamin Van Durme

机构 * Johns Hopkins University(约翰霍普金斯大学) National Institute of Standards and Technology(国家标准与技术研究院) University of New Hampshire(新罕布什尔大学)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 研究检索质量与生成响应信息覆盖的关系,发现基于覆盖的检索指标与生成响应中的要点覆盖强相关,支持用检索指标代理RAG性能。

Comments 12 pages, ICTIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22307 2026-06-23 cs.CV 版本更新 57%

Johnson-Lindenstrauss Lemma Guided Network for Efficient 3D Medical Segmentation

Johnson-Lindenstrauss引理引导的高效3D医学分割网络

Jinpeng Lu, Linghan Cai, Yinda Chen, Guo Tang, Songhan Jiang, Haoyuan Shi, Zhiwei Xiong

机构 * University of Science and Technology of China(中国科学技术大学) Dresden University of Technology(德累斯顿理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出VeloxSeg,通过双流CNN-Transformer架构(PWA和JLC)结合格拉姆矩阵空间解耦知识迁移,在低计算预算下实现多模态3D医学图像高效分割,Dice提升26%,GPU吞吐量提升11倍。

Comments 30 pages, 12 figures. Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04424 2026-06-19 cs.CV 版本更新 57%

Composed Object Retrieval: Object-level Retrieval via Composed Expressions

组合对象检索:通过组合表达式进行对象级检索

Tong Wang, Guanyu Yang, Nian Liu, Zongyan Han, Jinxing Zhou, Salman Khan, Fahad Shahbaz Khan

机构 * Key Laboratory of New Generation Artificial Intelligence Technology and Its Interdisciplinary Applications, Southeast University, Ministry of Education, Jiangsu, China(新一代人工智能技术及跨学科应用国家重点实验室,东南大学,教育部,江苏,中国) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI), Abu Dhabi, UAE(穆罕默德·本·扎耶德人工智能大学(MBZUAI),阿布扎赫德,阿联酋)

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 提出组合对象检索(COR)任务,通过组合参考对象、掩码和检索文本进行对象级检索,并构建COR125K基准和CORE模型,显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03120 2026-06-17 cs.CV cs.RO 版本更新 57%

SCC-Loc: A Unified Semantic Cascade Consensus Framework for UAV Thermal Geo-Localization

SCC-Loc: 无人机热红外地理定位的统一语义级联共识框架

Xiaoran Zhang, Yu Liu, Jinyu Liang, Kangqiushi Li, Zhiwei Huang, Huaxin Xiao

机构 * College of Systems Engineering, National University of Defense Technology(系统工程学院,国防科技大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CV

AI总结 提出SCC-Loc框架,通过共享DINOv2骨干网络、语义引导视口对齐、级联空间自适应纹理结构滤波和共识驱动可靠性感知位置选择,解决热红外-可见光模态差异导致的特征模糊问题,实现零样本高精度绝对位置估计,平均定位误差9.37米。

Comments 17 pages, 5 figures. Submitted to IEEE J-STARS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22777 2026-06-16 cs.CL 版本更新 57%

RASST: Retrieval-Augmented Simultaneous Speech Translation

RASST:检索增强的同声传译

Jiaxuan Luo, Siqi Ouyang, Jiaxing Xu, Lei Li

机构 * Johns Hopkins University(约翰霍普金斯大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 跨模态检索 :cross-modal(abstract);分类 cs.CL

AI总结 针对同声传译中罕见术语翻译不准的问题,提出检索增强方法RASST,通过轻量级语音-文本检索器提供分块术语提示,并合成训练数据教会模型何时应用检索术语,在ACL 60/60和ESO测试集上术语准确率提升近40%,BLEU提升最多3点。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08505 2026-06-12 cs.LG cs.AI 版本更新 57%

Echo2ECG: Enhancing ECG Representations with Cardiac Morphology from Multi-View Echos

Echo2ECG:利用多视角超声心动图的心脏形态增强心电图表示

Michelle Espranita Liman, Özgün Turgut, Alexander Müller, Eimo Martens, Daniel Rueckert, Philip Müller

机构 * Chair for AI in Healthcare and Medicine, Technical University of Munich (TUM) and TUM University Hospital(人工智能在医疗与医学中的中心,慕尼黑技术大学(TUM)和慕尼黑大学医院) Department of Cardiology, TUM University Hospital(心血管科,慕尼黑大学医院) Department of Computing, Imperial College London(计算系,伦敦帝国理工学院) Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心(MCML))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 提出Echo2ECG多模态自监督学习框架,通过多视角超声心动图丰富心电图表示,在结构表型分类和超声检索任务上优于现有方法,模型大小仅为最大基线的1/18。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08304 2026-06-09 cs.CR cs.AI 版本更新 57%

Securing Retrieval-Augmented Generation: A Taxonomy of Attacks, Defenses, and Future Directions

保障检索增强生成:攻击、防御与未来方向的分类法

Yuming Xu, Mingtao Zhang, Zhuohan Ge, Haoyang Li, Nicole Hu, Yongqi Zhang, Zhiyuan Wen, Jason Chen Zhang, Qing Li, Lei Chen

机构 * The Hong Kong Polytechnic University(香港理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

专题命中 跨模态检索 :multimodal(abstract);分类 cs.AI

AI总结 本文提出SLOT分类法,从攻击面、防御层、目标(遵循CIA属性)和攻击目标四个维度系统化梳理检索增强生成(RAG)的安全风险与防御,并指出知识访问管道中的结构性错配,最后展望未来方向。

Comments We have curated a paper list on RAG security in https://github.com/TreeAI-Lab/Awesome-RAG-Security, and we warmly welcome authors who wish to have their new work included to contact us via email

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28895 2026-08-17 cs.IR 版本更新 50%

LLM-Based Generative Retrieval for Snapchat Content Recommendation

基于大语言模型的生成式检索用于Snapchat内容推荐

Liam Collins, Jiwen Ren, Donald Loveland, Bhuvesh Kumar, Clark Mingxuan Ju, Xuan Guo, Mo Li, Alvin Hou, Yi Cui, Peng Yang, Jian Wang, Saud Afzal Shafi, Nga Than, Ruiming Lu, Wenfeng Zhuo, Dongheng Li, Lili Zhang, Mingtao Zhang, Jinchao Ye, Vincent Xue, Chunhui Zhu, Neil Shah

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究针对将预训练LLM转化为生成式检索器的挑战,设计了SnapLGR系统,通过三项核心优化实现了Snapchat短视频推荐效果的提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11973 2026-08-14 cs.IR 版本更新 50%

Sci-Surf: Navigating Scientific Literature Discovery through Human Feedback and Intelligent Summarization

Sci-Surf:通过人类反馈与智能摘要实现科学文献发现

Fang Guo, Qi Zhu, Rongcan Pei, Shuqi He, Hui Chen, Yue Zhang

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 针对现有学术发现平台支持不足的问题,提出以意图为中心的Sci-Surf系统,结合反馈驱动推荐与多模态论文消化,经评估推荐质量和消化质量有可测量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10202 2026-07-30 q-bio.QM 版本更新 50%

Robust and Generalizable Atrial Fibrillation Detection from ECG Using Time-Frequency Fusion and Supervised Contrastive Learning

基于时频融合与监督对比学习的ECG心房颤动鲁棒检测方法

Hongtao Li, Jia Wei, Jia Xiao, Yuanjun Lai, Mingyang Liu, Shuzhen Lv, Xueqiang Ouyang

专题命中 跨模态检索 :cross-modal(abstract)

AI总结 本文提出一种结合时频融合与监督对比学习的ECG心房颤动检测方法,通过双向门控模块和跨模态学习策略提升模型鲁棒性和跨数据集泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16360 2026-07-24 cs.DB 版本更新 50%

Fast Approximate Vector Joins via Offline-Online Co-Design

高效近似阈值向量连接的协作与卸载

Kyoungmin Kim, Lennart Roth, Liang Liang, Anastasia Ailamaki

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出统一框架提升向量连接效率,通过软协作复用遍历结果、构建合并索引加速图探索,并采用自适应混合搜索策略增强鲁棒性,实验显示在效率-召回率权衡上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16318 2026-07-24 cs.LG 版本更新 50%

Semantics at an Angle: When Cosine Similarity Works Until It Doesn't

角度语义:余弦相似度何时有效及失效

Kisung You

机构 * Baruch College, City University of New York(纽约城市大学巴克莱学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究探讨余弦相似度在信息处理等领域的应用,围绕其有用性取决于学习表示等因素展开,推导几何恒等式,区分失效机制,回顾证据并描述替代方法,得出其正尺度不变性有条件合理的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05353 2026-07-21 cs.LG cs.IT math.IT 版本更新 50%

GlyRAG: Context-Aware Retrieval-Augmented Framework for Blood Glucose Forecasting

GlyRAG:用于血糖预测的上下文感知检索增强框架

Shovito Barua Soumma, Hassan Ghasemzadeh

机构 * College of Health Solutions, Arizona State University(亚利桑那州立大学健康解决方案学院) School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 研究旨在利用连续血糖监测数据进行准确血糖预测,开发了GlyRAG框架,结合大语言模型提取上下文信息并通过检索增强预测,在OhioT1DM和AZT1D数据集上评估,显著提高长期预测的均方根误差,多数预测落在临床可接受区域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01506 2026-07-15 cs.LG 版本更新 50%

Beyond Logit Adjustment: A Residual Decomposition Framework for Long-Tailed Reranking

超越Logit调整:一种用于长尾重排的残差分解框架

Zhanliang Wang, Hongzhuo Chen, Quan Minh Nguyen, Mian Umair Ahsan, Kai Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) Children’s Hospital of Philadelphia(费城儿童医院)

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出残差分解框架,用于解决长尾分类中频繁类与稀有类的排序问题,通过分析残差分解的类内和类间组件,提出REPAIR方法以提升重排性能。

Comments Accepted into COLM 2026

Journal ref CONFERENCE ON LANGUAGE MODELING CONFERENCE ON LANGUAGE MODELING Third Conference on Language Modeling (COLM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22916 2026-07-10 cs.IR 版本更新 50%

GateSID: Adaptive Gating for Balancing Semantic and Collaborative Signals in Recommendation

GateSID: 语义协作对齐中的冷启动推荐自适应门控

Hai Zhu, Yantao Yu, Lei Shen, Bing Wang, Xiaoyi Zeng

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文提出GateSID框架,通过自适应门控网络动态平衡语义与协同信号,提升冷启动推荐性能,实验显示其在GMV、CTR和订单量上均有显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08630 2026-07-09 cs.HC 版本更新 50%

Sycamore: Characterizing Synthetic Personas for Evaluating Genomics Visualization Retrieval

Sycamore:用于评估基因组可视化检索的合成身份表征

Huyen N. Nguyen, Astrid van den Brandt, Nils Gehlenborg

专题命中 跨模态检索 :multimodal(abstract)

AI总结 Sycamore通过三种条件探针设计评估基因组可视化检索系统,探讨合成身份在真实用户反馈中的表现及影响。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08766 2026-07-03 cs.CR 版本更新 50%

Follow My Eyes: Backdoor Attacks on Goal-Directed Scanpath Prediction

跟随我的眼睛:基于VLM的扫视路径预测的后门攻击

Diana Romero, Mutahar Ali, Momin Ahmad Khan, Habiba Farrukh, Fatima Anwar, Salma Elmalaki

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文首次研究了针对基于VLM的扫视路径预测的后门攻击,通过设计两种可变输出攻击方法,展示了如何在不同触发模式下绕过检测,验证了边缘部署系统的实际威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16689 2026-06-23 eess.SP cs.NI 版本更新 50%

Against the Monolithic Wireless World Model: Why NextG Needs Composable and Agentic Intelligence

反对单一无线世界模型:为什么NextG需要可组合和代理智能

Aladin Djuhera, Farhan Ahmed, Vlad C. Andrei, Swanand Ravindra Kadhe, Alecio Binotto, Haris Gacanin, Holger Boche

专题命中 跨模态检索 :multimodal(abstract)

AI总结 本文指出无线领域缺乏等同于LLM的数据基础,主张采用可组合和代理智能架构以实现可部署的AI原生网络。

Journal ref ICML 2026 Workshop on AI and ML for NextG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07013 2026-06-09 stat.ML cs.LG 版本更新 50%

Conditional Normalizing Flows for Forward and Backward Joint State and Parameter Estimation

条件归一化流用于前向和后向联合状态与参数估计

Luke S. Lagunowich, Guoxiang Grayson Tong, Daniele E. Schiavazzi

机构 * Department of Computer Science and Engineering University of Notre Dame(计算机科学与工程系诺特达姆大学) Department of Pediatrics Stanford University(儿科系斯坦福大学) Department of Applied and Computational Mathematics and Statistics University of Notre Dame(应用与计算数学与统计系诺特达姆大学)

专题命中 跨模态检索 :multi-modal(abstract)

AI总结 针对非线性非高斯系统,提出基于条件归一化流的状态滤波方法,结合MLP、Transformer或Mamba-SSM生成条件嵌入,并引入最优传输动力学损失缓解过参数化,在自动驾驶和COVID-19联合估计中验证有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏