arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 3020 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 其他多模态 196 篇

2608.17447 2026-08-19 cs.CV 新提交 57%

NGS-Marker: Robust Native Watermarking for 3D Gaussian Splatting

NGS-Marker:面向3D高斯溅射(3DGS)的鲁棒原生水印

Hao Qin, Yukai Sun, Luyuan Chen, Mengxu Lu, Feng Zhang, Ming Kong, Zhenhong Du, Qiang Zhu

机构 * Zhejiang University(浙江大学) Zhejiang Key Laboratory of Geographic Information Science(浙江省地理信息科学重点实验室)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 该研究针对现有3D高斯溅射水印技术无法抵御部分侵权的问题,提出NGS-Marker原生水印框架,通过联合训练的注入器与解码器及梯度渐进注入策略实现全场景覆盖,可抵御部分侵权并支持混合与多模态水印,具备实际部署灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15115 2026-08-18 cs.CV 新提交 57%

Perspective-Invariant Attack with Enhanced Transferability of Adversarial Examples

具有增强对抗样本迁移性的视角不变攻击

Kaisheng Liang, Yiming Cao, Bin Xiao

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对对抗样本跨模型迁移性带来的安全威胁,提出视角不变攻击(PIA)及其扩展PIA-Mix,通过多自由度顶点采样策略提升对抗样本迁移性,实验显示其性能优于当前最优基于迁移的攻击方法。

Journal ref IEEE Transactions on Information Forensics and Security, vol. 21, pp. 6818-6831, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14306 2026-08-17 cs.AI cs.SY eess.SY 新提交 57%

Sensor-Driven Mission Synthesis for UAV/UGV Swarms: A TB-CSPN Coordination Architecture with Hardware-Enforced Safety

传感器驱动的无人机/无人车集群任务合成:具备硬件强制安全保障的TB-CSPN协同架构

Uwe M. Borghoff, Paolo Bottoni, Remo Pareschi

机构 * Institute for Software Technology, University of the Bundeswehr Munich(慕尼黑联邦国防军大学软件技术研究所) Department of Computer Science, Sapienza University of Rome(罗马大学计算机科学系) SofTware And Knowledge Engineering Lab(软件与知识工程实验室)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文提出一种具备硬件强制安全保障的TB-CSPN协同架构,用于异构无人机/无人车集群,结合多模态传感器观测,通过顾问与监督智能体实现可审计的决策路径,提升对抗环境下的韧性,经沿海监视案例验证其有效性。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10434 2026-08-12 cs.AI 新提交 57%

Conversational versus Dashboard Explainable AI for UAV Intrusion Detection: An Empirical Study of Operator Trust and Reliance

无人机入侵检测中对话式与仪表盘式可解释人工智能:操作员信任与依赖的实证研究

Cong Chi Nguyen, Trang Mai Xuan, Vu-Duc Ngo, Kim-Ngan Thi Nguyen, Trong-Nghia Nguyen, Thien Van Luong

机构 * Phenikaa University(菲卡大学) Phenikaa School of Computing(菲卡计算机学院) MobiFone Corporation(MobiFone集团) MobiFone HighTech Center(MobiFone高科技中心) National Economics University(国民经济大学) College of Technology(技术学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究对比对话式与仪表盘式XAI界面对无人机入侵检测操作员信任和依赖的影响,发现对话式界面可用性更高但易引发过度依赖,为未来XAI系统设计提供启示。

Comments 12 pages, 3 figures, EIDT conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10203 2026-08-12 cs.CV 新提交 57%

A Convolutional Layer Activation Dimensionality Reduction for Out-of-Distribution and Adversarial Attack Detection Methods

用于分布外样本与对抗攻击检测方法的卷积层激活降维技术

Leandro de Souza Rosa, Lorenzo Capelli, Clara Nunes Barrancos, Mauro Mangia, Riccardo Rovatti

机构 * Alma Mater Studiorum Università di Bologna(博洛尼亚大学) Advanced Research Center on Electronic Systems “Ercole De Castro” (ARCES) - Alma Mater Studiorum Università di Bologna(博洛尼亚大学“埃尔科莱·德·卡斯特罗”电子系统高级研究中心)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 本文针对卷积层激活降维的不足,提出一种可控高压缩率的新型降维方法,扩展两种最先进的检测方法并在OOD与对抗攻击检测任务上验证,其性能更优且计算内存占用更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06758 2026-08-10 cs.CL 新提交 57%

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader: Structured Document Parsing via Capability Injection and Forgetting Control

Stockmark-Nemotron-3-Nano-Omni-JapanDocReader:基于能力注入与遗忘控制的结构化文档解析模型

Shi Chen, Hayato Aida, Makoto Morinaga, Shohei Tanaka, Kosuke Arima

机构 * Stockmark Inc.(斯托克马克公司)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 本研究提出Stockmark-Nemotron-3-Nano-Omni-JapanDocReader模型,通过能力注入与遗忘控制优化结构化文档解析性能,结合混合SFT与DAPO式RL取得优于SFT的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05684 2026-08-07 cs.RO cs.AI cs.LG cs.SY eess.SY 新提交 57%

Nonvisual Classification of Ground-Condition by Artificial Proprioception in an Amoeba-Inspired Autonomous Walking Robot

变形虫启发的自主步行机器人中基于人工本体感觉的地面状况非视觉分类

Hyoto Yamaguchi, Zenji Yatabe, Seiya Kasai

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究为变形虫启发的自主步行机器人,整合传感器与储备池计算实现人工本体感觉,完成地面状况非视觉分类,可依地面切换步态并分析传感器贡献。

Comments 5 pages, 7 figures, The paper has been submitted to IEEE SCIS ISIS 2026 for consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04930 2026-08-06 cs.LG cs.AI 新提交 57%

SVI-DAG: A Structured Variational Inference Approach to Bayesian Causal Discovery

SVI-DAG:一种用于贝叶斯因果发现的结构化变分推断方法

Shrenik Zinage

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 SVI-DAG是一种贝叶斯因果发现的结构化变分推断方法,用归一化流建模边依赖、斯坦变分梯度下降优化,在不确定性量化上优于5种现有方法,结构准确性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02955 2026-08-05 cs.HC cs.AI cs.CY eess.IV 新提交 57%

Chat Debugging: An Exploratory Study of Human-AI Collaboration to Debug Analog Circuits

聊天调试:人机协作调试模拟电路的探索性研究

John Hu, Andrew Ash

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 该研究通过分析本科生与开源大型语言模型(LLMs)协作调试模拟电路的聊天记录,揭示了人机协作调试的模式、LLMs的优势与不足及学生的技能短板,为优化人机协作调试提供了依据。

Comments This is the accepted version of a paper to be presented at the 2026 IEEE Frontiers in Education Conference (FIE). The final version will be available via IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01112 2026-08-04 cs.AI 新提交 57%

Fighting Fire with Fire: On the Feasibility of Protecting Exercises Against AI Cheating

以毒攻毒:利用对抗机器学习保护练习题抵御AI作弊的可行性研究

Tobias Braun, Jonas Grebe, Louis Rethfeld, Marcus Rohrbach

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究探究利用对抗机器学习,通过在多模态选择题视觉组件添加扰动引导AI作弊者给出固定错误答案,再以统计检验检测作弊,以保护教育练习题抵御AI作弊的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00743 2026-08-04 cs.CV 新提交 57%

LUT: Latent Utility Training for Visual Reasoning

LUT:用于视觉推理的隐式效用训练

Jiaxuan Kang, Siyu Chen, Mingda Li, Mingjie Liu, Tianyue Wang, Zhaoyang Wei, Yongheng Zhang, Yanchao Hao, Zheng Wei

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出仅用标准VQA对训练的LUT框架,通过轨迹和步骤层面的隐式效用优化,在感知密集型视觉推理基准上性能优于现有隐式推理方法,且标注成本更低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29278 2026-08-03 cs.CV 新提交 57%

Training-Free Entity-Level Few-Shot Segmentation of Remote Sensing Images with Advection Refinement

基于平流优化的遥感图像无训练实体级小样本分割

Xueting Bai, Huan Ni

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 该研究针对现有跨域小样本分割方法训练成本高、预测结果碎片化的问题,提出一种基于平流优化的无训练实体级遥感图像小样本分割框架,可提升 SAM3 的相关适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27428 2026-07-31 physics.med-ph cs.AI 新提交 57%

Rethinking Artificial Intelligence in Medical Imaging: Assumptions, Reality, and Reframing

重新思考医学影像中的人工智能:假设、现实与重构

Arman Rahmim, Nourhan Bayasi, Xiaoxiao Li, Babak Saboury, Fereshteh Yousefirizi

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 本文指出医学影像AI研究转化不足源于结构性错位,明确六大错位维度并提出重构路径,最终愿景是开发与医生对齐、扩展而非替代临床判断的智能体AI。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24806 2026-07-29 q-bio.NC cs.AI 新提交 57%

Decoding Error-Related Potentials under Multisensory Feedback with Varying Congruency

在具有不同一致性的多感官反馈下解码错误相关电位

Yixin Liu, Kang Yin, Hye-Bin Shin, Seong-Whan Lee

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究在多模态视觉、听觉和触觉反馈及可控感官一致性下的ErrP解码挑战,采用基于多分支EEGNet的架构及辅助监督学习策略,经迷宫观察任务实验,该方法在异质感官条件下分类性能一致且准确度提高,提升了ErrP解码稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24113 2026-07-28 cs.RO cs.AI cs.HC 新提交 57%

A Case Study on the Acceptance of a Humanoid Robotic Head Employed in Three Public Spaces

关于在三个公共场所使用的仿人机器人头部接受度的案例研究

Marcel Heisler, Luca Randecker, Christian Becker-Asano

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究仿人机器人头部在公共场所的接受度,通过情感模拟后端处理自然语言生成多模态响应,邀请访客交流。结果显示用户有使用意愿,公共场所更适配,多语言响应受欢迎,但响应时间待改进。

Comments accepted at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026) Kitakyushu, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22734 2026-07-28 cs.CV eess.IV physics.geo-ph 新提交 57%

Fast Fourier Convolutional GAN for 30 m Clear-Sky Land Surface Temperature Gap-Free Reconstruction

用于30米晴空陆地表面温度无间隙重建的快速傅里叶卷积生成对抗网络

Marwa Alfouly, Smajil Halilovic, Nils Bochow, Thomas Hamacher, Niklas Boers, Konrad Schindler

机构 * Technical University of Munich(慕尼黑工业大学) Helmholtz Centre for Polar and Marine Research, Alfred Wegener Institute(亥姆霍兹极地与海洋研究中心阿尔弗雷德·韦格纳研究所) Swiss Federal Institute of Technology Zurich (ETH Zurich)(瑞士联邦理工学院苏黎世分校)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 针对卫星LST数据因云层有间隙、重建难问题,提出多模态快速傅里叶卷积生成对抗网络,利用快速傅里叶卷积实现全局感受野,由卫星观测和SAR数据引导,能恢复大量缺失区域,重建效果好。

Comments 35 pages, 9 figures, Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15442 2026-07-20 cs.AI 新提交 57%

Beyond a Joke: Multi-Angle Reasoning for Detecting and Explaining Harmful Humor in Memes

超越玩笑:用于检测和解释表情包中有害幽默的多角度推理

Shanhong Liu, Pai Chet Ng, De Wen Soh, Malika Meghjani, Konstantinos N. Plataniotis

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究如何检测和解释表情包中有害幽默,提出MAR-12框架,利用视觉语言模型,从十二个角度解读表情包,经注意力机制和原型分类器预测,在多数据集上准确率超现有方法,且能给出有说服力的解释。

Comments Accepted for Publication at AAAI-ICWSM 2027

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15374 2026-07-20 cs.CV 新提交 57%

Reasoning-Guided Part-Level Visual Grounding via Reinforcement Learning

通过强化学习进行推理引导的部件级视觉定位

Kazi Sajeed Mehrab, Hani Alomari, Najibul Haque Sarker, Chia-Wei Tang, Zaber Ibn Abdul Hakim, Anuj Karpatne, Chris Thomas

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究部件级视觉定位难题,提出OP - HRG粗到细推理引导定位策略,先定位父物体再定位部件,经自我检查反思结果,引入部件感知GRPO框架训练,训练的4B模型性能优异且可迁移到推理分割。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11118 2026-07-14 cs.CV 新提交 57%

GHOST: Geometry-Guided Hallucination of Opaque Surface Textures

GHOST:不透明表面纹理的几何引导幻觉

Langxu Zhao, Zuan Gu, Tianhan Gao

机构 * School of Software, Northeastern University, Shenyang, China(软件学院,东北大学,沈阳,中国)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.CV

AI总结 针对透明物体给深度估计和3D重建带来的挑战,提出几何引导预处理框架GHOST,利用视觉基础模型,经多步骤处理分离属性、恢复法线先验并整合多模态线索,合成不透明RGB图像,显著提升相关模型对透明物体的处理精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10068 2026-07-14 cs.LG cs.CV cs.GR 新提交 57%

Error Aware Distribution Prediction for Lightweight Implicit Neural Representations

轻量级隐式神经表示的误差感知分布预测

Zhimin Li, Jake D. Balla, Joshua A. Levine

机构 * Vanderbilt University(范德堡大学) University of Arizona(亚利桑那大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 研究针对隐式神经表示的预测误差问题,提出轻量级方法,将基于回归的INR训练转为分类任务,通过离散连续目标为bins实现灵活分布建模,经分析权衡表明该方法能通过不确定性估计获高重建质量和误差感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06531 2026-07-08 cs.AI cs.LG 新提交 57%

The Large Cancer Assistant (LCA): A Model-Agnostic Orchestration Framework for Scalable Clinical Decision Support in Oncology

大型癌症助手(LCA):用于肿瘤学中可扩展临床决策支持的模型无关编排框架

Ghassen Marrakchi, Basarab Matei

机构 * Ghassen MARRAKCHI(独立研究者) Basarab MATEI(独立研究者)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 研究针对肿瘤学多模态深度学习模型设计局限,提出模型无关的LCA编排框架。利用算法不可渗透原则等方法,经概念验证验证其编排逻辑、算法不可渗透性等,为临床决策支持提供高度适应性基础,利于电子病历互操作性。

Comments 22 pages, 6 figures, 8 tables, 9 appendices, 14 references, Elsevier JBI format

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05911 2026-07-08 cs.CV 新提交 57%

Progressive Reasoning with Primitive Correction for Compositional Zero-Shot Learning

基于原始校正的渐进推理用于组合零样本学习

Ziyi Chen, Haoyan Shi, Sunhan Xu, Congyan Lang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Key Laboratory of Big Data & Artificial Intelligence in Transportation (Ministry of Education)(交通运输大数据与人工智能教育部重点实验室)

专题命中 其他多模态 :MLLM(abstract);分类 cs.CV

AI总结 研究组合零样本学习问题,提出PRPC框架,通过逐步推理明确建模属性和对象间双向依赖性,对原语相互校正,将其公式化为结构化推理过程并结合强化学习后训练,在基准测试中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00272 2026-07-02 cs.RO cs.AI cs.MA 新提交 57%

ASPIRE: Agentic /Skills Discovery for Robotics

ASPIRE: 面向机器人的智能体技能发现

Runyu Lu, Yubo Wu, Ethan Kou, Letian Fu, Wenli Xiao, Ajay Mandlekar, Yinzhen Xu, Guanya Shi, Ken Goldberg, Ang Chen, Mosharaf Chowdhury, Yuke Zhu, Linxi "Jim" Fan, Guanzhi Wang

机构 * NVIDIA(英伟达) UMich(密歇根大学) UIUC(伊利诺伊大学厄巴纳-香槟分校) UC Berkeley(加州大学伯克利分校) CMU(卡内基梅隆大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出ASPIRE系统,通过闭环执行、技能库积累和进化搜索,自主编写和优化机器人控制程序,在扰动、多机器人协作和长时域任务上显著超越现有方法,并实现零样本泛化与仿真到现实的技能迁移。

Comments 43 pages, 12 figures, 9 tables. Project page: https://research.nvidia.com/labs/gear/aspire/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27575 2026-06-29 cs.CV 新提交 57%

Perceptual 3D Simulation With Physical World Modeling

基于物理世界建模的感知3D仿真

Wanhee Lee, Klemen Kotar, Rahul Mysore Venkatesh, Jared Watrous, Daniel L. K. Yamins

机构 * Stanford University(斯坦福大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出P3Sim系统,结合学习型物理世界模型、几何条件模块和持久场景记忆,在部分观测和不完整3D变换信号下模拟未来场景状态,实现多任务泛化。

Comments Published as a conference paper at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27381 2026-06-29 cs.LG cs.AI 新提交 57%

OverFlowLight: Real-Time Gridlock Prevention and Traffic Signal Optimization for Urban Intersections

OverFlowLight:城市交叉口实时防锁死与交通信号优化

Mingyuan Li, Boyang Huang, Tianqi Jiang, Chenpu Li, Chunyu Liu, Yang Li, Ruimin Li, Qiang Wu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) University of Electronic Science and Technology of China(电子科技大学) South China University of Technology(华南理工大学) Beijing Xiaocheng Intelligent Computing(北京小城智能计算) Tsinghua University(清华大学) Lanzhou University(兰州大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 针对城市交通中队列溢出导致级联锁死的问题,提出OverFlowLight框架,利用多模态传感实时检测溢出并动态插入专用相位,结合规则与强化学习混合控制,实际部署43个路口减少60.4%溢出事件并提升18.2%网络吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26485 2026-06-26 cs.CL cs.DL cs.HC cs.IR 新提交 57%

Utilizing Cognitive Signals Generated during Human Reading to Enhance Keyphrase Extraction from Microblogs

利用人类阅读过程中产生的认知信号增强微博关键词抽取

Xinyi Yan, Yingyi Zhang, Chengzhi Zhang

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL

AI总结 研究利用脑电图(EEG)和眼动追踪信号增强微博关键词抽取(AKE),发现EEG特征带来最大性能提升,两种信号部分互补但存在冗余。

Journal ref IPM, 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23771 2026-06-24 eess.SP cs.AI 新提交 57%

Integrated Sensing and Communications for Real-time Avatar Control in XR over 5G

面向5G上XR中实时化身控制的集成感知与通信

Nabeel Nisar Bhat, Javad Sameri, Rreze Halili, Rafael Berkvens, Maria Torres Vega, Jeroen Famaey

机构 * IDLab, University of Antwerp - imec(ID实验室,安特卫普大学 - imec) IDLab, Ghent University - imec(ID实验室,根特大学 - imec) Lighting Technology Lab, KU Leuven(照明技术实验室,鲁汶大学)

专题命中 其他多模态 :multimodal(abstract);分类 cs.AI

AI总结 提出结合5G毫米波ISAC与表面肌电信号的多模态感知架构,实现从身体到手指的多尺度手势识别,支持XR实时化身控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22101 2026-06-23 cs.LG cs.CV 新提交 57%

OphthaDT: Generative Digital Twins for Forecasting Visual Acuity Trajectories in Ophthalmology

OphthaDT:用于眼科视力轨迹预测的生成式数字孪生

Pietro Belligoli, Nikita Makarov, Sayedali Shetab Boushehri, Fabian Schmich, Raul Rodriguez-Esteban, Michael Menden

机构 * Computational Sciences Center of Excellence, Roche, Penzberg, Germany(计算科学卓越中心,罗氏,彭茨贝格,德国) Computational Health Center, Helmholtz Munich, Munich, Germany(计算健康中心,亥姆霍兹慕尼黑,慕尼黑,德国) Department of Biology, Ludwig Maximilian University of Munich, Munich, Germany(生物学系,路德维希-马克西米利安-慕尼黑大学,慕尼黑,德国) Computational Sciences Center of Excellence, Roche, Basel, Switzerland(计算科学卓越中心,罗氏,巴塞尔,瑞士) Department of Biochemistry and Pharmacology, Bio21 Molecular Science and Biotechnology Institute, The University of Melbourne, Parkville, Australia(生物化学与药理学系,Bio21分子科学与生物技术研究所,墨尔本大学,帕克维尔,澳大利亚) Technical University of Munich, Munich, Germany(慕尼黑工业大学,慕尼黑,德国)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出基于LLM的数字孪生OphthaDT,通过序列化纵向患者历史预测最佳矫正视力,在nAMD和DME数据集上分别降低MAE 6.0%和2.6-6.9%,尤其擅长处理高变异性轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20609 2026-06-23 cs.CY cs.AI 新提交 57%

Understanding Privacy by Formalizing It

通过形式化理解隐私

Réka Markovich, Truls Pedersen, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 其他多模态 :multi-modal(abstract);分类 cs.AI

AI总结 本文使用多模态逻辑形式化不同隐私理论及其原则,探讨作为认知权利的隐私权在规范位置理论中的含义。

Comments Published in Proceedings of the 17th International Conference on Juris-informatics, JURISIN 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19258 2026-06-18 cs.CV cs.RO 新提交 57%

CABLE: Cloud-Assisted Bandwidth-efficient LMM-based Encoding for V2X Systems

CABLE: 面向V2X系统的云辅助带宽高效LMM编码框架

Haohua Que, Zhipeng Bao, Qianyi Wu, Handong Yao

机构 * College of Engineering, University of Georgia(佐治亚大学工程学院)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV

AI总结 提出CABLE框架,通过边缘端利用自我运动补偿和残差运动线索传播云分割掩码,生成感兴趣区域(ROI)并仅上传ROI掩码图像,形成掩码-ROI-LMM反馈循环,在五个数据集上实现73-87%的ROI像素覆盖减少和5-8倍LMM预填充加速。

详情

展开后加载摘要…

URL PDF HTML 收藏