arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-06 至 2026-08-06 共收录 54 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 3 篇

2608.04302 2026-08-06 cs.CV cs.IR cs.MM 新提交 66%

CLIP-CC-Bench: Evaluating Paragraph-Level Video Descriptions in Video-Language Models

CLIP-CC-Bench:评估视频语言模型中的段落级视频描述

Mukhtiar Ali, Harsh Dubey, Sugam Mishra, Chulwoo Pack

机构 * South Dakota State University(南达科他州立大学)

专题命中 图文多模态 :multimodal(abstract,comments);分类 cs.CV、cs.MM

AI总结 CLIP-CC-Bench是针对视频语言模型的长篇段落级视频描述评估套件,采用多LLM嵌入模型集成与粗细粒度语义匹配方法,评估17种模型填补了现有短片段基准的空白。

Comments Accepted and presented at EvalMG 2026, the Second Workshop on Evaluation for Multimodal Generation, co-located with ACM SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04504 2026-08-06 cs.CV cs.AI 新提交 62%

GeoReward: Mitigating Contextual Variable Overestimation in Vision-Language Models for Cross-Market Preference Prediction

GeoReward:缓解跨市场偏好预测的视觉语言模型中的上下文变量高估问题

Shuo Liu, Huixiang Cai, Weiru Zhang, Xiaoyi Zeng

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究针对视觉语言模型的上下文变量高估问题,提出GeoReward奖励模型,通过三种机制缓解该偏差,在跨市场广告偏好预测任务中性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04509 2026-08-06 cs.AI 新提交 57%

CARGO-VL: Counterfactual Arbitration with Risk-Constrained Group Optimization for Vision-Language Models

CARGO-VL:面向视觉-语言模型的风险约束组优化反事实仲裁方法

De Jiang, Zhengyang Zhang, Kehong Yuan, Shaohua Ma

专题命中 图文多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出CARGO-VL框架,结合XMC资源,通过组相对优化及原对偶控制器,提升视觉-语言模型的反事实仲裁性能,在多基准上优于逐点基线。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 4 篇

2608.04798 2026-08-06 cs.HC 新提交 78%

Reference-Based Manipulation: A Framework and Pipeline for Multimodal Spatial Reasoning

基于参考的操作:多模态空间推理的框架与流程

Yangyang He, Zhuangze Hou, Yonglin Chen, Can Liu

专题命中 音频语音多模态 :multimodal(title,abstract)

AI总结 本研究针对沉浸式平台中多模态空间交互问题,提出基于参考的操作框架,分解空间参考为源、锚点、框架组件,实现LLM驱动的流程并验证其效用,为空间交互设计提供关键经验。

Comments 16 pages, 10 figures. Accepted to the 39th Annual ACM Symposium on User Interface Software and Technology (UIST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04224 2026-08-06 cs.CV 新提交 77%

OmniVR: Joint Video-Audio Conditional Generation for Restoring Degraded Historical Films

OmniVR:用于恢复退化历史影片的联合视频-音频条件生成模型

Xin Lu, Zihao Fan, Mingchen Zhong, Jie Huang, Xueyang Fu, Zheng-Jun Zha

机构 * University of Science and Technology of China(中国科学技术大学) JD Explore Academy(京东探索研究院)

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 提出首个联合音视频生成修复模型OmniVR,通过三项关键设计解决历史影片的音视频共同退化问题,在多类指标上超越现有方法,还发布了相关基准OmniVRBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04709 2026-08-06 cs.CL 新提交 70%

EmpaAva: An Open-source Agentic 3D-Avatar Empathetic Live Chatbot

EmpaAva:开源智能体式3D化身共情实时聊天机器人

Jie Yang, Wenhao Xu, Shuhui Lin, Hao Fei

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Oxford(牛津大学)

专题命中 音频语音多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CL

AI总结 该研究提出首个开源智能体式3D化身共情聊天机器人EmpaAva,通过三智能体架构实现闭环多模态交互,在评估中优于多款基准模型,将开源并提供在线演示。

Comments Project&Demo: https://empaava.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04351 2026-08-06 cs.SD cs.AI 新提交 70%

HyPASE: Hyperbolic Geometry for Parameter-Efficient Speech Emotion Fine-Tuning Framework for Large Audio-Language Models

HyPASE:用于大音频语言模型的参数高效语音情感微调框架的双曲几何方法

Tian Jin, Ruikang Zhang, Zefeng Zhao, Ding Luo, Jin Zeng

机构 * Tongji University(同济大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 音频语音多模态 :cross-modal(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出HyPASE双曲PEFT框架,利用庞加莱球模型及HGA、EMCA组件,在MELD、IEMOCAP等数据集上优于欧氏PEFT基线,实现高效的大音频语言模型语音情感微调。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 9 篇

2608.04515 2026-08-06 cs.CV cs.AI cs.CL 新提交 80%

CARVE: Cross-Slice Anisotropic Reallocation of Visual Evidence for Efficient 3D Medical Volume Understanding

CARVE:用于高效3D医学体积理解的视觉证据跨切片各向异性重分配

Zhenyu Yi, Qiang Hu, Zhenhao Li, Jiaxuan Zhao, Yusong Sun, Lichi Zhang

专题命中 视频多模态 :MLLM(summary_cn,abstract_cn);分类 cs.CV、cs.CL、cs.AI

AI总结 针对3D医学体积理解中切片式MLLM的视觉令牌冗余问题,提出无需训练的CARVE框架,通过跨切片各向异性重分配压缩80%令牌,在AMOS-MM等基准上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04368 2026-08-06 cs.LG 新提交 78%

EvtGraph: Event-Adaptive Compression for Sparse Temporal Graph Learning in Multimodal Time Series

EvtGraph:面向多模态时间序列稀疏时序图学习的事件自适应压缩方法

Ziqian Wang, Tingxiong Xiao, Yuxiao Cheng, Jinli Suo

机构 * Tsinghua University(清华大学)

专题命中 视频多模态 :multimodal(title,abstract)

AI总结 本研究针对多模态时序数据均匀离散化效率低的问题,提出EvtGraph框架,通过事件自适应压缩等技术实现预算约束下的高效图学习,在多模态临床等基准上性能优于基线且效率显著提升。

Comments 9 page, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04902 2026-08-06 cs.CV cs.LG cs.SD 新提交 70%

Visual Representation Matters: Exploiting Temporal Differences in Video-to-Audio Generation

视觉表示很重要:利用视频到音频生成中的时间差异

Zehua Chen, Junyou Wang, Yuxuan Jiang, Zhenying Fang, Yusheng Dai, Jianfei Chen, Ziwei Liu, Jun Zhu

专题命中 视频多模态 :multimodal(abstract);audio-visual(abstract);分类 cs.CV

AI总结 针对现有基于条件扩散的视频到音频(V2A)生成方法需额外网络或强归纳偏置的问题,提出TD-V2A框架,利用时间差异(TD)增强视觉条件,提升了V2A生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04589 2026-08-06 cs.CV cs.AI 新提交 62%

The First EgoCross Challenge at EgoVis 2026: Cross-Domain Egocentric Video Question Answering

2026年EgoVis首届EgoCross挑战赛:跨域自我中心视频问答

Yuqian Fu, Tianwen Qian, Yanjun Li, Yu Li, Kunyu Peng, Xu Zheng, Yongqin Xian, Alessio Tonioni, Yanwei Fu, Xiaoling Wang, Danda Paudel, Federico Tombari, Luc Van Gool, Leyi Wu, Yifan Zhao, Jinjie Zhang, Yinchuan Li, Yingcong Chen, Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie, Takuya Murakawa, Toru Tamaki, Yi Wen, Zhenglin Du, Zhengyang Li, Lingling Li, Licheng Jiao, Wenping Ma

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文介绍2026年EgoVis研讨会举办的首届EgoCross跨域自我中心视频问答挑战赛,含两个赛道,共获1500余份提交,公布结果与获胜方案,资源公开以推进相关研究。

Comments 1st EgoCross challenge @ EgoVis workshop, CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04426 2026-08-06 cs.CV cs.CL 新提交 62%

Predict, Then Retrieve: Cross-Instance Future-State Retrieval from Video Prefixes

预测再检索:从视频前缀中进行跨实例未来状态检索

Quynh Vo, Thong Nguyen, Vinh-Hien Do, Cong-Duy Nguyen, Anh-Tuan Luu

机构 * Centre for AI Research, VinUniversity(VinUniversity人工智能研究中心) National University of Singapore(新加坡国立大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 该研究提出PSR任务,构建含多数据集的基准,提出LFTR模型,发现预测而非感知是核心挑战,LFTR缩小差距且成本低,相关资源已公开。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04124 2026-08-06 cs.CV cs.AI 新提交 62%

Perception Before Reasoning: Dynamic Latent Reasoning for Video Understanding and Question Answering

推理前的感知:面向视频理解与问答的动态隐式推理

Haotian Xia, Zilin Xiao, Junbo Zou, Vicente Ordonez, Hanjie Chen

机构 * Rice University(莱斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视频问答现有方法依赖长文本思维链的问题,提出DyLaR模型,通过动态调整感知与推理隐式变量的使用,在9个视频基准上提升准确率且缩短响应长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04939 2026-08-06 cs.CL 新提交 57%

Reading Between the Frames: Interpreting Implicit and Non-literal Meaning in Social Media Videos

帧间解读:社交媒体视频中隐含与非字面意义的理解

Yang Wang, Yanan Ma, Yiqi Liu, Zi Yan Chang, Chi-Li Chen, Chia-Yi Hsiao, Tyler Loakman, Aline Villavicencio, Chenghao Xiao, Chenghua Lin

机构 * University of Manchester(曼彻斯特大学) Durham University(杜伦大学) University of Sheffield(谢菲尔德大学) University of Exeter(埃克塞特大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CL

AI总结 本文提出DrivelHub+基准,评估视频-语言模型推断社交媒体视频隐含意义的能力,从解释和表征两方面开展实验,衡量模型多模态感知与语用理解的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04587 2026-08-06 cs.CV 新提交 57%

MetaVideoAgent: Automated Video-Agent Evolution for Long-Form Video Understanding

MetaVideoAgent:面向长视频理解的自动视频智能体进化框架

Benlei Cui, Ruize Wang, Junjie Li, Jinhao Chen, Longtao Huang, Yinghao Chen, Yuwen Zhai, Jingqun Tang, Ruijian Jia, Weiwei Wu, Pengfei Sun, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Zhejiang University(浙江大学) Beihang University(北京航空航天大学) ByteDance(字节跳动)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 MetaVideoAgent是自动进化视频智能体的框架,在VA-EvoBench上经4次迭代后将宏平均准确率从38.44%提至51.47%,性能优于现有最优固定设计智能体且成本更低。

Comments 16 pages, 7 figures. Code: https://github.com/Alibaba-VELLDEPTH/MetaVideoAgent

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04130 2026-08-06 cs.CV 新提交 57%

Radar4D-VLM: Proposal-Grounded Temporal 4D Radar Reasoning Across Frozen Language Models

Radar4D-VLM:基于提议的跨冻结语言模型的时序4D雷达推理

Jiaju Han, Xuemeng Sun, Qike Zhang, Xiang Chen, Luwei Yang, Jiahuan Long, Yiwei Wei, Jiujiang Guo, Chengyin Hu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出仅用雷达的时序视觉-语言模型Radar4D-VLM,结合提议的时序目标标记等,在K-Radar验证集上表现优异,且雷达标记接口兼容多款冻结语言骨干,为雷达多模态推理奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 4 篇

2608.04052 2026-08-06 cs.CR cs.CV cs.LG 新提交 83%

When Modalities Fail to Tango: Conformal Backdoor Detection in Multimodal Contrastive Learning

当模态无法“共舞”:多模态对比学习中的共形后门检测

Yiming Chen, Kemou Li, Haiwei Wu, Jiantao Zhou

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV

AI总结 针对多模态对比学习后门检测方法的缺陷,提出CASCADE两阶段共形框架,在CC3M数据集上实现高TPR下低FPR与高AUROC,可应对自适应攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05149 2026-08-06 cs.CV 新提交 57%

CoCo-IR: Contextual Composed Image Retrieval

CoCo-IR:上下文组合图像检索

Shengcao Cao, Tanmaya Shekhar Dabral, Zhongli Ding, Madhuri Shanbhogue, Kaifeng Chen, Zhe Li, Mojtaba Seyedhosseini, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Google DeepMind(谷歌DeepMind) OpenAI

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对现有图像检索系统无法处理多轮交互的局限,提出CoCo-IR任务,构建基于LMM的模型并开发自主数据引擎,在CIRCO和自建CoCo-IR基准上取得最优性能。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04768 2026-08-06 cs.CV 新提交 57%

Embedding Large Language Models into Flow Controls: An Agentic Framework for Adaptive and Trustworthy Automated Cooking

将大语言模型嵌入流程控制:一种用于自适应且可信的自动化烹饪的智能体框架

Zihan Song, Hongwei Huang, Yueshuo Sun, Yonglin Tian, Fei-Yue Wang, Bai Li

专题命中 跨模态检索 :multimodal(abstract);分类 cs.CV

AI总结 针对自动化烹饪机器人的个性化与可信性问题,提出智能体框架,通过多智能体分解需求、分阶段生成执行代码,实验验证其在真实场景中可靠且实用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04489 2026-08-06 quant-ph physics.app-ph physics.chem-ph 新提交 50%

Engineering Nanodiamonds for Quantum Sensing: Material Constraints at the Nanoscale

用于量子传感的纳米金刚石工程:纳米尺度下的材料约束

Ashutosh Rathi, Keisuke Oshimi, Kento Sasaki, Kensuke Kobayashi, Yutaka Shikano, Oliver Benson, Tim Schröder, Shery L. Y. Chang, Masazumi Fujiwara

专题命中 跨模态检索 :multimodal(abstract)

AI总结 该研究聚焦纳米金刚石中氮-空位中心的材料约束机制,提出缓解策略,推动其作为移动量子传感器在生物传感与纳米尺度科学中的可靠应用。

Comments Published in ACS Nano under CC-BY 4.0

Journal ref ACS Nano 20, 17143 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 10 篇

2608.04655 2026-08-06 cs.CV cs.AI 新提交 81%

CSGen: A Multi-Domain Curvilinear Structure Generation Model via Hierarchical Multimodal Diffusion

CSGen:一种基于分层多模态扩散的多领域曲线结构生成模型

Zhe Shan, Ziming Yang, Lei Zhou, Wenwen Zhang, Cong Lin, Xia Xie

机构 * Hainan University(海南大学) Guangdong Ocean University(广东海洋大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 该研究针对可控曲线结构图像生成的挑战,提出CSGen模型,通过构建多领域数据集、分层渐进控制策略与稀疏感知损失机制,提升生成图像的结构精度与下游分割性能,为曲线结构分析提供新范式。

Comments Accepted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04623 2026-08-06 cs.CV 新提交 79%

Visual Anchoring in Diffusion: Multimodal Zero-Shot Skeleton Action Recognition

扩散模型中的视觉锚定:多模态零样本骨骼动作识别

Zehao Bao, Shujun Guo, Bruce X. B. Yu

机构 * The University of Hong Kong(香港大学) Zhejiang University(浙江大学)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究针对零样本骨骼动作识别中模态融合的问题,提出TDSM-MM模型,通过生成式分类范式结合视觉锚定,在NTU数据集上取得优异零样本识别性能,为零样本学习提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04436 2026-08-06 cs.CV 新提交 79%

ToolArtist: Tool-Using Unified Multimodal Models for Agentic Image Generation

ToolArtist:用于智能体图像生成的工具使用统一多模态模型

Jiahao Zhao, Xiaomin Yu, Zhongxiang Sun, Fengwei Teng, Chengwei Qin, Xiaobin Hu, Jun Xu, Shuicheng Yan

机构 * RUC(中国人民大学) HKUST(GZ)(香港科技大学(广州)) NUS(新加坡国立大学) UCD(加州大学戴维斯分校)

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出ToolArtist,一种全智能体图像生成模型,通过后训练UMM实现,采用RAD-GRPO方法优化,将完整开放世界图像生成过程置于智能体控制下,性能优于部分控制方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04071 2026-08-06 cs.AI 新提交 79%

Monte Carlo Tree Search for Table-to-Multimodal Report Generation

面向表格到多模态报告生成的蒙特卡洛树搜索

Teng Lin, Zhiyang Zhang, Yuyu Luo, Nan Tang

专题命中 多模态生成 :multimodal(title,abstract);分类 cs.AI

AI总结 针对表格到多模态报告生成的现有方法缺陷,本文提出基于MCTS的MCTS-Report框架,通过分解原子动作与多维奖励函数优化,在自建的MMRBench基准上取得优于基线的77.9总体得分。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04374 2026-08-06 cs.CL cs.AI 新提交 62%

FinReportBench: Measuring and Improving Institution-Grade Financial Report Generation

FinReportBench:衡量与提升机构级财务报告生成能力

Yinghao Tang, Tan Zhenwei, Yiyao Wang, Wanli Gu, Xiaolu Zhang, Jun Zhou, Wei Chen

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FinReportBench基准,发现大型语言模型生成机构级财务报告的瓶颈在于报告身份认同与机构完整性,通过基准引导的技能蒸馏可显著提升模型相关指标。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04622 2026-08-06 cs.CV 新提交 57%

DAC-Pose: Dual-Agent Collaborative Framework for Pose-Guided Human Generation

DAC-Pose:用于姿态引导人体生成的双智能体协作框架

Haotian Yang, Zhile Yang, Huiyu Zhou, Xin Sun

机构 * Faculty of Data Science, City University of Macau(澳门城市大学数据科学学院) Shenzhen University of Advanced Technology(深圳理工大学) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) School of Computing and Mathematical Sciences, University of Leicester(莱斯特大学计算与数学科学学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对姿态引导人体生成在剧烈视角变化下的视觉伪影问题,提出双智能体协作框架DAC-Pose,通过PSR与DAVE智能体的反馈循环实现高保真合成,在DeepFashion和Market-1501基准上验证了其优越性。

Comments Code is available at DAC-Pose" target="_blank" rel="noopener">https://github.com/AIVRC/DAC-Pose

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04525 2026-08-06 cs.CV 新提交 57%

Coupled Continuous-Discrete Generation for Scene Text Image Super-Resolution

面向场景文本图像超分辨率的耦合连续-离散生成方法

Axi Niu, Knag Zhang, Qingsen Yan, Hao Jin, Jinqiu Sun, Yanning Zhang

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 针对现有场景文本图像超分辨率(STISR)方法误差传播、成本高的问题,提出统一框架DualTSR,通过耦合连续-离散生成实现高效准确的STISR,在多数据集上表现优于对比方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04510 2026-08-06 cs.RO cs.AI 新提交 57%

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

GUARD:面向扩散型视觉-语言动作(VLA)的不确定性与基于消融的风险检测

Suhas Hegde, Jitendra Yasaswi Bharadwaj Katta

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出GUARD方法,无需修改预训练扩散型VLA策略即可检测其故障,在多基准测试中提升未见过任务的ROC-AUC,提供可跨多维度迁移的故障信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04314 2026-08-06 cs.CR cs.CV 新提交 57%

Adversarial Attacks for Good: A Survey of Proactive Protection across the Visual Content Lifecycle

用于良性目的的对抗性攻击:视觉内容全生命周期主动保护综述

Jiaming Zhang, Boyang Chen, Zherui Li, Fuyao Zhang, Xinyu Yan, Hong Xi Tae, Wenwen He, Xuan Wang, Siqi Guo, Junhao Dong, Kun Wang, Hanxun Huang, Yige Li, Xingjun Ma, Yang Cao, Lingjuan Lyu, Wei Yang Bryan Lim

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 本综述研究了视觉内容全生命周期中用于主动保护的“良性对抗性攻击”范式,涵盖五类方法并评估其特性,同时指出当前保护措施的不足与未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04475 2026-08-06 cs.HC 新提交 50%

Super-Gaussian: Interactive Scene Editing for 3D Gaussian Splatting and NLI-Based Volume Visualization in Virtual Reality

超高斯:虚拟现实中面向三维高斯溅射与基于自然语言交互的体可视化的交互式场景编辑

Suemin Jeon, Kaiyuan Tang, Chaoli Wang, Won-Ki Jeong

专题命中 多模态生成 :multimodal(abstract)

AI总结 本研究针对VR中体可视化的渲染成本与交互问题,提出Super-Gaussian框架,结合三维高斯溅射、特征感知聚类、分层选择-细化工作流与NLI,实现高效直观的体数据交互编辑与分析

Comments IEEE VIS 2026 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏