arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 4959 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态生成 4959 篇

2508.20275 2026-06-18 cs.LG cs.CL q-bio.QM 57%

A Systematic Review on the Generative AI Applications in Human Medical Genomics

关于生成式AI在人类医学基因组学中的应用系统综述

Anton Changalidis, Yury Barbitoff, Yulia Nasykhova, Andrey Glotov

机构 * Dpt. of Genomic Medicine(基因组医学系) D.O. Ott Research Institute of Obstetrics, Gynaecology, and Reproductology(D.O. Ott妇产科与生殖医学研究所)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 本文系统综述了生成式AI在罕见和常见疾病遗传研究与诊断中的应用,分析了LLM在基因组变异识别、注释及医学影像中的作用,指出其在多模态数据整合和临床应用中的挑战。

Comments 31 pages, 5 figures

Journal ref Frontiers in Genetics 16 (2026) 1694070

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17742 2026-06-17 cs.CV q-bio.NC 新提交 57%

BrainWorld: A Structural-Prior-Conditioned Generative Model for Whole-Brain 4D fMRI Dynamics

BrainWorld:一种用于全脑4D fMRI动力学的结构先验条件生成模型

Junfeng Xia, Wenhao Ye, Junxiang Zhang, Xuanye Pan, Mo Wang, Quanying Liu

机构 * Department of Biomedical Engineering, Southern University of Science and Technology(南方科技大学生物医学工程系) School of Biomedical Engineering, Shenzhen University(深圳大学生物医学工程学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出BrainWorld模型,利用结构MRI作为解剖先验条件,通过去噪过程生成全脑4D fMRI动态,在22个数据集上稳定生成400帧轨迹,并通过生成样本增强提升下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17675 2026-06-17 cs.CV 新提交 57%

Do We Really Need Diffusion? A Fast U-Net for Paired Medical Image Translation

我们真的需要扩散吗?用于配对医学图像翻译的快速U-Net

Alicia Pirwass, Birte Glimm, Michael Munz, Hans-Joachim Wilke

机构 * Institute of Artificial Intelligence, Ulm University(乌尔姆大学人工智能研究所) Institute of Orthopaedic Research and Biomechanics, Centre for Trauma Research, University Hospital Ulm(乌尔姆大学医院创伤研究中心骨科研究与生物力学研究所) AI for Sensor Data Analytics Research Group, Ulm University of Applied Sciences(乌尔姆应用科学大学传感器数据分析人工智能研究组)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 本文比较轻量级4级U-Net与去噪扩散概率模型(DDPM)在从T2加权MRI估计脂肪分数任务上的性能,发现U-Net在精度和速度上均优于DDPM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17107 2026-06-17 cs.LG cs.AI 新提交 57%

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

模型在预填充阶段记笔记:KV缓存可编辑且可组合

Bojie Li

机构 * Pine AI

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16449 2026-06-17 cs.CV 新提交 57%

PermaVid: Consistent Video Generation Across Edits via Disentangled Context Memory

PermaVid: 通过解耦上下文记忆实现编辑下的一致视频生成

Shuai Yang, Bingjie Gao, Ziwei Liu, Jiaqi Wang, Dahua Lin, Tong Wu

机构 * Shanghai Jiao Tong University(上海交通大学) Stanford University(斯坦福大学) S-Lab, Nanyang Technological University(南洋理工大学S-Lab) The Chinese University of Hong Kong(香港中文大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 提出PermaVid框架,利用解耦为语义外观和几何结构的上下文记忆,结合编辑感知更新策略,实现编辑操作后视频的长期一致生成。

Comments Project page: https://ys-imtech.github.io/projects/PermaVid/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24357 2026-06-17 cs.LG cs.AI 版本更新 57%

DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Diffusion Language Models

DPRM: 一种用于扩散语言模型的即插即用Doob h变换诱导的令牌排序模块

Dake Bu, Wei Huang, Andi Han, Hau-San Wong, Qingfu Zhang, Taiji Suzuki, Atsushi Nitanda

机构 * City University of Hong Kong(香港城市大学) The Institute of Statistical Mathematics(统计数学研究所) University of Sydney(悉尼大学) Nanyang Technological University(南洋理工大学) The University of Tokyo(东京大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出DPRM模块,通过在线估计从置信度驱动排序逐步过渡到过程奖励引导排序,改进扩散语言模型的令牌排序策略,在九种任务中提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16496 2026-06-16 cs.CL cs.LG 新提交 57%

REFLEX: Reflective Evolution from LLM Experience

REFLEX: 基于大语言模型经验的反思进化

Pan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 提出REFLEX框架,通过解耦视觉诊断与代码生成实现可审计的高效策略进化,在控制任务和天线阵列合成中展现优异样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15867 2026-06-16 cs.CV 新提交 57%

CogCanvas: A Benchmark for Evaluating Multi-Subject Reference-Based Image Generation

CogCanvas: 用于评估多主体参考图像生成的基准

Long-Bao Nguyen, Quang-Khai Tran, Tam V. Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, Ho Chi Minh City, Vietnam(胡志明市理科大学) University of Dayton, Ohio, United States(代顿大学) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学胡志明市分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出CogCanvas基准,包含1952张参考图像和1361个组合提示,评估多身份、对象绑定和背景场景的生成,引入BG-Sim和Attr-VQA指标,发现现有模型在超过3个主体时性能严重下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15323 2026-06-16 cs.CV 新提交 57%

PPDM: Pixel Puzzling Diffusion Model for Speed and Memory Efficient Volumetric Medical Image Translation

PPDM: 像素拼图扩散模型用于速度和内存高效的体积医学图像翻译

Tianqi Chen, Jun Hou, Yinchi Zhou, James S. Duncan, Chi Liu, Bo Zhou

机构 * Department of Radiology, Northwestern University(西北大学放射学系) Department of Biomedical Engineering, Yale University(耶鲁大学生物医学工程系) Department of Radiology and Biomedical Imaging, Yale School of Medicine(耶鲁医学院放射学与生物医学影像系)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出像素拼图扩散模型(PPDM),通过可逆像素拼图操作和直接桥接扩散公式,在降低内存和加速推理的同时保持全局一致性,用于3D医学图像翻译。

Comments 12 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14981 2026-06-16 cs.RO cs.AI cs.LG 新提交 57%

Inference-time Policy Steering via Vision and Touch

通过视觉和触觉进行推理时策略引导

Yilin Wu, Zilin Si, Zeynep Temel, Oliver Kroemer, Andrea Bajcsy

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出ViTaL框架,通过视觉采样验证和触觉引导扩散编辑的双层优化,在推理时引导机器人策略,显著提升接触丰富操作任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07212 2026-06-16 cs.AI cs.LG 版本更新 57%

Sample from What You See: Visuomotor Policy Learning via Diffusion Bridge with Observation-Embedded Stochastic Differential Equation

从所见中采样:基于观测嵌入随机微分方程的扩散桥视觉运动策略学习

Zhaoyang Liu, Mokai Pan, Zhongyi Wang, Kaizhen Zhu, Haotao Lu, Haipeng Zhang, Jingya Wang, Ye Shi

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.AI

AI总结 提出BridgePolicy,通过扩散桥公式将观测直接集成到随机动力学中,利用语义对齐器处理异构观测,在模拟和真实任务中超越现有生成式策略。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19699 2026-06-16 cs.LG cs.AI cs.DC 版本更新 57%

Mosaic: Data-Free Knowledge Distillation via Mixture-of-Experts for Heterogeneous Distributed Environments

Mosaic: 面向异构分布式环境的无数据知识蒸馏与混合专家模型

Junming Liu, Yanting Gao, Yuqi Li, Siyuan Meng, Yifei Sun, Aoqi Wu, Yirong Chen, Ding Wang, Shiping Wen

机构 * School of Computer Science and Technology, Tongji University(同济大学计算机科学与技术学院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The City University of New York(纽约城市大学) Shenzhen University of Advanced Technology(深圳先进技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 针对联邦学习中模型与数据异构性问题,提出Mosaic框架,通过本地生成模型合成隐私保护数据,并利用混合专家模型蒸馏全局模型,在图像和多模态基准上超越现有方法。

Comments 23 pages, 5 figures, 24 tables; Accepted by Knowledge-Based Systems, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14176 2026-06-15 cs.AI 新提交 57%

VeriGeo: Controllable Geometry Question Generation with Numerical and Analytical Verification

VeriGeo: 可控几何问题生成与数值和分析验证

Xiaoxian Duan, Zequn Liu, Yingce Xia

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出VeriGeo框架,通过可执行推理轨迹和三级验证流水线,实现用户约束下的可控几何问题生成,并利用验证引导的反思修复无效生成,提升数据可靠性。

Comments 32 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02320 2026-06-15 cs.CL 版本更新 57%

TVIR: Building Deep Research Agents Towards Text-Visual Interleaved Report Generation

TVIR:构建面向文本-视觉交错报告生成的深度研究智能体

Xinkai Ma, Zhiqi Bai, Dingling Zhang, Pei Liu, Yishuo Yuan, He Zhu, Jiakai Wang, Qianqian Xie, Yifan Zhao, Xinlong Yang, Hao Cong, Zhiheng Yao, Fengxia Xie, Zihao Xu, Haoran Xu, Zhaohui Wang, Minghao Liu, Shirong Lin, Yingshui Tan, Yuchi Xu, Wenbo Su, Zhaoxiang Zhang, Bo Zheng, Jiaheng Liu

机构 * Nanjing University Alibaba Group(南京大学阿里集团)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 提出TVIR基准和层次化多智能体框架,解决深度研究报告中视觉元素的事实可靠性与对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12828 2026-06-12 cs.AI 新提交 57%

Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics

人工智能研究中的主题相变:大规模证据与新兴主题的早期预警信号

Rasul Khanbayov, Hasan Kurban

机构 * College of Science and Engineering(科学与工程学院) Hamad Bin Khalifa University(哈马德·本·哈利法大学) Doha, Qatar(卡塔尔多哈)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 通过分析2017-2025年五大AI会议论文,发现AI主题通过“相变”方式突然爆发,并基于早期预警信号识别未来需关注的主题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12633 2026-06-12 cs.CV cs.LG 新提交 57%

ECA: Efficient Continual Alignment for Open-Ended Image-to-Text Generation

ECA:面向开放图像到文本生成的高效持续对齐

Jiangtao Kong, Peijun Zhao, Chun-Fu Chen, Youngwook Do, Shaohan Hu, Tianyi Zhou, Huajie Shao

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :cross-modal(abstract);分类 cs.CV

AI总结 提出ECA方法,通过混合查询模块、Fisher动态扩展和字典重放,实现无需旧数据的持续对齐,缓解灾难性遗忘,提升开放图像到文本生成的增量学习性能。

Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12576 2026-06-12 cs.CL 新提交 57%

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表

Ishani Mondal, Javad Baghirov, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CL

AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。

Comments Webpage: https://minard.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15133 2026-06-12 cs.CE cs.AI 版本更新 57%

HD-Prot: A Protein Language Model for Joint Sequence-Structure Modeling with Continuous Structure Tokens

HD-Prot:一种使用连续结构令牌进行联合序列-结构建模的蛋白质语言模型

Yi Zhou, Haohao Qu, Yunqing Liu, Shanru Lin, Le Song, Wenqi Fan

机构 * The Hong Kong Polytechnic University(香港理工大学) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫人工智能大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出HD-Prot,一种混合扩散蛋白质语言模型,通过连续结构令牌将序列pLM扩展为多模态,实现联合序列-结构建模,在多种任务上取得竞争性能。

Comments This is the long version of the corresponding paper to appear at KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03184 2026-06-12 cs.LG cs.AI 版本更新 57%

Decentralized Autoregressive Generation

分散自回归生成

Stepan Maschan, Haoxuan Qu, Jun Liu

机构 * Lancaster University(兰卡斯特大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文通过离散流匹配框架证明分散训练与集中训练在理论上等价,实验验证其在多模态基准上保持竞争力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11783 2026-06-11 cs.CV 新提交 57%

A Comprehensive Ecosystem for Open-Domain Customized Video Generation

开放域定制视频生成的综合生态系统

Jingxu Zhang, Yuqian Hong, Daneul Kim, Kai Qiu, Qi Dai, Jianmin Bao, Yifan Yang, Xiaoyan Sun, Chong Luo

机构 * University of Science and Technology of China(科学技术大学) Microsoft Research Asia(微软亚洲研究院) Seoul National University(首尔国立大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出百万级数据集PexelsCustom-1M和参数高效框架CustoMDiT,仅用8%额外参数实现定制视频生成,并构建千类基准OpenCustom,开源整个生态系统。

Comments 5 pages, 3 figures, 4 tables. Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11152 2026-06-11 cs.CV 版本更新 57%

P3D-Bench: Benchmarking MLLMs for Parametric 3D Generation and Structural Reasoning

P3D-Bench:用于参数化3D生成与结构推理的多模态大语言模型基准

Yikang Yang, Zhanpeng Hu, Youtian Lin, Mengqi Zhou, Jingxi Xu, Feihu Zhang, Jiaheng Liu, Yao Yao

机构 * Nanjing University(南京大学) Envision

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出P3D-Bench基准,通过参数化3D程序评估多模态大语言模型在几何精度、语义对齐和装配一致性上的表现,涵盖文本到3D、图像到3D和装配3D三类任务。

Comments Project page: https://spatiaos.github.io/projects/P3D-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20795 2026-06-11 cs.CV 版本更新 57%

What Semantics Survive the Connector? Diagnosing VLM-to-DiT Alignment in Video Editing

什么语义能经受住连接器的考验?视频编辑中VLM到DiT对齐的诊断

Hangyu Lin, Chao Wen, Chengming Xu, Jianxiong Gao, Jiangning Zhang, Xiaobin Hu, Yanwei Fu

机构 * HKUST(香港理工大学) FDU(福建大学) ZJU(浙江大学) NUS(新加坡国立大学)

专题命中 多模态生成 :multi-modal(abstract);分类 cs.CV

AI总结 本研究探讨了视频生成模型中VLM与DiT对齐过程中的语义瓶颈问题,通过提出TRACE-Edit数据集和诊断协议,发现连接器模块会导致细粒度结构语义的严重退化,挑战了原有假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18291 2026-06-11 cs.AI 版本更新 57%

Diffusing to Coordinate: Efficient Online Multi-Agent Diffusion Policies

扩散以协调:高效在线多智能体扩散策略

Zhuoran Li, Hai Zhong, Xun Wang, Qingxin Xia, Lihua Zhang, Longbo Huang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出首个在线离线策略多智能体强化学习框架OMAD,利用扩散策略和松弛策略目标最大化缩放联合熵,实现高效探索与协调,在MPE和MAMuJoCo上样本效率提升2.5至5倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11180 2026-06-10 cs.CV 新提交 57%

Lip Forcing: Few-Step Autoregressive Diffusion for Real-time Lip Synchronization

Lip Forcing: 用于实时唇部同步的少步自回归扩散

Paul Hyunbin Cho, Jinhyuk Jang, SeokYoung Lee, Joungbin Lee, Siyoon Jin, Heeseong Shin, Jung Yi, Yunjin Park, Chulmin Park, Seungryong Kim

机构 * KAIST AI(韩国科学技术院人工智能) AIPARK

专题命中 多模态生成 :audio-visual(abstract);分类 cs.CV

AI总结 提出Lip Forcing,首个用于视频到视频唇部同步的自回归扩散方法,通过蒸馏14B教师模型为因果学生模型,仅需两步去噪即可实现实时同步,并引入同步窗口DMD、两步推理计划和SyncNet奖励。

Comments Project Page: https://cvlab-kaist.github.io/LipForcing/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10413 2026-06-10 cs.AI 新提交 57%

Soul Computing: A Theoretical Framework and Technical Architecture for Intelligent Agents with Independent Consciousness

灵魂计算:具有独立意识的智能体的理论框架与技术架构

Jinshan Zhang, Xishi Zhou, Qiu Peng, Jianwei Yin

机构 * Innovation and Management Center, School of Software Technology, Zhejiang University (Ningbo)(浙江大学(宁波)软件学院创新与管理中心) School of Software Technology, Zhejiang University, Ningbo(浙江大学软件学院(宁波))

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 本文提出“灵魂计算”范式,区分狭义与广义概念,构建以意向性核心为特征的智能体架构,实现AI从工具到生命体的转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03963 2026-06-10 cs.RO cs.AI 版本更新 57%

AgenticRL: Self-Refining Agentic Reinforcement Learning for Vision-Conditioned UAV Navigation

面向视觉条件的无人机导航的自优化智能体强化学习

Roohan Ahmed Khan, Yasheerah Yaqoot, Amir Atef Habel, Muhammad Ahsan Mustafa, Dzmitry Tsetserukou

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.AI

AI总结 提出AgenticRL框架,利用多模态GPT智能体自动设计奖励函数、通过闭环自改进优化策略,在多种无人机导航任务中提升性能并实现高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22192 2026-06-10 cs.CV 版本更新 57%

CharTide: Data-Centric Chart-to-Code Generation via Tri-Perspective Tuning and Inquiry-Driven Evolution

CharTide: 数据中心的图表到代码生成通过三视角微调和查询驱动进化

Xiangxi Zheng, Kuang He, Jiayi Hu, Ping Yu, Rui Yan, Yuan Yao, Peng Hou, Anxiang Zeng, Alex Jinpeng Wang

机构 * Nanjing University(南京大学) LLM Team, Shopee Pte. Ltd.(Shopee 联邦学习团队) East China Normal University(华东师范大学) Nanjing University of Science and Technology(南京理工大学) Central South University(中南大学)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出CharTide框架,通过三视角微调解耦视觉感知与代码逻辑,并引入基于信息不变性的查询驱动强化学习进行数据验证,在多个基准上超越GPT-4o。

Comments Accepted to ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09738 2026-06-09 cs.CV 新提交 57%

HDSL: A Hierarchical Domain-Specific Language for Structured 3D Indoor Scene Generation and Localized Editing with LLM Agents

HDSL:一种用于结构化3D室内场景生成和基于LLM智能体局部编辑的层次化领域特定语言

Letian Li, Chao Shen, Shuzhao Xie, Chenghao Gu, ZhengXiao He, Yu Meng, Xin Yang, Wenyuan Jiang, Zhi Wang

机构 * SIGS, Tsinghua University(清华大学深圳国际研究生院) Nankai University(南开大学) University of Arizona(亚利桑那大学) Zhejiang University(浙江大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出HDSL语言,以树结构表示室内场景,结合LLM智能体生成、多模态检索和力导向布局优化,实现结构化场景生成与局部编辑,显著提升对象覆盖率和编辑效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00967 2026-06-09 cs.CV 版本更新 57%

MedSyn2: Flexible Control of 3D CT Generation via Text and Semantically-Defined Segmentation Prompts

通过文本和语义定义的分割提示灵活控制3D CT生成

Weicheng Dai, Chenyu Wang, Binxu Li, Shantanu Ghosh, Afrooz Zandifar, Christina LeBedis, Kayhan Batmanghelich

机构 * Boston University School of Engineering(波士顿大学工程学院) Stanford University(斯坦福大学) University of Pittsburgh Medical Center(匹兹堡大学医学中心) Boston University School of Medicine(波士顿大学医学院)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出一种灵活的多模态框架,通过文本和可选分割提示控制3D CT生成,实现高分辨率、解剖一致且可控的体数据生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01171 2026-06-09 cs.CV cs.LG 版本更新 57%

CADFit: Precise Mesh-to-CAD Program Generation with Hybrid Optimization

CADFit:基于混合优化的精确网格到CAD程序生成

Ghadi Nehme, Eamon Whalen, Faez Ahmed

机构 * Department of Mechanical Engineering, Massachusetts Institute of Technology, Cambridge, MA 02139, USA(麻省理工学院机械工程系)

专题命中 多模态生成 :multimodal(abstract);分类 cs.CV

AI总结 提出CADFit框架,通过基于几何反馈的增量拟合和验证参数化操作,从网格中恢复复杂可编辑的CAD构造序列,在多个基准上优于现有方法,并显著降低无效比率。

详情

展开后加载摘要…

URL PDF HTML 收藏