arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 557 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 557 篇

2607.23373 2026-07-28 cs.CV 新提交 50%

UltraViT: Latency-Optimized On-device Vision Encoder for Large Vision-Language Models

UltraViT:用于大型视觉语言模型的延迟优化设备端视觉编码器

Ioannis Maniadis Metaxas, Adrian Bulat, Alberto Baldrati, Anestis Zaganidis, Yassine Ouali, Hyeonuk Kim, Georgios Tzimiropoulos

机构 * Samsung AI Cambridge(三星人工智能剑桥实验室) Technical University of Iasi(雅西技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 其他安全 :alignment(abstract)

AI总结 针对大型视觉语言模型在设备端部署受限问题,提出UltraViT视觉编码器,通过考虑设备延迟设计金字塔架构,并采用两阶段生成式预训练策略,有效提升编码效率,优于现有基线。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23213 2026-07-28 cs.HC 新提交 50%

A Taxonomy of Confabulations and the Perception-Reality Gap in LLM-Assisted Immersive Scene Editing

大语言模型辅助沉浸式场景编辑中的虚构分类与感知-现实差距

Junlong Chen, Per Ola Kristensson

专题命中 其他安全 :safety(abstract)

AI总结 研究LLM辅助沉浸式3D场景编辑中的虚构,通过对24名非专业用户的探索性研究构建分类法,报告其普遍性与破坏性,定义感知-现实差距结构,强调负载下虚构意识饱和度,得出对未来系统减轻虚构的设计启示。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23038 2026-07-28 cs.IR 新提交 50%

EGR: Embedding-Native Generative Retrieval with a Shared LLM

EGR:使用共享语言模型的嵌入原生生成式检索

Xiaodong Liu, Congfei Zhang, Hsiang-wei Chao, Siman Wang, Tong Zhao, Xiao Bai, Vincent Zhang, Jingxiao Ma, Zhe Liu, Wenfeng Zhuo, Zichu Li, Jitin Krishnan, Yunzhi Zhou, Yajun Wang, Jinchao Li, Yu Zhang

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对生成式检索在推荐和广告系统中的问题,提出EGR框架,利用共享语言模型在同一嵌入空间学习项目与用户表示,经联合对比训练,在多场景评估中表现出色,提升了转化率,简化了系统设计。

Comments Accepted to RecSys 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22678 2026-07-28 math.OC stat.ME 新提交 50%

Convexifying Mean-Field Control: An Occupation-Measure and Frank-Wolfe Approach

凸化平均场控制:一种占用测度和弗兰克 - 沃尔夫方法

Di Yu, Sixiong You, Chaoying Pei

专题命中 其他安全 :safety(abstract)

AI总结 针对大规模机器人群体的平均场控制问题,建立基于优化的框架,将其提升到占用测度空间并采用弗兰克 - 沃尔夫算法求解,避免状态空间离散化,具有O(1/k)收敛速度,可扩展到三维环境,展现出实用性和可扩展性。

Comments 7 pages, 5 figures. Accepted to the 2026 American Control Conference (ACC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21957 2026-07-27 cs.SE cs.CR 新提交 50%

KaPilot: LLM-Assisted Generation of Kani Specifications for Unsafe Rust Verification

KaPilot:用于不安全Rust验证的大语言模型辅助Kani规范生成

Minghua Wang, Yuxi Ling, Mingzhi Gao, Yuwei Liu, Lin Huang

专题命中 其他安全 :safety(abstract)

AI总结 研究针对不安全Rust内存安全验证规范编写难题,提出KaPilot多智能体框架,经轻量级分析、智能体协作及循环优化、策略筛选确定最佳规范,评估显示其在规范生成成功率和质量上优于AutoSpec。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21459 2026-07-24 econ.GN q-fin.EC 新提交 50%

The Evolution of Digital Search: From Blue Links to Delegated Decision-Making

数字搜索的演变:从蓝色链接到委托决策

David M. Rothschild, Nicole Immorlica, Brendan Lucier, Markus Mobius, Aleksandrs Slivkins

专题命中 其他安全 :alignment(abstract)

AI总结 研究数字搜索从传统模式到人工智能原生模式的转变,指出小设计选择影响重大,未来搜索发展不由算法和界面改进决定,而是取决于开放透明有竞争力的代理系统设计,揭示多领域交叉的重大挑战。

Comments 4 pages, 0 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20207 2026-07-23 cs.RO 新提交 50%

SeededGrasp: Language-Guided Grasping in Complex Scenes with Multiple Embodiments

SeededGrasp:复杂场景中多实体语言引导抓取

Yang Xu, Gurpreet Singh Mukker, Raymond Wang, Jasper Gerigk, Maria Attarian, Igor Gilitschenski

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) University of British Columbia(英属哥伦比亚大学) Google Deepmind(谷歌DeepMind)

专题命中 其他安全 :alignment(abstract)

AI总结 针对复杂场景中机器人抓取问题,提出 SeededGrasp 框架,通过 VLM 预测种子点,结合轻量级抓取生成模型,解耦语义与几何执行,无需端到端训练,发布多实体数据集,实验证明该方法优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19836 2026-07-23 cs.IR cs.DL 新提交 50%

Using Hierarchical Controlled Vocabularies to Understand CLIP Retrieval Failures in Historical Photo Collections

使用分层控制词汇表理解历史照片集中CLIP检索失败的原因

Ratan Sebastian, Anett Hoppe, Christoph Rippe, Ralph Ewerth

专题命中 其他安全 :alignment(abstract)

AI总结 研究探讨用AAT词汇表的根面类型和层次深度解释CLIP在历史照片集检索的成败及微调作用,通过三个标注集研究视觉连贯性等指标,发现两指标可区分失败模式,根面类型有区分作用,微调对层次浅的术语更有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19027 2026-07-22 cs.CV 新提交 50%

Mitigating Modality and Language-Style Gaps for Zero-Shot Video Moment Retrieval

缓解零样本视频时刻检索中的模态和语言风格差距

Jihyun Lee, Cheol-Ho Cho, Woojin Jun, Woojin Jeong, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究零样本视频时刻检索中模态和语言风格差距问题,提出基于自相似性的时刻提议和评分方法及查询感知的多模态大语言模型推理阶段,有效缓解差距,在相关基准测试中达最优性能。

Comments ECCV 2026 (* These authors contributed equally.)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18605 2026-07-22 cs.HC 新提交 50%

Understanding ADHD Productivity in Construction Work: Toward AI-enabled VR Interventions

理解建筑工作中的注意力缺陷多动障碍(ADHD)生产力:迈向人工智能支持的虚拟现实干预

Zinat Ara, Behzad Esmaeili, Lap-Fai Yu, Sungsoo Ray Hong

专题命中 其他安全 :safety(abstract)

AI总结 研究旨在了解ADHD特征对建筑领域生产力的影响及相关干预措施,通过对多方进行半结构化访谈,确定了工作场所挑战与生产力支持策略两大主题,得出AI和VR干预措施设计要求,为提升ADHD生产力支持发展提供参考。

Comments arXiv admin note: text overlap with arXiv:2509.12153

Journal ref 2026 Neurodiversity at Work Research Conference (NWRC 2026), University of Washington, Seattle, WA, USA, June 22-23, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17839 2026-07-21 cs.RO 新提交 50%

Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation

基于抓握感知物体方向的以接收者为中心的机器人到人类工具交接

Federico Biagi, Dario Onfiani, Simone Silenzi, Luigi Biagiotti

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学)

专题命中 其他安全 :safety(abstract)

AI总结 研究针对协作机器人与人类操作员工具交接问题,提出以接收者为中心、语音驱动的自适应交接系统,基于Franka cobot,用LLM识别意图、MediaPipe跟踪手部,动态调整末端执行器方向,经实验验证该系统能减少抓握延迟,提升交互流畅性与信任感知。

Comments Accepted for presentation at the 19th International Workshop on Human-Friendly Robotics (HFR 2026), Trento, Italy. The paper will appear in Springer's Proceedings in Advanced Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17693 2026-07-21 cs.CV 新提交 50%

Memory-Supported Synergistic Adaptation for Training-Free Test-Time Medical Image Segmentation

用于无训练测试时医学图像分割的内存支持协同适应

Lingrui Li, Nan Pu, Dong Zhao, Wenjing Li, Andrew P French, Zhun Zhong, Xin Chen

机构 * School of Computer Science, University of Nottingham(诺丁汉大学计算机科学学院) School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机科学与信息工程学院) Information Systems Technology and Design Pillar, Singapore University of Technology and Design(新加坡科技设计大学信息系统技术与设计支柱)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对医学图像分割中测试时适应的挑战,提出内存支持协同适应(MSSA)框架,不更新模型参数,通过构建在线内存、文本引导语义先验及跨图像结构对齐实现稳健适应,实验证明其优于现有方法。

Comments 18 pages, ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16862 2026-07-21 cs.CV cs.RO 新提交 50%

InLiER: Learning-Free Heterogeneous LiDAR Place Recognition via Intermediate Mixed-Radix Structural Keypoint Tokenization

InLiER:通过中间混合基数结构关键点令牌化实现无学习的异构激光雷达地点识别

Nikolaos Stathoulopoulos, George Nikolakopoulos

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对机器人平台结合多种激光雷达致现有描述符性能下降的问题,提出无学习管道InLiER,通过混合基数令牌ID编码关键点信息,经三个检索阶段处理,在相关数据集和实验中表现出色,优于基于学习的基线。

Comments Accepted for publication in IEEE Robotics and Automation Letters (RA-L). 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交 50%

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

专题命中 其他安全 :safety(abstract)

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16708 2026-07-21 cs.SE 新提交 50%

Model-Driven Discipline for Multi-Agent LLMs: Requirement-to-Verification Generation of Traceable System Models

多智能体大语言模型的模型驱动规范:可追溯系统模型的需求到验证生成

Ran Wei, Le Zhu, Haochi Wang, Ruizhe Yang, Jiapeng Guan, Siyuan Ji, Yuchen Hu, Zhe Jiang, Xiangyang Ji

专题命中 其他安全 :safety(abstract)

AI总结 针对软件复杂性问题,提出RADIANT方法,结合MDE与多智能体LLMs用于系统开发。能从需求模型自动生成异构模型及可追溯链接,进行变更影响分析和形式验证。评估显示可提高语法有效性和可执行性,减少开发时间并可跨领域应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16649 2026-07-21 cs.CV 新提交 50%

DRIFT: Difficulty-aware Rectified Flows for Through-plane MRI Super-Resolution

DRIFT:用于平面内MRI超分辨率的难度感知整流流

Yoonseok Choi, Eun-Gyu Ha, Daniel Kim, Mohammed A. Al-masni, Ming-Hsuan Yang, Dong-Hyun Kim

机构 * Yonsei University(延世大学) King Fahd University of Petroleum & Minerals (KFUPM)(法赫德国王石油与矿业大学) University of California at Merced(加州大学默塞德分校)

专题命中 其他安全 :alignment(abstract)

AI总结 针对平面内MRI超分辨率中效率与保真度的权衡问题,提出DRIFT框架,通过两阶段厚度条件整流流,利用解剖投影网络初始化,引入物理感知难度度量指导自适应积分调度器,降低推理成本并优于超分辨率基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16540 2026-07-21 cs.CV 新提交 50%

Do Vision Encoders Exhibit Human-like Color Thresholds?

视觉编码器是否表现出类人的颜色阈值?

Engy Ehab, Pablo Hernández-Cámara, Nahla Belal, Jesús Malo, Javier Vazquez-Corral, Alexandra Gomez-Villa

机构 * Computer Vision Center(计算机视觉中心) Universitat Autònoma de Barcelona(巴塞罗那自治大学) Image Processing Lab, Universitat de València(瓦伦西亚大学图像处理实验室) Arab Academy for Science, Technology, and Maritime Transport(阿拉伯科学、技术和海运学院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究探索50多个预训练视觉编码器的色度敏感性,将其与人类辨别阈值比较,发现模型表示与人类感知阈值对齐弱,自监督编码器优于监督的,语言监督模型两极分化,表明当前训练目标不会自然产生类人色度敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16321 2026-07-21 cs.CV cs.IR 新提交 50%

Art Beyond Semantics: Sheaf-Informed Contrastive Learning for Multi-Relational Representations

超越语义的艺术:用于多关系表示的层状信息对比学习

Ludovica Schaerf, Antonio Purificato, Piera Riccio, Fabrizio Silvestri, Noa Garcia

机构 * University of Zurich(苏黎世大学) Max Planck Institute Bibliotheca Hertziana(马克斯·普朗克赫兹iana图书馆研究所) Sapienza University of Rome(罗马第一大学) Amazon(亚马逊) University of Amsterdam(阿姆斯特丹大学) The University of Osaka(大阪大学)

专题命中 其他安全 :alignment(abstract)

AI总结 该研究针对视觉语言模型丢失艺术作品多关系结构的问题,引入受层理论启发的CANVAS框架,通过多嵌入和对比损失学习关系感知多模态表示,在新基准测试中表现优于基线,证明多关系对齐在艺术理解中兼具理论与实践价值。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16507 2026-07-21 cs.IT eess.SP math.IT 新提交 50%

AISAC: Closing the Loop Between AI and Integrated Sensing and Communication for 6G

AISAC:为6G闭合人工智能与集成传感通信之间的环路

Mehdi Karbalayghareh, Abhishek Rajasekaran, Xiaoyan Ma, David J. Love, Christopher G. Brinton

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对6G中人工智能与集成传感通信融合问题,提出AISAC闭环框架,阐述其新物理层设计原则,展示全貌、解释问题、开发架构并概述用例及相关开放问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15600 2026-07-20 cs.CV 新提交 50%

Geometric Distillation from Rectified Stereo: Leveraging Epipolar Cues for Monocular Depth

从校正立体中进行几何蒸馏:利用对极线索进行单目深度估计

Jung-Hee Kim, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对单目深度估计在不同环境下的难题,提出将多视图模型的尺度感知几何先验转移到单目深度基础模型的框架,通过对极蒸馏方法,无需多视图输入就能保持几何一致性,显著提升零样本度量深度估计性能,且与模型无关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14870 2026-07-17 physics.med-ph 新提交 50%

One-for-All Adaptive Radiotherapy Planning Agent: A Foundation Framework for Daily CBCT-guided Radiotherapy

一适用于所有情况的自适应放射治疗计划智能体:基于每日锥束CT引导的放射治疗基础框架

Shaoyan Pan, Kirk Jon Luca, Yuan Gao, Shansong Wang, Mingzhe Hu, Ryan Sanford, Mojtaba Safari, Justin Roper, Zhen Tian, Tonghe Wang, Xiaofeng Yang

专题命中 其他安全 :alignment(abstract)

AI总结 介绍一适用于所有情况的自适应放射治疗计划智能体,它基于统一基础模型,能从每日锥束CT执行在线自适应计划,自主预测关键组件并设计临床计划,经多数据集评估,其准确性和计划质量与临床方案相当,为放射治疗带来新机遇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-07-16 cs.CV 新提交 50%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract)

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13674 2026-07-16 cs.CV cs.RO 新提交 50%

WAVE-Stereo: Warp-Aligned Volume Encoding for Stereo Matching

WAVE-Stereo:用于立体匹配的扭曲对齐体素编码

Zehan Liu, Yage He, Xianwu Gong

专题命中 其他安全 :alignment(abstract)

AI总结 研究提出WAVE-Stereo立体匹配方法,基于相关体与特征扭曲互补线索,通过地理扭曲对应编码器并行编码多信息,用周期性全局上下文传播减轻无纹理区匹配退化,在多基准测试中实现精度与效率良好平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13257 2026-07-16 cs.SE 新提交 50%

Can LLMs Learn and Apply Multi-Level Modelling Semantics? A First Empirical Study

大语言模型能否学习并应用多层次建模语义?首次实证研究

Yuhong Fu, Weixing Zhang, Bowen Jiang, Haowei Cheng, Karamjti Kaur, Markus Stumptner

专题命中 其他安全 :alignment(abstract)

AI总结 研究大语言模型能否学习应用多层次建模语义,通过让三种商业大语言模型在六种提示策略下为挑战生成模型并与参考对比,发现句法正确性可及,语义正确性部分实现,明确能力边界,为工业5.0建模工作流设计提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12460 2026-07-15 cs.SE 新提交 50%

CodeOwl: Automatic Generation of Tiered Parsons Problems for Introductory Programming

CodeOwl:用于编程入门的分层帕森斯问题自动生成

Luca Cisternino, Florian Obermüller, Gordon Fraser

专题命中 其他安全 :alignment(abstract)

AI总结 针对编程教育中学习者异质性难题,介绍CodeOwl这一人工智能驱动工具自动生成分层帕森斯问题,经混合方法框架评估,该工具生成的问题难度提升效果好,获专家、教师和学生认可,不过教师和学生也分别提出了改进意见。

Comments To appear at the 38th CSEE&T

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12429 2026-07-15 cs.CV 新提交 50%

More Than Where You Are: Learning Semantics, Structure, and Geometry from Cross-View Localization

不仅仅是你在哪里:从跨视图定位中学习语义、结构和几何

Mao Chen, Xiangkai Zhang, Zhiyong Liu, Chuankai Liu, Xu Yang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Aerospace Control Center(北京航天飞行控制中心)

专题命中 其他安全 :alignment(abstract)

AI总结 研究如何在极端视角变化下通过跨视图定位让模型学习语义、结构和几何。提出CROSS框架,克服现有方法局限,经实验验证该框架在跨视图定位中性能最优,能有效学习多方面内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12418 2026-07-15 cs.CV 新提交 50%

MQAdapter: Multi-Modal Quantum Adapter for Coarse-to-Fine VLM Fine-tuning

MQAdapter:用于从粗到细的视觉语言模型微调的多模态量子适配器

Yumiao Zhao, Bo Jiang, Min Lu, Xiao Wang, Jin Tang

机构 * Anhui University(安徽大学) Origin Quantum Computing Company Limited(本源量子计算有限公司)

专题命中 其他安全 :alignment(abstract)

AI总结 针对视觉语言模型在少样本学习中细粒度区分不足的问题,提出多模态量子适配器MQAdapter。先检索Top-K候选类别作语义锚点,再用跨模态量子学习机制,利用量子特性建模高阶交互,细化视觉特征,参数高效且能集成现有算法提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12221 2026-07-15 cs.HC 新提交 50%

From Chaos to Clarity: A Framework for Program-Level AI Learning Outcomes

从混乱到清晰:程序级人工智能学习成果框架

Grace Barkhuff, Ian Pruitt, William Gregory Johnson, Rodrigo Borela, Ben Rydal Shapiro, Anu G. Bourgeois

专题命中 其他安全 :alignment(abstract)

AI总结 针对高等教育中缺乏明确人工智能准备界定结构的问题,提出程序级人工智能学习成果(PLAI-LOs)框架,通过工件级GenAI政策实施,为高等教育从分散规则走向清晰、以学习为中心的战略提供路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12193 2026-07-15 cs.HC cs.CV 新提交 50%

Compos3D: Interactive Part-Based Composition for Creative Control in Generative 3D Models

Compos3D:用于生成式3D模型中创意控制的基于部件的交互式合成

Faraz Faruqi, Sean J. Liu, George Fitzmaurice, Justin Matejka

机构 * Autodesk Research(Autodesk研究院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对生成式3D建模中控制有限问题,提出Compos3D系统,通过重新混合部件实现创意控制。用户从提示生成候选,选择部件组装,系统合成模型。用户研究表明该方法能带来更好控制、意图匹配和满意度,还给出了未来工作流程设计建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11196 2026-07-14 cs.CV 新提交 50%

Slot-RAE: Streamlining Object-Centric Learning via Direct Representation Auto-Encoders

Slot-RAE:通过直接表示自动编码器简化以对象为中心的学习

Alexandre Chapin, Emmanuel Dellandrea, Liming Chen

机构 * LIRIS(里昂图像与信息系统实验室) Ecole Centrale de Lyon(里昂中央理工学院)

专题命中 其他安全 :alignment(abstract)

AI总结 研究针对以对象为中心的模型部署问题,提出Slot-RAE框架,直接在视觉基础模型特征空间运行,采用特征空间扩散过程及独特训练方式,在COCO数据集实验中取得领先成果,实现高效无监督对象发现等,速度和计算效率更高。

详情

展开后加载摘要…

URL PDF HTML 收藏