arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

2026-07-21 至 2026-07-21 共收录 133 信号源:cs.CV, cs.GR, cs.MM

1. 可控生成 13 篇

2607.17146 2026-07-21 cond-mat.dis-nn cs.CL cs.LG 新提交 50%

The Geometry of Semantic Space: A Continuous Geometric Framework for the Transformer Architecture

语义空间的几何:Transformer架构的连续几何框架

Zhihua Liang

机构 * INFN, Sezione di Cagliari(意大利国家核物理研究所,卡利亚里分部)

专题命中 可控生成 :diffusion(abstract)

AI总结 该研究提出连续几何框架,将Transformer架构运算建模为积分 - 微分方程,从几何公理出发转化其核心组件。通过实验验证,此框架能为大语言模型的稳定性、上下文及优化动态提供预测性描述词汇。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26887 2026-07-21 math.AP 版本更新 50%

Local well-posedness for hyperbolic systems of equations with fractional dissipation

分数阶正则化双曲方程组的局部适定性

Felipe Angeles

专题命中 可控生成 :diffusion(abstract)

AI总结 针对具有分数阶耗散和非局部交换子的双曲拟线性演化系统,利用分数阶拉普拉斯的自伴性和傅里叶乘子交换子的代数恒等式,结合非齐次Littlewood-Paley理论建立局部适定性,并通过Schauder不动点定理克服Banach收缩原理失效的困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13204 2026-07-21 math.OC 版本更新 50%

Indefinite Stochastic Linear-Quadratic Optimal Control Problems with Random Coefficients and Poisson Jumps: Closed-Loop Representation of Open-Loop Optimal Controls

不定随机线性二次最优控制问题:带有随机系数和泊松跳跃的闭环表示法

Kai Ding, Jiaqiang Wen, Jie Xiong, Xin Zhang

专题命中 可控生成 :diffusion(abstract)

AI总结 本文研究了具有随机系数和泊松跳跃的有限时间随机线性二次最优控制问题,证明了在均匀凸性条件下,带跳跃的随机黎曼-西格纳方程有唯一强正则解,从而得到开环最优控制的闭环表示。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27167 2026-07-21 math.NA cs.NA 50%

A monotone finite element method for an elliptic distributed optimal control problem with a convection-dominated state equation

一种用于对流主导状态方程的椭圆分布最优控制问题的单调有限元方法

SeongHee Jeong, Seulip Lee, Sijing Liu

专题命中 可控生成 :diffusion(abstract)

AI总结 本文提出了一种单调有限元方法,用于求解对流主导的椭圆分布最优控制问题,通过保持离散最大原理和最优收敛阶次,确保数值稳定性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27497 2026-07-21 cs.LG cs.AI 版本更新 50%

InertialAR: Autoregressive 3D Molecule Generation with Inertial Frames

InertialAR:基于惯性框架的自回归3D分子生成

Haorui Li, Weitao Du, Yuqiang Li, Hongyu Guo, Shengchao Liu

机构 * The Chinese University of Hong Kong(香港中文大学) Alibaba DAMO Academy(阿里巴巴达摩院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) University of Ottawa(渥太华大学)

专题命中 可控生成 :diffusion(abstract)

AI总结 研究探索基于Transformer的自回归模型在3D分子生成上的应用。提出InertialAR,通过规范标记化、几何位置编码及分层自回归范式应对挑战,在无条件和可控生成任务中表现出色,多个指标达领先水平。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 个性化与一致性 3 篇

2607.17279 2026-07-21 cs.CR cs.AI cs.MM 新提交 57%

Between Safe Boundaries: Exploiting Temporal Consistency for Jailbreaking Text-To-Video Generation Models

在安全边界之间:利用时间一致性破解文本到视频生成模型

Xingkai Peng, Jun Jiang, Jiayang Liu, Kejiang Chen, Weiming Zhang

机构 * University of Science and Technology of China(科学技术大学)

专题命中 个性化与一致性 :text-to-image(abstract);分类 cs.MM

AI总结 研究针对文本到视频模型的越狱攻击,提出结构化查询高效的BSB框架,利用时间一致性,通过在文本代理空间进行蒙特卡洛树搜索并结合视频级评估来校准结果,实验表明该方法超越现有基线,有效发现模型漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17120 2026-07-21 cs.CV 新提交 57%

The generator is the tracker: Multi-object tracking by painting persistent identity colours

生成器即跟踪器:通过绘制持久身份颜色进行多目标跟踪

Haiyu Yang, Miel Hostens

机构 * Cornell University(康奈尔大学)

专题命中 个性化与一致性 :diffusion(abstract);分类 cs.CV

AI总结 研究多目标跟踪问题,核心方法是用轻量级LoRA微调文本到视频扩散模型生成带持久身份颜色的视频,无需传统跟踪组件。主要贡献是在DanceTrack测试服务器上达到40.3 HOTA,有独特错误分布,颜色分配可在遮挡后重新识别身份。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06310 2026-07-21 cs.CY cs.AI cs.MA 50%

Too Human to Model:The Uncanny Valley of LLMs in Social Simulation -- When Generative Language Agents Misalign with Modelling Principles

过于人性化的模型:LLM在社交模拟中的怪诞谷--当生成语言代理与建模原则不一致时

Yongchao Zeng, Calum Brown, Mark Rounsevell

专题命中 个性化与一致性 :diffusion(abstract)

AI总结 本文探讨了LLM在社交模拟中因过于人性化的特性导致的抽象与自然性矛盾,指出其在建模原则下的局限性,并提出重新定位LLM代理以适应不同应用场景的建议。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 图像生成评测 1 篇

2607.16268 2026-07-21 cs.LG 新提交 50%

PsiLogic: Chaos-Aware Active Cancellation for Adam with a Fair Cross-Domain Benchmark

PsiLogic:用于Adam的混沌感知主动抵消及公平跨域基准测试

Ali Sultonov

专题命中 图像生成评测 :diffusion(abstract)

AI总结 研究针对自适应优化器在不同训练阶段更新规则相同的问题,提出PsiLogic优化器,通过双指数移动平均控制主动抵消项,经FairBench基准测试,在多个领域表现优异,还发布开源实现等支持验证。

Comments 9 pages, 4 figures; code at https://github.com/Troxter222/psilogic

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 效率与蒸馏 4 篇

2607.03788 2026-07-21 cs.LG 版本更新 78%

Tensor-Train Joint Modeling for Few-Step Discrete Diffusion

用于少步离散扩散的张量训练联合建模

Byoungkwon Kim, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 效率与蒸馏 :diffusion(title,abstract)

AI总结 研究离散扩散少步生成潜力受限问题,用张量分解进行联合分布建模,支持多种分解方式,提出迭代边际推理程序,通过微调预训练模型大幅提升少步生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18230 2026-07-21 cs.CV cs.AI 新提交 57%

Simple Domain Generalization for Strong Pixel-Level Image Tampering Detection in Modern VLMs

现代视觉语言模型中用于强像素级图像篡改检测的简单域泛化

Yi Tang, Xinyi Shang, Jiacheng Cui, Sondos Mahmoud Bsharat, Jiacheng Liu, Xiaohan Zhao, Tran Dinh Tien, Ahmed Elhagry, Salwa K. Al Khatib, Tianjun Yao, Yonina C. Eldar, Jing-Hao Xue, Hao Li, Salman Khan, Zhiqiang Shen

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) University College London(伦敦大学学院) Weizmann Institute of Science(魏茨曼科学研究所)

专题命中 效率与蒸馏 :image generation(abstract);分类 cs.CV

AI总结 研究现代视觉语言模型中像素级图像篡改检测的域泛化,提出基于平衡小批量采样和后期注入策略的简单训练框架,大幅提升平均gIoU和cIoU,增强了篡改定位和分布外鲁棒性。

Comments Our code is available at https://github.com/VILA-Lab/PIXAR-DG

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16361 2026-07-21 cs.CV 新提交 57%

Spatial Transport of Integration Error in Generative ODEs

生成常微分方程中积分误差的空间传输

Songheng Yin

机构 * Columbia University(哥伦比亚大学)

专题命中 效率与蒸馏 :diffusion(abstract);分类 cs.CV

AI总结 研究生成常微分方程中积分误差的空间传输问题,通过带符号的源和传输计算,利用单步截断残差和结构破坏零值等方法分析误差,还发现训练惩罚注入变化可降误差,模型可据此训练改变。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18106 2026-07-21 cs.RO 新提交 50%

Importance Sampling and PCA for Finding Failures in Commercial Autonomous Vehicles

用于发现商用自动驾驶车辆故障的重要性采样和主成分分析

Hailey Warner, Duncan Eddy, Shreya Parjan, Caroline Cahilly, Harrison Delecki, Matthias Kleinstauber, Chaitanya Shinde, Jerry Lopez, Mykel J. Kochenderfer

机构 * Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天系) Torc Robotics(Torc机器人公司)

专题命中 效率与蒸馏 :diffusion(abstract)

AI总结 研究商用自动驾驶车辆故障发现问题,应用自适应压力测试和基于扩散的故障采样算法找到模拟碰撞,引入基于主成分分析的统计分析将故障分类并恢复噪声轨迹,为故障发现到系统诊断提供路径。

Comments IEEE ICVES 2026 (Submitted)

详情

展开后加载摘要…

URL PDF HTML 收藏