arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

图像生成

图像生成、文生图、图像编辑、扩散模型和可控生成。

共收录 41 信号源:cs.CV, cs.GR, cs.MM

1. 图像生成评测 41 篇

2602.09809 2026-06-10 cs.CV 版本更新 57%

SciFlow-Bench: Evaluating Structure-Aware Scientific Diagram Generation via Inverse Parsing

SciFlow-Bench:通过逆解析评估结构感知的科学图表生成

Tong Zhang, Honglin Lin, Zhou Liu, Chong Chen, Wentao Zhang

机构 * Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Huawei Cloud BU(华为云业务部) Zhongguancun Academy(中关村学院) Beijing Key Laboratory of Data Intelligence and Security (Peking University)(北京数据智能与安全重点实验室(北京大学))

专题命中 图像生成评测 :text-to-image(abstract);分类 cs.CV

AI总结 提出SciFlow-Bench基准,通过逆解析将生成的图表图像转换为结构化图进行比较,以结构可恢复性而非视觉相似性评估科学图表生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09974 2026-08-11 cs.AI cs.CL 版本更新 50%

SPRInG: Continual LLM Personalization via Selective Parametric Adaptation and Retrieval-Interpolated Generation

SPRInG: 通过选择性参数适应和检索插值生成实现连续大语言模型个性化

Seoyeon Kim, Jaehyung Kim

机构 * Yonsei University(延世大学)

专题命中 图像生成评测 :personalized generation(abstract)

AI总结 SPRInG通过选择性参数适应和检索插值生成,实现连续大语言模型个性化,有效应对用户偏好变化带来的挑战。

Comments under review, 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20894 2026-08-04 math.AP 版本更新 50%

On the well-posedness of porous medium equations on general metric measure spaces

关于一般度量测度空间上多孔介质方程的适定性

Diwen Chang

专题命中 图像生成评测 :diffusion(abstract)

AI总结 研究一般度量测度空间上带符号多孔介质方程柯西问题的适定性,基于Rothe方法和单调算子理论,仅用狄氏型定义,证明对给定初始数据存在唯一弱解,适用于多种度量测度空间包括非光滑分形。

Comments 39 pages, 2 figures. Have corrected nearly all errors in old versions. Comments are welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08417 2026-08-04 cs.CL cs.AI 版本更新 50%

Hacking Generative Perplexity: Why Unconditional Text Evaluation Needs Distributional Metrics

破解生成困惑度:为何无条件文本评估需要分布度量

Antonio Franca, Alexander Tong

机构 * AITHYRA Institute(AITHYRA研究所)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文指出生成困惑度(gen-PPL)作为非自回归语言模型评估指标存在缺陷,通过构造零参数朴素采样器在LM1B和OpenWebText上达到SOTA gen-PPL但生成不连贯文本,建议采用直接量化生成文本与参考文本分布差异的评估套件。

Comments Presented at the ICML 2026 Workshop on Structured Probabilistic Inference & Generative Modeling (SPIGM), Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14021 2026-07-27 cs.RO 版本更新 50%

Industrial Dexterity Benchmark: A Hardware-Software Benchmarking Platform for Industrial Dexterous Manipulation

工业灵巧性基准测试:一个用于工业灵巧操作的硬件-软件基准测试平台

Honglu He, Jacob Laufer, Zhiwu Zheng, David Elkan-gonzalez, Raman Goyal, Xinyi Li, Su Lu, Mishek Musa, Berke Saat, Nicolas Tan, Colm Prendergast

机构 * Analog Devices, Inc.(亚德诺半导体技术有限公司)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对工业灵巧操作瓶颈,提出从经典流程到端到端多模态模仿学习框架的转变,介绍了IDB板、DAG-ROS框架和AG-iDP3策略框架,通过数据中心电缆操作实验表明新策略在多方面优于传统方法,推动向可扩展机器人自动化发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06796 2026-07-15 cs.RO 版本更新 50%

RoboDesign1M: A Large-scale Dataset for Robot Design Understanding

RoboDesign1M:用于机器人设计理解的大规模数据集

Tri Le, Toan Nguyen, Quang Tran, Quang Nguyen, Baoru Huang, Hoan Nguyen, Minh Nhat Vu, Tung D. Ta, Anh Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) University of Liverpool(利物浦大学) University of Information Technology(信息技术大学) Automation & Control Institute(自动化与控制研究所) Department of Creative Informatics(创意信息系) Faculty of Environment and Information Studies(环境与信息科学系)

专题命中 图像生成评测 :image generation(abstract)

AI总结 针对机器人设计领域缺乏大规模数据集的问题,介绍了含100万个样本的RoboDesign1M数据集,提出半自动数据收集管道,经多项实验评估,该数据集可推动机器人设计理解研究及相关自动化发展。

Comments 8 pages, accepted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09976 2026-06-26 cs.LG cs.RO 版本更新 50%

Reinforcement Fine-Tuning of Flow-Matching Policies for Vision-Language-Action Models

视觉-语言-动作模型的流匹配策略的强化微调

Mingyang Lyu, Yinqian Sun, Erliang Lin, Huangrui Li, Ruolin Chen, Feifei Zhao, Yi Zeng

机构 * Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences, Beijing, China(脑启发认知人工智能实验室,自动化研究所,中国科学院,北京,中国) Beijing Institute of AI Safety and Governance, China(北京人工智能安全与治理研究院,中国) State Key Laboratory of Brain Cognition and Brain-inspired Intelligence Technology(脑认知与脑启发智能技术国家重点实验室) Beijing Key Laboratory of Safe AI and Superalignment, China(北京安全人工智能与超对齐重点实验室,中国) University of Chinese Academy of Sciences (UCAS), Beijing, China(中国科学院大学(UCAS),北京,中国) Long-term AI,Beijing,China(长期人工智能,北京,中国)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 针对流匹配模型强化微调中重要性采样计算困难的问题,提出流策略优化算法,通过条件流匹配目标、结构感知信用分配等技术实现稳定在线微调,在LIBERO和ALOHA任务上超越基线。

Comments Accepted to ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14930 2026-06-23 math.NA cs.NA 版本更新 50%

Kernel-learning parameter prediction and evaluation in algebraic multigrid method for several PDEs

针对若干偏微分方程的代数多重网格方法中核学习参数预测与评估

Junyue Luo, Xiaoqiang Yue, Fangfang Zhang, Juan Zhang

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出基于高斯过程回归的代数多重网格参数优化策略,通过核学习构建核函数库并线性组合最优核,在小规模数据集上预测近优参数,显著降低计算时间并保持迭代次数与网格搜索一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25937 2026-06-17 cs.RO cs.LG 版本更新 50%

Can Vision Foundation Models Navigate? Zero-Shot Real-World Evaluation and Lessons Learned

视觉基础模型能否导航?零样本真实世界评估与经验教训

Maeva Guerrier, Karthik Soma, Jana Pavlasek, Giovanni Beltrame

机构 * Polytechnique Montreal(蒙特利尔理工学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 本文对五种视觉导航模型在真实环境中进行零样本评估,发现其存在几何理解不足、感知混淆和分布漂移等系统性问题,并公开评估代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21227 2026-06-12 cond-mat.mtrl-sci cs.AI 版本更新 50%

PhononBench:A Large-Scale Phonon-Based Benchmark for Dynamical Stability in Crystal Generation

PhononBench:面向晶体生成中动态稳定性的基于声子的大规模基准

Xiao-Qi Han, Ze-Feng Gao, Wen-Kao Li, Peng-Jie Guo, Zhong-Yi Lu

机构 * School of Physics, Renmin University of China(中国人民大学物理学院)

专题命中 图像生成评测 :diffusion(abstract)

AI总结 提出PhononBench,首个大规模AI生成晶体动态稳定性基准,利用MatterSim势高效计算声子,评估7个模型生成的133,838个结构,发现平均动态稳定性率仅32.15%。

Comments 53 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27303 2026-06-11 eess.SP 版本更新 50%

Point Spread Function Optimization for Communication-assisted UAV-borne MIMO TomoSAR

面向通信辅助的无人机载MIMO TomoSAR的点扩展函数优化

Pouya Fakharizadeh, Mohamed-Amine Lahmeri, Gerhard Krieger, Robert Schober

专题命中 图像生成评测 :image generation(abstract)

AI总结 针对无人机载MIMO合成孔径雷达层析成像系统,提出基于粒子群优化的联合无人机编队与卸载功率分配方法,以最小化点扩展函数旁瓣水平。

详情

展开后加载摘要…

URL PDF HTML 收藏