arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Shanghai Jiao Tong University(上海交通大学)

共收录 3135
2603.13319 2026-08-03 cs.LG 版本更新

LightningRL: Breaking the Accuracy-Parallelism Trade-off of Block-wise dLLMs via Reinforcement Learning

LightningRL: 通过强化学习打破块状dLLMs的精度-并行性权衡

Yanzhe Hu, Yijie Jin, Pengfei Liu, Kai Yu, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出LightningRL框架,通过强化学习优化预训练dLLMs的速度-质量帕累托前沿,提升并行生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08390 2026-08-03 cs.RO cs.CV 版本更新

DuetHOI: Language-Guided Bimanual Hand--Object Motion Generation with Articulation Planning and Contact Refinement

StructBiHOI: 结构化关节建模用于长时程双臂手-物体交互生成

Zhi Wang, Yuyan Liu, Liu liu, Ruonan Liu, Ruixuan Liu

机构 * Hefei University of Technology(合肥工业大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 StructBiHOI通过结构化关节建模框架实现长时程双臂手-物体交互生成,提升稳定性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28596 2026-07-31 cs.RO 新提交

FA-RDP: A Frequency-Adaptive Reactive Diffusion Policy for Contact-Rich Manipulation

FA-RDP:用于接触丰富操作的频率自适应反应式扩散策略

Lifeng Zhuo, Wendi Chen, Han Xue, Shirun Tang, Jun Lv, Cewu Lu, Chuan Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix Ltd.(诺玛特里斯有限公司)

AI总结 FA-RDP 是一种频率自适应反应式扩散策略,通过多频率视觉-力 Transformer 和多模态指标动态调整采样策略,结合流形一致性蒸馏,在接触丰富操作任务中兼顾多模态保留与反应性,实现最高成功率。

Comments Project page: https://fa-rdp.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28590 2026-07-31 cs.CV cs.CL 新提交

VAD: Attributing Visual Evidence for Target Reconstruction in Multimodal On-Policy Distillation

VAD:为多模态在线策略蒸馏中的目标重建归因视觉证据

Kangning Zhang, Yixing Li, Shuai Shao, Qingyao Li, Zhengxi Lu, Zhiyuan Yao, Jianghao Lin, Wenxiang Jiao, Yuan Lu, Weiwen Liu, Weinan Zhang, Yong Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Xiaohongshu Inc.(小红书公司) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Southeast University(东南大学)

AI总结 该研究提出视觉归因蒸馏(VAD)算法,通过反事实目标重建分离教师校正中的视觉证据分量,在6个4B/9B规模的细粒度视觉基准上,性能优于现有蒸馏方法。

Comments The project is accessible at https://github.com/DeepExperience/VAD_Multimodal_OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28243 2026-07-31 cs.CV cs.AI 新提交

EgoGenesis: Egocentric World-Action Modeling with Online Anchored Projective Memory and Action-3D RoPE

EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模

Zexuan Yan, Yuzhou Wu, Yue Ma, Zonghang He, Kaibo Yin, Xiaobing Tu, Yinggui Wang, Jinkui Ren, Xiantao Zhang, Shijian Wang, Jinghong Liu, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Alibaba Group(阿里巴巴集团) Tianji KernalMind Co., Ltd.(天机芯智有限公司) The Hong Kong University of Science and Technology(香港科技大学) Southeast University(东南大学) Renmin University of China(中国人民大学) The University of Tokyo(东京大学)

AI总结 本文提出EgoGenesis模拟器,通过在线锚定投影记忆与Action-3D RoPE合成自我中心操作视频,扩充训练数据,显著提升了真实机器人单臂、双臂任务的分布外操作成功率。

Comments project page: https://egogenesis.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28022 2026-07-31 cs.LG cs.AI 新提交

Flux-OPD: On-Policy Distillation with Evolving Contexts

Flux-OPD:基于演化上下文的在线策略蒸馏

Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang, Yifan Dai, Yang Shi, Bozhou Li, Chengzhuo Tong, Daili Hua, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team(KLING团队) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院)

AI总结 该研究针对开放域大语言模型训练缺乏可验证奖励的问题,提出Flux-OPD范式,利用演化上下文作为监督,通过分解反向KL目标优化,在开放域任务上性能优于现有OPD范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27888 2026-07-31 cs.AI 新提交

Not All Tokens Deserve Equal Credit: Counterfactual Sensitivity Credit Reallocation for Long-CoT Reasoning

并非所有 token 都应获得同等权重:面向长思维链(Long-CoT)推理的反事实敏感性权重重分配

Qiangqiang He, Zhongheng Wu, ZiJian Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) Institute of Wireless Communications Technology, Shanghai Jiao Tong University(上海交通大学无线通信技术研究所)

AI总结 针对长思维链推理中均匀分配 token 权重的缺陷,提出反事实敏感性权重重分配方法,在数学推理基准上优于 GRPO,验证了特权诱导方向不可靠的诊断。

Comments 20 pages, 6 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24101 2026-07-31 cs.CV cs.AI 版本更新

LU-500: A Logo Benchmark for Concept Unlearning

LU-500:用于概念遗忘的标志基准

Keyu Li, Jin Gao, Jialing Zhang, Dequan Wang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 研究文本到图像模型中概念遗忘里公司标志未被充分研究的问题,引入LU-500基准及多粒度协议,通过实验评估多种方法,分析ProLU基线,指出未来标志遗忘或需空间感知控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03328 2026-07-31 cs.LG cs.AI 版本更新

Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning

校准数据在能力维度上的权衡:为什么多源混合对高稀疏LLM剪枝至关重要

Hu Xu, Zhaolong Xing, Congcong Liu, Jiaxing Wang, Zhida Jiang, Junshi Huang, Zhen Chen, Jianfeng Xu

机构 * Shanghai Jiao Tong University(上海交通大学) JD.com(京东公司)

AI总结 通过分解后剪枝能力维度并分析15个校准源,发现校准困惑度与通用能力保留正相关但与数学和代码能力保留负相关,提出多源混合校准方法IGSP以平衡各维度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24973 2026-07-31 cs.CV cs.AI cs.CL 版本更新

MinerU-Popo: Universal Post-Processing Model for Structured Document Parsing

MinerU-Popo:结构化文档解析的通用后处理模型

Bangrui Xu, Ziyang Miao, Xuanhe Zhou, Yiming Lin, Zirui Tang, Xiaomeng Zhao, Fan Wu, Cheng Tan, Fan Wu, Bin Wang, Conghui He

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) University of California, Berkeley(加州大学伯克利分校)

AI总结 提出MinerU-Popo轻量级通用后处理框架,通过分解为文本/表格截断恢复、标题层级重建和图文关联四个子任务,并利用动态分块和重叠同步将OCR页面级结果重构为文档级逻辑结构,显著提升标题层级TEDS和RAG准确性。

Comments The code is available at https://github.com/opendatalab/MinerU-Popo

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26914 2026-07-30 cs.RO cs.AI 新提交

BioVLN: A Simulation Platform for Visual Language Navigation in Biomedical Laboratories

BioVLN:生物医学实验室视觉语言导航的仿真平台

Zhe Liu, Quan Lu, Zhaohui Du, Zhe Wang, Huanbo Jin, Jiaming Gu, Qi Wang, Ting Xiao, Minting Pan, Dongzhan Zhou

机构 * East China University of Science and Technology(华东理工大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Shanghai AI Laboratory(上海人工智能实验室)

AI总结 该研究针对现有导航平台不适用于实验室仪器的问题,提出BioVLN仿真平台,通过分区域建模仪器实现更精准导航,实验验证其提升成功率并降低安全风险。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26784 2026-07-30 cs.LG cs.AI 新提交

SkillRise: Agentic Reinforcement Learning for Cross-Task Skill Evolution

SkillRise:面向跨任务技能演化的智能体强化学习

Zhiyuan Yao, Yuxin Chen, Zhengxi Lu, Zishan Xu, Yueqing Sun, Yifu Guo, Yuquan Lu, Zhengzhou Cai, Kangning Zhang, Zhuowen Han, Zi-Han Wang, Ziang Ye, Qi Gu, Xunliang Cai, Weiwen Liu, Yongliang Shen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Shanghai Jiao Tong University(上海交通大学) Meituan(美团)

AI总结 SkillRise是跨任务学习技能的统一强化学习框架,解耦信用分配机制实现任务求解与技能整理,在多基准上Pass@1性能优于基线,还降低了运行开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26647 2026-07-30 cs.CV 新提交

Anchoring and Steering Diffusion: Enhancing the Faithfulness of Text-to-Image Generation at Inference Time

锚定与引导扩散:在推理时提升文生图生成的忠实度

Xinyi Wang, Yuyang Huang, Yalin Su, Pengcheng Luan, Tao Zhang, Feiming Wei, Wenxian Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出无训练框架AnchorSteer,通过语义锚定与反射引导组件改进文生图扩散模型的推理,在GenEval等基准上提升文本-图像对齐性能且保持视觉质量。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26529 2026-07-30 cs.CV 新提交

CineWeaver: Training-Free Reference-Controllable Multi-Shot Long Video Generation for Cinematic Storytelling

CineWeaver:用于电影叙事的无训练参考可控多镜头长视频生成

Yuyang Huang, Yabo Chen, Wenrui Dai, Ziyang Zheng, Haibin Huang, Chi Zhang, Junni Zou, Hongkai Xiong, Xuelong Li

机构 * Shanghai Jiao Tong University(上海交通大学) China Telecom(中国电信) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(电信AI))

AI总结 CineWeaver是首个无训练的统一框架,通过操控位置编码、注意力模式等,实现参考可控的多镜头长视频生成,产出的电影视频时长较长且质量高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26393 2026-07-30 cs.AI 新提交

CaM-Wolf: Causal-Aware Multimodal Agents for Social Deduction Games

CaM-Wolf:面向社交推理游戏的因果感知多模态智能体

Zheng Zhang, Nanjie Yao, Jiarui He, Deheng Ye, Peilin Zhao, Hao Wang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanyang Technological University(南洋理工大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对现有SDG智能体多模态特性缺失的问题,提出首个整合多模态感知生成的CaM-Wolf,经实验验证其游戏性能与交互质量均有提升。

Comments Accepted by ACMMM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25765 2026-07-30 cs.RO 版本更新

StairMaster: Learning to Conquer Risky Hollow Stairs for Agile Quadrupedal Robots

StairMaster: 学习征服危险空心楼梯的敏捷四足机器人

Xincheng Tang, Youhan Xie, Zhengjie Shu, Wanyu Li, Lai Jiang, Wenkang Hu, Yitong Li, Ruigang Yang

机构 * Shanghai Jiao Tong University(上海交通大学)

AI总结 提出StairMaster,一种三阶段强化学习框架,通过交叉注意力机制、空间感知循环单元和高保真深度传感器建模,实现四足机器人在空心楼梯上的稳定攀爬,零样本迁移达到55°坡度。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16986 2026-07-30 cs.CL cs.AI 版本更新

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Skills on the Fly: Test-Time Adaptive Skill Synthesis for LLM Agents

Jingxing Wang, Chenyu Zhou, Zhihui Fu, Jun Wang, Weiwen Liu, Weinan Zhang, Jianghao Lin

机构 * Shanghai Jiao Tong University(上海交通大学) OPPO Research Institute(OPPO研究院)

AI总结 本文提出了一种在测试时自适应的技能合成方法SkillTTA,通过检索与当前任务相关的少量训练轨迹并将其合成成为任务特定的文本技能,以提高LLM代理在SpreadsheetBench、ALFWorld和BigCodeBench等任务上的性能。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14029 2026-07-30 cs.CV 版本更新

POINTS-Seeker: An Open Recipe for Multimodal Search Agents with Visual Memory Management

POINTS-Seeker:从零开始训练多模态代理搜索模型

Yikun Liu, Yuan Liu, Haicheng Wang, Zhongyin Zhao, Le Tian, Xiao Zhou, Jiangchao Yao, Yanfeng Wang, Weidi Xie

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) CMIC, Shanghai Jiao Tong University(上海交通大学CMIC) WeChat AI, Tencent(腾讯WeChat AI)

AI总结 本文提出POINTS-Seeker模型,通过引入代理播种机制和V-Fold压缩方案,解决长周期交互中的证据检索问题,并在六个基准测试中超越现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25393 2026-07-29 cs.CV 新提交

Towards Reliable Stain Transfer: An Iterative Data-Model Co-Optimization Framework Based on Multimodal Expert-Guided Assessment

迈向可靠的染色转移:基于多模态专家指导评估的迭代数据-模型协同优化框架

Siyuan Xu, Yan Wang, Haofei Song, Lili Gao, Jiansheng Wang, Qing Zhang, Dan Huang, Boxiang Yun, Hongkai Xiong, Qingli Li

机构 * East China Normal University(华东师范大学) Ruijin Hospital, Shanghai Jiao Tong University School of Medicine(上海交通大学医学院附属瑞金医院) Hangzhou Hyperspectral Imaging Technology Co., Ltd.(杭州高光谱成像技术有限公司) Fudan University Shanghai Cancer Center(复旦大学附属肿瘤医院)

AI总结 研究针对染色转移建模难题,提出DMCoStain框架,通过迭代优化数据与模型能力提升准确性和可解释性。基于IPE视觉语言模型构建MEGFS策略并创建ImmunoInstruction数据集,实验证明该框架达最优精度,其范式有实用价值,MEGFS可作评估工具。

Comments 10 pages, accepted by ACMMM2026 Main Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25294 2026-07-29 cs.CV cs.AI cs.CL cs.LG 新提交

CLBench-V: Evaluating Multimodal Context Learning from Grounding to Knowledge Acquisition

CLBench-V:评估从基础到知识获取的多模态上下文学习

Lai Wei, Chengqi Li, Jiapeng Li, Ruina Hu, Yue Wang, Weiran Huang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) Zhongguancun Academy(中关村科学城创新中心) Shanghai Innovation Institute(上海创新研究院)

AI总结 研究多模态上下文学习问题,引入CLBench-V基准,围绕上下文基础、新信息应用和新知识学习三个维度组织任务,结合公共基准与新数据集,经自动化程序构建,测试六个模型,分析相关因素,揭示多模态上下文学习远未饱和及各模型表现情况。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24889 2026-07-29 cs.LG cs.AI cs.CE 新提交

GAUGE: Grading Agent-Built Financial Models Without a Golden Answer

GAUGE:在没有标准答案的情况下对代理构建的金融模型进行评分

Jiacheng Lu, Sinuo Wang, Wentao Zhao, Rui Sun, Cheng Hua, Tao Song, Hui Cai, Beidi Luan, Zhengze Wu, Lingjing Teng, Yijia He, Jing Li, Daxin Jiang, Zuo Bai, Haibing Guan

机构 * Shanghai Jiao Tong University(上海交通大学) University of Adelaide(阿德莱德大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Peking University(北京大学)

AI总结 研究针对金融模型无标准答案的问题,引入GAUGE基准,依据分析师实际做法评估代理构建的估值模型,通过多种方式验证,揭示高级、初级分析师及学生在模型评分上的差异,指出当前代理在模型构建与估值判断上的强弱情况,并发布相关资源。

Comments 35 pages, including appendices. Code, benchmark materials, and evaluation artifacts will be publicly released

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24863 2026-07-29 cs.RO 新提交

Steeringless Drifting: Differential-Torque Control of a Four-Wheel Independently Driven Vehicle

无舵漂移:四轮独立驱动车辆的差动扭矩控制

Sheng Zhao, Zexin Wu, Dongyang Zhou, Bolin Zhao, Xiaodong Wu

机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械工程学院) School of Mechanical and Aerospace Engineering, Nanyang Technological University(南洋理工大学机械与航天工程学院)

AI总结 研究针对无舵四轮独立驱动车辆,提出基于双轨车辆模型的差动扭矩漂移控制方法,经仿真和实验验证,该方法能使车辆实现特定角度的稳定圆周漂移及8字漂移跟踪,证明了仅用差动轮扭矩漂移控制的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24780 2026-07-29 cs.AI 新提交

LivingArena: Do LLMs Know What Other LLMs Don't? Peer-Probing as Scalable Evaluation

LivingArena:大语言模型知道其他大语言模型所不知道的吗?作为可扩展评估的对等探测

Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

机构 * Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 研究大语言模型能否利用其他模型的未知进行评估,提出自动化抗污染评估框架LivingArena,模型轮流提问,经评审验证,能产生稳定排行榜,可衡量事实严谨性等,与人类偏好相关性弱,提供低成本持续评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24771 2026-07-29 cs.AI cs.LG 新提交

RoCo-ACE: Rollout-Conditioned Online Distillation for Retention-Aware Knowledge Injection

RoCo-ACE:用于保留感知知识注入的基于展开的在线蒸馏

Yan Hong, Wei Li, Kedong Xiu, Jun Lan, Shuheng Zhou, Zhongcai Lyu, Huijia Zhu, Weiqiang Wang, Jianfu Zhang

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对知识注入中拟合权威答案致行为偏差问题,提出RoCo-ACE方法,通过同展开无参考/基于参考条件的似然对比及参考侧锚定校正,在多知识注入设置等下,实现最佳注入知识准确性且保持保留率接近基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13454 2026-07-29 cs.CV cs.AI 版本更新

GeoAnchor: Collaborative Reasoning via Latent Decomposition for 3D Spatial Understanding

GeoAnchor:通过潜在分解进行协作推理以实现3D空间理解

Hao Li, Han Fang, Zixin Pan, Xin Wei, Hongbo Sun, Jinglin Xu, Zhiyu Lin, Ye Yuan, Zhongjiang He, Yu Yu, Hao Sun

机构 * Shanghai Jiao Tong University(上海交通大学) Xingchen AGI Lab, China Telecom Artificial Intelligence Technology (Beijing) Co., Ltd(星辰通用人工智能实验室,中国电信人工智能技术(北京)有限公司) University of Science and Technology Beijing(北京科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 针对从2D图像理解3D空间关系的挑战,提出GeoAnchor框架,通过分解3D空间信息为互补组件并结合协作训练策略,实现动态可解释推理,在复杂3D推理任务中优于现有技术。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30147 2026-07-29 cs.CV 版本更新

T2LDM++: A Self-Conditioned Representation Guided Diffusion Model for Realistic Text-to-LiDAR Scene Generation

T2LDM++:一种用于真实文本到激光雷达场景生成的自条件表示引导扩散模型

Wentao Qu, Qi Zhang, Chenxu Wang, Guofeng Mei, Yongfei Liu, Xiaoshui Huang, Gim Hee Lee, Liang Xiao

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Nanjing University of Science and Technology(南京理工大学) Faculty of Data Science(数据科学学院) City University of Macau(澳门城市大学) Beijing Institute of Technology(北京理工大学) Fondazione Bruno Kessler(布鲁诺·凯瑟尔基金会) School of Public Health(公共卫生学院) Shanghai Jiao Tong University(上海交通大学) School of Computing(计算机学院) National University of Singapore(新加坡国立大学)

AI总结 针对文本-激光雷达数据稀缺导致场景过平滑和可控性不足的问题,提出T2LDM++模型,通过自条件表示引导(SCRG)提供重建监督,并构建高质量基准数据集,实现几何细节丰富的激光雷达场景生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06908 2026-07-29 cs.CV 版本更新

polyDAG: Polynomial Acyclicity Constraints for Efficient Continuous Causal Discovery in Visual Semantic Graphs

polyDAG:用于视觉语义图中高效连续因果发现的多项式无环性约束

Wenhao Zhang, Ramin Ramezani, Tao Han, Kai Hwang, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) University of California, Los Angeles(加州大学洛杉矶分校) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出多项式无环性约束框架polyDAG,用有限多项式迹约束替代矩阵指数约束,实现视觉语义图中高效的连续有向无环图学习,在合成图和CelebA数据集上提升了效率与结构恢复性能。

Comments Published at the Visual Computer on July 24th, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06276 2026-07-29 cs.CV cs.AI 版本更新

RefBench-PRO: Perceptual and Reasoning Oriented Benchmark for Referring Expression Comprehension

RefBench-PRO:面向感知与推理的指称表达理解基准

Tianyi Gao, Hao Li, Han Fang, Xin Wei, Xiaodong Dong, Hongbo Sun, Ye Yuan, Zhongjiang He, Jinglin Xu, Jingmin Xin, Hao Sun

机构 * National Key Laboratory of Human-Machine Hybrid Augmented Intelligence(国家人机混合增强智能重点实验室) National Engineering Research Center for Visual Information and Applications(国家视觉信息与应用工程技术研究中心) Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院) Xi’an Jiaotong University(西安交通大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI)) China Telecom(中国电信) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology Beijing(北京科技大学)

AI总结 RefBench-PRO提出一个面向感知与推理的指称表达理解基准,通过分解指称表达为感知和推理两个维度,设计六个逐步递增的挑战任务,并引入Ref-R1强化学习方案提升定位精度,实现对多模态大语言模型的可解释评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00411 2026-07-29 cs.LG 版本更新

Diffusion Disambiguation Models for Partial Label Learning

用于部分标签学习的扩散消歧模型

Jinfu Fan, Xiaohui Zhong, Kangrui Ren, Jiangnan Li, Linqing Huang, Min Gan, C. L. Philip Chen

机构 * College of Computer Science and Technology, Qingdao University(青岛大学计算机科学与技术学院) Department of Control Science and Engineering, College of Electronics and Information Engineering, Tongji University(电子信息工程学院控制科学与工程系,同济大学) School of Electronic Information and Electrical Engineering, Shanghai Jiao Tong University(上海交通大学电子信息与电气工程学院)

AI总结 研究从模糊标签学习的问题,基于扩散模型提出用于部分标签学习的扩散消歧模型(DDMP),利用实例与标签互补信息构建伪干净标签,引入过渡感知矩阵估计潜在真实标签,经实验验证了DDMP在部分标签学习中的优势。

Comments Accepted by IEEE TCSVT

详情

展开后加载摘要…

URL PDF HTML 收藏