arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Science and Technology of China(中国科学技术大学)

2026-08-10 至 2026-08-10 共收录 4
2608.07147 2026-08-10 cs.AI 新提交

DiDPO: Diff-in-Diff Policy Optimization for Coding Agent Training

DiDPO:用于编码智能体训练的差异内差异策略优化

Xucong Wang, Zhe Zhao, Liheng Yu, Di Wu, Xiaofeng Cao, Pengkun Wang

机构 * University of Science and Technology of China (USTC)(中国科学技术大学) Stanford University(斯坦福大学) Suzhou Institute for Advanced Research, USTC(中国科学技术大学苏州高等研究院) Tongji University(同济大学)

AI总结 针对编码智能体训练的细粒度信用分配难题,提出DiDPO方法,在Qwen2.5-7B-Coder上性能超可比方法10%以上,开源了支持多种RL方法的verl-code代码库。

Comments 16 pages, 6 figures, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06745 2026-08-10 cs.AI 新提交

MemPrism: Task-Conditioned Relational Memory Views for Long-Horizon Agents

MemPrism:面向长程智能体的任务条件关系记忆视图

Zhisheng Chen, Bingfan Zeng, Bangde Cao, Zhengwei Xie, Yuxuan Li, Jinhan Li, Zheng Lu, Xiangchen Guan, Zikai Xiao, Rui Qian, Jingwei Song

机构 * Nanyang Technological University(南洋理工大学) South China University of Technology(华南理工大学) Beijing University of Posts and Telecommunications(北京邮电大学) University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 该研究针对长程智能体记忆系统的表示不匹配问题,提出MemPrism任务条件关系记忆框架,经实验验证可提升长程任务性能、减少记忆消耗且视图策略可跨VLM迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30380 2026-08-10 cs.GR cs.CV cs.LG 版本更新

RenderFormer++: Scalable and Physics-Informed Feed-Forward Neural Rendering

RenderFormer++:可扩展且物理基础的馈送前向神经渲染

Huangsheng Du, Haoran Zhu, Youcheng Cai, Jingyang Meng, Ligang Liu

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 提出RenderFormer++框架,通过物理信息传输引导(PITG)和层次化对象中心分词(HOCT)解决现有Transformer神经渲染的物理一致性和可扩展性问题,实现大规模场景的高效全局光照渲染。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19597 2026-08-10 cs.LG stat.ML

The Geometric Mechanics of Contrastive Representation Learning: Alignment Potentials, Entropic Dispersion, and Cross-modal Divergence

对比表示学习的几何力学:对齐势、熵分散和跨模态散度

Yichao Cai, Zhen Zhang, Yuhang Liu, Javen Qinfeng Shi

机构 * University of Science and Technology of China(中国科学技术大学)

AI总结 本文通过测度论框架,在大批量极限下证明InfoNCE目标与确定性能量景观的等价性,揭示单模态与对称多模态之间的几何分岔,并指出跨模态散度项导致模态间隙。

Comments 54 Pages, ICML 2026 (Refined document aesthetics for clearer reading)

详情

展开后加载摘要…

URL PDF HTML 收藏