arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Chinese University of Hong Kong(香港中文大学)

2026-07-22 至 2026-07-22 共收录 4
2607.18979 2026-07-22 cs.AI 新提交

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因

Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao

机构 * ShanghaiTech University(上海科技大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学)

AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。

Comments 19 pages, 4 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18910 2026-07-22 cs.LG 新提交

Breaking Feedback-Blindness: Utility-Augmented Transformer for Sequential Decision Making

打破反馈盲目性:用于序列决策的效用增强Transformer

Yuyang Shen, Shan Dai, Daimin Chen

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Research Institute of Big Data(深圳大数据研究院) University of International Business and Economics(对外经济贸易大学)

AI总结 研究非平稳和部分可观测环境下序列决策问题,提出效用增强Transformer(UAT),通过紧凑效用状态调制注意力检索,解决现有模型反馈盲目性问题,在四个非平稳基准测试中性能优于其他基线。

Comments 25 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18724 2026-07-22 cs.AI 新提交

One Rewrite to Fix Them All? Type-Aware Repair Allocation for Text-to-Image Prompt Optimization

一劳永逸?用于文本到图像提示优化的类型感知修复分配

Haoyue Liu, Xiaoyu Ma, Ye Chen, Shuguang Cui, Xiaoying Tang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)理工学院) XJTU-POLIMI Joint School, Xi’an Jiaotong University(西安交通大学-米兰理工大学联合学院) Shenzhen Future Network of Intelligence Institute (FNii-Shenzhen)(深圳未来智能网络研究院)

AI总结 研究文本到图像提示优化问题,提出将语义提示优化制定为原子修复分配的方法,在无需训练的TARA框架中实例化,实验表明该方法在多个基准生成器单元中语义准确性最佳,且运行快、图像质量好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18252 2026-07-22 cs.AI cs.NE 新提交

MILP-Evo: Closed-Loop Fully Automatic Design of MILP Solvers

MILP-Evo:混合整数线性规划求解器的闭环全自动设计

Jinbiao Nie, Kewei Feng, Xiaoyuan Zhang, Shan Yin, Zizhuo Wang, Bin Dong

机构 * BUPT(北京邮电大学) BZA(未提及具体中文名,推测可能是某个机构简称) BIT(北京理工大学) CUHK-Shenzhen(香港中文大学(深圳)) PKU(北京大学)

AI总结 研究能否将MILP求解器逻辑自动设计为LLM引导的闭环搜索,提出闭环程序演化框架,通过PySCIPOpt实现,在割集选择器和分支规则联合设计上实例化,输出可检查修改部署的组件,在多基准测试中发现有竞争力的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏