arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Peking University(北京大学)

2026-07-22 至 2026-07-22 共收录 10
2607.18979 2026-07-22 cs.AI 新提交

Fishing Out Free Riders: Shapley-Based Reward Attribution for Parallel Reasoning via Reinforcement Learning

揪出搭便车者:基于夏普利值的强化学习并行推理奖励归因

Wentao Zhang, Haoyu Zhang, Xinke Jiang, Yuxuan Cheng, Yuhan Pan, Miao Li, Zhipeng Qiao, Tao Feng, Zhen Tao, Dengji Zhao

机构 * ShanghaiTech University(上海科技大学) City University of Hong Kong(香港城市大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Zhejiang University(浙江大学)

AI总结 研究大型语言模型多步推理中并行推理路径贡献难区分问题,提出基于夏普利值的强化学习框架并行夏普利值方法,通过量化边际贡献等实现按比例分配奖励,实验证明其优于基线且能改进多路径推理。

Comments 19 pages, 4 figures, 8 Tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18875 2026-07-22 cs.CV 新提交

Wave2Body: Rethinking mmWave Human Pose Estimation as Radar-to-Body Token Translation

Wave2Body:将毫米波人体姿态估计重新思考为雷达到身体的令牌转换

Bo Liang, Chen Gong, Wei Gao, Chenren Xu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) University of Pittsburgh(匹兹堡大学) Key Laboratory of High Confidence Software Technologies, Ministry of Education (PKU)(教育部高可信软件技术重点实验室(北京大学))

AI总结 针对毫米波雷达人体姿态估计问题,提出Wave2Body框架,通过自监督毫米波令牌器等解耦学习目标,在M4Human和mmBody实验中展现出比以往方法更强的跨域泛化能力及更低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18801 2026-07-22 cs.CV 新提交

ZeroSplat: Generalized Referring Segmentation in 3D Gaussian Splatting

ZeroSplat:3D高斯点云渲染中的广义指代分割

Jiayu Ding, Meilu Song, Xiaoyi Zhang, Hongbo Jin, Yichen Jin, Xiangtian Si

机构 * Peking University(北京大学) North China Electric Power University(华北电力大学) China University of Geosciences(中国地质大学)

AI总结 针对现有指代3D高斯点云渲染方法局限,提出ZeroSplat框架,通过多视图几何约束将2D视觉语言模型先验提升至3D空间,无需额外特征存储,在广义和单目标场景中显著优于现有方法,且效率高。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18715 2026-07-22 cs.AI 新提交

DWM: Separating World Effects from Actions in Latent World Models

DWM:在潜在世界模型中分离世界效应与动作

Yi-Ge Zhang, Tianqi Du, Qi Zhang, Yisen Wang

机构 * Peking University(北京大学)

AI总结 研究在潜在世界模型中分离世界效应与动作的问题,提出DWM框架,通过辅助世界头和正交性约束实现预测转换的显式加法分解,在构建的W变体基准测试中取得更好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18413 2026-07-22 cs.CL 新提交

Convolution for Large Language Models

大语言模型中的卷积

Yuchuan Tian, Yingte Shu, Wei He, Shuo Zhang, Tianchen Zhao, Chao Xu, Xinghao Chen, Yunhe Wang, Hanting Chen, Yu Wang

机构 * Peking University(北京大学) Huawei Technologies(华为技术有限公司) Tsinghua University(清华大学)

AI总结 研究大语言模型中,轻量级深度卷积能否在不大幅增模型大小的情况下提供局部归纳偏差。通过实验发现特定位置应用卷积效果最佳,采用特定残差深度卷积设计,在多个模型和数据预算下提升了下游基准平均准确率,支持其作为自注意力补充建模短程交互。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19241 2026-07-22 cs.LG physics.comp-ph physics.flu-dyn 新提交

Thermodynamics-Informed Input Reparameterization for Neural Prediction of Real-Fluid Thermodynamic Properties in Supercritical Combustion

用于超临界燃烧中真实流体热力学性质神经预测的热力学信息输入重新参数化

Haoze Zhang, Han Li, Ke Xiao, Yangchen Xu, Runze Mao, Zhi X. Chen

机构 * State Key Laboratory of Turbulence and Complex Systems, College of Engineering, Peking University(湍流与复杂系统国家重点实验室,北京大学工学院) AI for Science Institute (AISI)(科学智能研究院)

AI总结 研究超临界燃烧模拟中真实流体热力学性质评估成本高的问题,提出TAIR策略,通过用目标匹配的热力学坐标替换原始焓坐标,降低了预测温度、密度和压缩系数的RMSE,证明收益源于热力学匹配的输入设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10481 2026-07-22 cs.LG cs.AI cs.CL 版本更新

ARMOR: Stabilizing On-Policy LLM RL with Off-Policy Anchor Samples

ARMOR:使用离策略锚样本稳定在线大语言模型强化学习

Kexin Huang, Junkang Wu, Jinda Lu, Shuo Yang, Chiyu Ma, Jiancan Wu, Xiang Wang, Xiangnan He, Guoyin Wang, Jingren Zhou

机构 * University of Science and Technology of China(中国科学技术大学) Peking University(北京大学) Dartmouth College(达特茅斯学院)

AI总结 研究大语言模型强化学习训练不稳定问题,提出ARMOR框架,通过锚展开利用离策略数据保留解决方案模式,混合优化重新制定策略目标实现可控探索,经实验验证可有效减轻验证崩溃,提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04733 2026-07-22 cs.CL cs.LG 版本更新

LP-SFT: Local-Preserving Supervised Fine-Tuning via Multimodal Entropy Structure

LP-SFT:通过多模态熵结构进行局部保持监督微调

Yueyang Wang, Baolong Bi, Shuo Lu, Jingyuan Zhang, Jiajun Shi

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

AI总结 研究监督微调中存在的问题,利用香农和雷尼熵分析揭示预训练模型的多模态熵结构,提出LP-SFT目标,在多领域实验中提升性能,平衡准确率和k准确率。

Comments 20 pages, 3 figures. Code is available at https://github.com/Wakaka161/LP-SFT

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05282 2026-07-22 cs.CL

Not All Errors Are Created Equal: ASCoT Addresses Late-Stage Fragility in Efficient LLM Reasoning

并非所有错误都是同等重要:ASCoT解决高效大语言模型推理中的晚期脆弱性

Dongxu Zhang, Yujun Wu, Yiding Sun, Jinnan Yang, Ning Yang, Jihua Zhu, Miao Xin, Baoliang Tian

机构 * Xi’an Jiaotong University(西安交通大学) Peking University(北京大学) Institute of Automation, CASIA(中国科学院自动化研究所) Bytedance(字节跳动)

AI总结 ASCoT通过自适应校正机制提升大语言模型推理效率与可靠性,减少计算资源消耗的同时保持高准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14469 2026-07-22 cs.CL 版本更新

Measuring and Mitigating Post-hoc Rationalization in Reverse Chain-of-Thought Generation

反向思维链生成中的事后合理化测量与缓解

Guangyue Peng, Zongchao Chen, Wen Luo, Yuntao Wen, Wei Li, Ruixiang Feng, Ran Le, Chen Yang, Zhenwei An, Yang Song, Tao Zhang, Houfeng Wang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(信息处理国家重点实验室,计算机科学学院,北京大学) University of Electronic Science and Technology of China(电子科技大学) Nanbeige Lab, BOSS Zhipin(纳贝格实验室,BOSS智联)

AI总结 针对反向思维链生成中的事后合理化问题,提出结构骨架引导推理方法,通过解耦答案依赖而非抑制答案来缓解锚定效应,在开放推理基准上提升10%性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏