arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-06-23 至 2026-06-23 共收录 7
2605.04126 2026-06-23 cs.LG cs.NA math.NA 版本更新

Simultaneous CNN Approximation on Manifolds with Applications to Boundary Value Problems

流形上的同时CNN逼近及其在边值问题中的应用

Hanfei Zhou, Lei Shi

机构 * School of Mathematical Sciences, Fudan University(复旦大学数学学院) Shanghai Key Laboratory for Contemporary Applied Mathematics, Fudan University(上海当代应用数学重点实验室)

AI总结 提出用于紧黎曼流形上Sobolev逼近和椭圆边值问题的CNN方法,通过谱边界损失实现稳定求解,数值实验表明精度和收敛性优于标准PINN。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17902 2026-06-23 cs.LG cs.AI stat.ML 版本更新

DUPLE: An Intelligent Cross-Deployment Recognition Framework for Fiber-Optic Perimeter Security under Scarce Target Labels

基于统计的元学习用于分布式光纤传感跨部署活动识别

Yifan He, Haodong Zhang, Qiuheng Song, Lin Lei, Zhenxuan Zeng, Haoyang He, Hongyan Wu

机构 * College of Smart Materials(智能材料学院) Future Energy, Fiber-Optic Research Center, Fudan University, Shanghai 200433, China(未来能源、光纤研究中心、复旦大学、上海200433, 中国) School of Software, Northwestern Polytechnical University, Xi'an 710129, China(软件学院、西北工业大学、西安710129, 中国) Sichuan Fujinan Technology Co., Ltd., Chengdu 611400, China(四川傅南科技有限公司、成都611400, 中国) School of Computer Science, Northwestern Polytechnical University, Xi'an 710129, China(计算机学院、西北工业大学、西安710129, 中国)

AI总结 本文提出DUPLE框架,通过联合利用时频域特征和样本统计信息,提升分布式光纤传感跨部署识别的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12691 2026-06-23 cs.RO cs.AI 版本更新

ALOE: Action-Level Off-Policy Evaluation for Vision-Language-Action Model Post-Training

ALOE: 面向视觉-语言-动作模型后训练的动作级离策略评估

Rushuai Yang, Hecheng Wang, Zhichao Wu, Chiming Liu, Xiaohan Yan, Xuan Du, Shuoyu Yue, Chuheng Zhang, Yunlong Wang, Yongcheng Liu, Lizhe Qi, Yi Chen, Wei Shan, Maoqing Yao

机构 * AgiBot The Hong Kong University of Science and Technology(香港科技大学) Fudan University(复旦大学) Nanjing University(南京大学) Independent Researcher(独立研究者)

AI总结 提出ALOE框架,通过离策略评估直接估计当前策略的价值,结合分块时序差分和保守值聚合,改善稀疏奖励下的信用分配,在四项真实世界操作任务中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07078 2026-06-23 cs.LG cs.AI 版本更新

The Optimal Token Baseline: Variance Reduction for Long-Horizon LLM-RL

最优Token基线:长程LLM-RL的方差缩减

Yingru Li, Jiawei Xu, Ziniu Li, Jiacai Liu, Wei Liu, Yuxuan Tong, Longtao Zheng, Zhenghai Xue, Yaxiang Zhang, Tianle Cai, Ge Zhang, Qian Liu, Baoxiang Wang

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Hong Kong University of Science(香港科学大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Vector Institute(向量研究所)

AI总结 针对长程LLM-RL训练中梯度方差爆炸问题,从第一性原理推导最优Token基线,提出仅用前向概率近似梯度范数的Logit-Gradient Proxy,以N=4分组达到N=32性能,减少65%以上Token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10324 2026-06-23 cs.CV 版本更新

EchoingPixels: Aliasing-Resistant Joint Token Reduction for Audio-Visual LLMs

EchoingPixels: 抗混叠的音频-视觉联合令牌缩减方法

Chao Gong, Depeng Wang, Zhipeng Wei, Ya Guo, Huijia Zhu, Jingjing Chen

机构 * Fudan University(复旦大学)

AI总结 针对音频-视觉大语言模型中令牌冗余和位置混叠问题,提出EchoingPixels框架,通过跨模态语义筛和Sync-RoPE实现抗混叠的联合令牌缩减,仅用5-20%令牌达到全模型性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09388 2026-06-23 cs.LG cs.CL 版本更新

Don't Tell the Answer, Truly Guide the Reasoning During RL Rollouts

不要告诉答案,真正引导RL Rollout期间的推理

Xinyi Wang, Jinyi Han, Zishang Jiang, Tingyun Li, Jiaqing Liang, Sihang Jiang, Zhaoqian Dai, Shuguang Ma, Fei Yu, Yanghua Xiao

机构 * School of Data Science, Fudan University(复旦大学数据科学学院) Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学教育人工智能研究所) College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Ant Group(蚂蚁集团)

AI总结 针对强化学习中任务难度超出模型能力导致奖励稀疏的问题,提出HINT框架,通过元提示和亲和力感知策略优化,提升模型推理能力并保持训练稳定性。

Comments Accepted to Findings of ACL 2026. 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03058 2026-06-23 cs.LG cs.AI cs.CL 版本更新

VRPO: Rethinking Value Modeling for Robust RL under Noisy Supervision in LLM Post-Training

VRPO: 重新思考价值建模以实现大语言模型后训练中噪声监督下的鲁棒强化学习

Dingwei Zhu, Shihan Dou, Zhiheng Xi, Senjie Jin, Guoqiang Zhang, Jiazheng Zhang, Junjie Ye, Mingxu Chai, Enyu Zhou, Ming Zhang, Yuhui Wang, Caishuang Huang, Chenhao Huang, Yunke Zhang, Yuran Wang, Tao Gui, Qi Zhang, Xipeng Qiu, Xuanjing Huang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Honor Device Co., Ltd(荣耀设备有限公司) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身人工智能研究院) Shanghai Key Laboratory of Multimodal Embodied AI(上海多模态具身人工智能重点实验室)

AI总结 针对强化学习中噪声监督导致策略不稳定问题,提出VRPO框架,通过熵和困惑度辅助损失及变分信息瓶颈增强价值模型,使其能过滤噪声并生成可靠优势估计,在多项任务上优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏