arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-04-22 至 2026-04-22 共收录 4
2604.19485 2026-04-22 cs.LG cs.AI cs.CL

EVPO: Explained Variance Policy Optimization for Adaptive Critic Utilization in LLM Post-Training

EVPO:用于大语言模型后训练中自适应批评者利用的解释方差策略优化

Chengjun Pan, Shichun Liu, Jiahang Lin, Dingwei Zhu, Jiazheng Zhang, Shihan Dou, Songyang Gao, Zhenhua Han, Binghai Wang, Rui Zheng, Xuanjing Huang, Tao Gui, Yansong Feng

机构 * Peking University(北京大学) Fudan University(复旦大学) Shanghai Qiji Zhifeng Co., Ltd.(上海启智科技有限公司) Shanghai AI Lab(上海人工智能实验室)

AI总结 本文提出EVPO,通过监控批量方差并自适应切换基于批评者或批量均值估计,证明在每一步都能达到更小的方差。在四个任务中,EVPO优于PPO和GRPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11913 2026-04-22 cs.CL cs.AI

LSTM-MAS: A Long Short-Term Memory Inspired Multi-Agent System for Long-Context Understanding

LSTM-MAS:一种受长短期记忆启发的多智能体系统用于长上下文理解

Yichen Jiang, Jiakang Yuan, Chongjun Tu, Peng Ye, Tao Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出LSTM-MAS多智能体系统,通过模仿LSTM的层次信息流和门控机制,解决长上下文处理中的误差累积和幻觉传播问题,实验表明在多个问答数据集上取得显著提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04237 2026-04-22 cs.AI cs.CL cs.LG

SAGE-32B: Agentic Reasoning via Iterative Distillation

SAGE-32B:通过迭代蒸馏实现代理推理

Basab Jha, Firoj Paudel, Ujjwal Puri, Ethan Henkel, Zhang Yuting, Mateusz Kowalczyk, Mei Huang, Choi Donghyuk, Wang Junhao

机构 * SAGEA Tribhuwan University(特里布文大学) Vedas College(韦达学院) Madan Bhandari Memorial College(马丹·班达里纪念学院) Fudan University(复旦大学) ETH Zurich(苏黎世联邦理工学院)

AI总结 SAGE-32B是一种专注于代理推理和长期规划的320亿参数语言模型,通过迭代蒸馏提升推理能力,在代理推理基准测试中表现出色。

Comments 23 Pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20182 2026-04-22 cs.CL cs.AI

FaithLens: Detecting and Explaining Faithfulness Hallucination

FaithLens:检测并解释忠实性幻觉

Shuzheng Si, Qingyi Wang, Haozhe Zhao, Yuzhuo Bai, Guanqiao Chen, Kangyang Luo, Gang Chen, Fanchao Qi, Minjia Zhang, Baobao Chang, Maosong Sun

机构 * Tsinghua University(清华大学) DeepLang AI Fudan University(复旦大学) University of Illinois Urbana-Champaign(伊利诺伊大学香槟分校) Peking University(北京大学)

AI总结 本文提出FaithLens模型,通过合成训练数据和规则强化学习,有效检测并解释大语言模型中的忠实性幻觉,优于GPT-5.2和o3模型,提升可信度与效率。

Comments ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏