arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

2026-08-03 至 2026-08-03 共收录 6
2607.23802 2026-08-03 cs.AI 版本更新

From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement

从可验证奖励强化学习到自验证奖励强化学习:任务转换为开放式语言模型自我改进带来自验证奖励

Qinsi Wang, Jing Shi, Huazheng Wang, Kun Wan, Yiran Wu, Bo Liu, Qingyun Wu, Hai Helen Li, Yiran Chen, Handong Zhao, Wentian Zhao

机构 * Duke University(杜克大学) Adobe Inc.(奥多比公司) Oregon State University(俄勒冈州立大学) Pennsylvania State University(宾夕法尼亚州立大学) National University of Singapore(新加坡国立大学) Amazon(亚马逊)

AI总结 研究针对开放式LLM自我改进中奖励验证问题,提出基于任务转换的RLSVR方法,通过SpyRL实例化,在文本摘要等任务实验中,该方法在不可验证任务上优于现有方法,在可验证推理任务上有提升,扩展了基于RLVR的自我改进。

Comments COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23986 2026-08-03 cs.DB cs.AI cs.MA 版本更新

MemForest: An Efficient Agent Memory System with Hierarchical Temporal Indexing

MemForest: 一种具有层次化时间索引的高效智能体记忆系统

Han Chen, Zining Zhang, Wenqi Pei, Bingsheng He, Ming Wu, Jason Zeng, Michael Heinrich, Wei Wu, Hongbao Zhang

机构 * National University of Singapore(新加坡国立大学) Zero Gravity Labs(零重力实验室)

AI总结 针对长上下文LLM智能体记忆系统中粗粒度状态管理和顺序更新导致的维护开销问题,提出MemForest框架,通过并行块提取和层次化时间索引树MemTree实现高效写入和局部更新,在LongMemEval-S上达到79.8% pass@1准确率,吞吐量比现有方法高约6倍。

Comments 12 pages. Extended version with appendix as supplemental material. Submitted to VLDB

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16301 2026-08-03 cs.CY cs.AI cs.LG 版本更新

Do LLMs Hold Their Values? MANTA: A Multi-Turn Adversarial Benchmark for Animal Welfare Reasoning

LLMs 是否坚持其价值观?MANTA:一个用于动物福利推理的多轮对抗性基准

Isabella Luong, Joyee Chen, Sankalpa Ghose, David Williams-King, Linh Le, Allen Lu

机构 * SPAR Compassion Aligned Machine Learning(同情对齐机器学习) NUS(新加坡大学) Mila(Mila研究所) ERA Cambridge(剑桥ERA)

AI总结 提出 MANTA 基准,通过多轮对抗性对话评估大语言模型在动物福利推理中的价值观稳定性和道德敏感性,发现单轮基准无法捕捉的排名变化和物种-压力交互效应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03322 2026-08-03 cs.CL cs.AI 版本更新

Can Large Language Models Derive New Knowledge? A Dynamic Benchmark for Biological Knowledge Discovery

大语言模型能否推导新知识?一种动态生物知识发现基准

Chaoqun Yang, Xinyu Lin, Shulin Li, Wenjie Wang, Ruihan Guo, Fuli Feng, Tat-Seng Chua

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出DBench-Bio,一种动态生物知识发现基准,通过三阶段流程评估AI的新知识发现能力,揭示当前模型在知识发现上的局限性。

Comments Accepted by KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22876 2026-08-03 cs.LG 版本更新

Matterhorn: Masked Time-to-First-Spike Encoding by Reassigning the Silent State for Sparse and Energy-Efficient Spiking Transformers

Matterhorn: 一种高效的类脑稀疏脉冲变压器架构与掩码时间到首次脉冲编码

Zhanglu Yan, Kaiwen Tang, Zixuan Zhu, Zhenyu Bai, Qianhui Liu, Yongxin Zhu, Weng-Fai Wong

机构 * Department of computer science, National University of Singapore(新加坡国立大学计算机科学系) School of Artificial Intelligence, Shandong University(山东大学人工智能学院) Shanghai Advanced Research Institute, Chinese Academy of Science(中国科学院上海先进研究院) University of Chinese Academy of Sciences, Beijing(中国科学院大学北京校区)

AI总结 Matterhorn通过引入掩码时间到首次脉冲编码和类比计算在内存技术,实现高效稀疏脉冲变压器架构,提升能效并达到新的准确率水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18660 2026-08-03 cs.CV 版本更新

So-Fake: Benchmarking and Explaining Social Media Image Forgery Detection

So-Fake:社交媒体图像伪造检测的基准构建与可解释性研究

Zhenglin Huang, Xiangtai Li, Xi Yang, Bei Peng, Xiaowei Huang, Baoyuan Wu, Dacheng Tao, Ming-Hsuan Yang, Guangliang Cheng

机构 * University of Liverpool, UK(利物浦大学) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The University of Sheffield(谢菲尔德大学)

AI总结 该研究针对社交媒体图像伪造检测的数据集与基准缺口,构建了So-Fake-Set数据集与So-Fake-OOD分布外基准,提出采用强化学习的So-Fake-R1框架,其检测准确率与定位IoU均优于现有方法,为相关研究提供了新基础。

详情

展开后加载摘要…

URL PDF HTML 收藏