Mechanism-Guided Selective Unlearning for RLVR-Induced Reasoning
机制引导的选择性遗忘:针对RLVR诱导的推理
Chenyu Zhou, Qiliang Jiang, Shuning Wu, Xu Zhou
机构
*
School of Engineering, Institute of Science Tokyo, Japan(东京科学研究院工程学院)
;
College of Control Science and Engineering, Zhejiang University, China(浙江大学控制科学与工程学院)
;
Department of Electrical and Computer Engineering, National University of Singapore, Singapore(新加坡国立大学电子与计算机工程系)
Understanding Diversity Collapse in RLVR via the Lens of Overtraining
通过过度训练的视角理解RLVR中的多样性崩溃
Suqin Yuan, Jinkun Chen, Jiyang Zheng, Muyang Li, Lei Feng, Dadong Wang, Tao Xiang, Tongliang Liu, Bo An
机构
*
Sydney AI Centre, The University of Sydney(悉尼大学悉尼人工智能中心)
;
Southeast University(东南大学)
;
Microsoft(微软)
;
Data61, CSIRO(澳大利亚联邦科学与工业研究组织Data61)
;
Chongqing University(重庆大学)
;
Nanyang Technological University(南洋理工大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
机构
*
Tsinghua University(清华大学)
;
Chongqing University(重庆大学)
;
Peking University(北京大学)
;
ZenoMind AI
;
Xi’an Jiaotong University(西安交通大学)
;
Beijing Institute of Technology(北京理工大学)
;
Southeast University(东南大学)
;
Shanghai Jiao Tong University(上海交通大学)
;
Joy Future Academy(京东探索研究院)
;
The University of Hong Kong(香港大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
CommentsAccepted for publication in the Proceedings of the 30th International Conference on Knowledge-Based and Intelligent Information & Engineering Systems (KES 2026)
Comments11 pages, 7 figures. Accepted to IEEE VIS 2026 (Full Papers Track). Author's version accepted for publication in IEEE Transactions on Visualization and Computer Graphics
RTPO: Reverse-Turn Policy Optimization for Stabilizing Agentic RL Training
RTPO:用于稳定智能体强化学习训练的反向回合策略优化
Yugu Li, Jimmy Cao, Jianglin Qiao, Siyi Hu
机构
*
Adelaide University(阿德莱德大学)
;
The University of Sydney(悉尼大学)
;
Curtin University(科廷大学)
;
School of CSIT(计算机科学与信息技术学院)
;
ACFR(澳大利亚空间研究中心)
;
School of EECMS(电子工程、计算机与数学科学学院)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI
SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting--Extended Version
SCENARIODIFF:面向多模态时间序列预测的场景级引导框架——扩展版
Tuan-Binh Tran, Dat Nguyen Cong, Duc-Trong Le, Thanh Trung Huynh, Tung Kieu
机构
*
VinUniversity
;
FPT Software AI Center, FPT Corporation(FPT软件AI中心,FPT集团)
;
VNU University of Engineering and Technology(VNU工程技术大学)
;
Aalborg University(奥尔堡大学)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.LG
Comments10 pages. An extended version of "SCENARIODIFF: A Scenario-level Guidance Framework for Multimodal Time Series Forecasting" accepted at ICDM 2026
Why Vision Fails as a Universal Bridge: Rectifying Modality Asynchrony in Multilingual MLLMs
为何视觉无法作为通用桥梁:修正多语言多模态大语言模型(MLLMs)中的模态异步性
Yihang Du, Juhao Liang, Zhengzhao Lai, Siyu Li, Yan Hu
机构
*
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
;
Shenzhen Loop Area Institute(深圳河套学院)
;
National Health Data Institute (Shenzhen)(国家健康数据研究院(深圳))
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.CL
机构
*
School of Computer Science and Technology, University of Chinese Academy of Sciences (UCAS)(中国科学院大学计算机科学与技术学院)
;
Institute of Computing Technology (ICT), Chinese Academy of Sciences (CAS)(中国科学院计算技术研究所)
;
Beijing Academy of Artificial Intelligence (BAAI)(北京智源人工智能研究院)
;
School of Artificial Intelligence and Robotics, Hunan University(湖南大学人工智能与机器人学院)
专题命中
推理与问题求解
:large language model(abstract);language model(abstract);分类 cs.AI