A Critical Look At Tokenwise Reward-Guided Text Generation
Ahmad Rashid, Ruotian Wu, Julia Grosse, Agustinus Kristiadi, Pascal Poupart
机构
*
University of Waterloo(滑铁卢大学)
;
Vector Institute(向量研究所)
;
University of Tübingen(图宾根大学)
;
Tübingen AI Center(图宾根人工智能中心)
;
Western University(西方大学)
Brittleness and Promise: Knowledge Graph Based Reward Modeling for Diagnostic Reasoning
Saksham Khatwani, He Cheng, Majid Afshar, Dmitriy Dligach, Yanjun Gao
机构
*
University of Colorado Boulder(科罗拉多大学博尔德分校)
;
University of Colorado Anschutz(科罗拉多大学安舒茨分校)
;
University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
;
Loyola University Chicago(芝加哥洛约拉大学)
机构
*
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
;
University of Toronto(多伦多大学)
;
NVIDIA(英伟达)
;
Princeton University(普林斯顿大学)
;
Salesforce Research(Salesforce研究)
SUDER: Self-Improving Unified Large Multimodal Models for Understanding and Generation with Dual Self-Rewards
Jixiang Hong, Yiran Zhang, Guanzhong Wang, Yi Liu, Ji-Rong Wen, Rui Yan
机构
*
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)
;
School of Computer Science(计算机科学学院)
;
Baidu Inc.(百度公司)
;
School of Computer Science, Wuhan University(武汉大学计算机学院)
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Baidu Inc.(百度公司)
Comments10 pages, 9 figures, Under review as a full paper at AAAI 2026. A preliminary version is under review at the NeurIPS 2025 Workshop on Reliable ML from Unreliable Data
REFN: A Reinforcement-Learning-From-Network Framework against 1-day/n-day Exploitations
Tianlong Yu, Lihong Liu, Ziyi Zhou, Fudu Xing, Kailong Wang, Yang Yang
机构
*
School of Artificial Intelligence, Hubei University(湖北大学人工智能学院)
;
Huazhong University of Science and Technology(华中科技大学)
;
University of Southern California(美国南加州大学)
FinSage: A Multi-aspect RAG System for Financial Filings Question Answering
Xinyu Wang, Jijun Chi, Zhenghan Tai, Tung Sum Thomas Kwok, Muzhi Li, Zhuhong Li, Hailin He, Yuchen Hua, Peng Lu, Suyuchen Wang, Yihong Wu, Jerry Huang, Jingrui Tian, Fengran Mo, Yufei Cui, Ling Zhou
机构
*
1SimpleWay.AI 2McGill University 3University of Toronto 4University of California, Los Angeles 5The Chinese University of Hong Kong 6Duke University 7Universit\'e de Montr\'eal 8Mila - Quebec AI Institute 9Noah's Ark Lab 10CG Matrix Technology Limited
;
1SimpleWay.AI 2McGill University 3University of Toronto 4University of California, Los Angeles
;
5The Chinese University of Hong Kong 6Duke University 7Universit\'e de Montr\'eal 8Mila - Quebec AI Institute
;
9Noah's Ark Lab 10CG Matrix Technology Limited
专题命中
偏好对齐
:DPO(abstract);分类 cs.AI、cs.LG
CommentsAccepted at the 34th ACM International Conference on Information and Knowledge Management (CIKM2025)