Writing-RL: Advancing Long-form Writing via Adaptive Curriculum Reinforcement Learning
Writing-RL: 通过自适应课程强化学习推进长文本写作
Xuanyu Lei, Chenliang Li, Yuning Wu, Kaiming Liu, Weizhou Shen, Peng Li, Ming Yan, Fei Huang, Ya-Qin Zhang, Yang Liu
机构
*
Institute for AI Industry Research (AIR)(人工智能产业研究院)
;
Tsinghua University(清华大学)
;
Dept. of Comp. Sci. & Tech.(计算机科学与技术系)
;
Institute for AI(人工智能研究院)
;
Institute of Intelligent Computing(智能计算研究院)
;
Alibaba Group(阿里巴巴集团)
Comments51 pages, 14 figures. We present Six Llamas, a comparative study examining whether Llama-3.1-8B models fine-tuned on distinct religious corpora encode systematically different patterns of ethical reasoning. Five LoRA-adapted variants are constructed for Christianity, Islam, Judaism, Hinduism, and Buddhism. For theoretical background on the condensate comparative method, see arXiv:2603.07329
Position: Multimodal Large Language Models Can Significantly Advance Scientific Reasoning
位置:多模态大语言模型可以显著推动科学推理
Yibo Yan, Shen Wang, Jiahao Huo, Jingheng Ye, Zhendong Chu, Xuming Hu, Philip S. Yu, Carla Gomes, Bart Selman, Qingsong Wen
机构
*
Squirrel AI
;
HKUST(GZ)(香港科技大学(广州))
;
HKUST(香港科技大学)
;
Tsinghua University(清华大学)
;
University of Illinois at Chicago(伊利诺伊大学香槟分校)
;
Cornell University(康奈尔大学)
NumCoKE: Ordinal-Aware Numerical Reasoning over Knowledge Graphs with Mixture-of-Experts and Contrastive Learning
NumCoKE: 基于混合专家和对比学习的图知识中有序意识数值推理
Ming Yin, Zongsheng Cao, Qiqing Xia, Chenyang Tu, Neng Gao
机构
*
State Key Laboratory of Cyberspace Security Defense(网络空间安全防御国家重点实验室)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Department of Information Science, Tsinghua University(清华大学信息学院)
GRAIL: Autonomous Concept Grounding for Neuro-Symbolic Reinforcement Learning
GRAIL:自主概念 grounding 用于神经符号强化学习
Hikaru Shindo, Henri Rößler, Quentin Delfosse, Kristian Kersting
机构
*
Technical University of Darmstadt(达姆施塔特技术大学)
;
Google Intrinsic(谷歌内在)
;
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI))
;
Centre for Cognitive Science, TU Darmstadt(达姆施塔特技术大学认知科学中心)
MetaMem: Evolving Meta-Memory for Knowledge Utilization through Self-Reflective Symbolic Optimization
MetaMem: 通过自反思符号优化实现元记忆的进化以促进知识利用
Haidong Xin, Xinze Li, Zhenghao Liu, Yukun Yan, Shuo Wang, Cheng Yang, Yu Gu, Ge Yu, Maosong Sun
机构
*
School of Computer Science and Engineering, Northeastern University, Shenyang, China(东北大学计算机科学与工程学院)
;
Department of Computer Science and Technology, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)
;
School of Computer Science, Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学计算机学院)
BOOKAGENT: Orchestrating Safety-Aware Visual Narratives via Multi-Agent Cognitive Calibration
BOOKAGENT:通过多智能体认知校准 orchestrate 安全意识的视觉叙述
Bo Gao, Chang Liu, Yuyang Miao, Siyuan Ma, Ser-Nam Lim
机构
*
Carnegie Mellon University(卡内基梅隆大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Imperial College London(伦敦帝国理工学院)
;
Nanyang Technological University(南洋理工大学)
;
University of Central Florida(佛罗里达中央大学)
Cognitive Chain-of-Thought (CoCoT): Structured Multimodal Reasoning about Social Situations
认知链式推理(CoCoT):关于社会情境的结构化多模态推理
Eunkyu Park, Wesley Hanwen Deng, Gunhee Kim, Motahhare Eslami, Maarten Sap
机构
*
Seoul National University(首尔国立大学)
;
Human-Computer Interaction Institute, Carnegie Mellon University(人机交互研究所,卡内基梅隆大学)
;
Language Technologies Institute, Carnegie Mellon University(语言技术研究所,卡内基梅隆大学)
Decoupling the Effect of Chain-of-Thought Reasoning: A Human Label Variation Perspective
解耦链式推理的影响:从人类标签变异视角出发
Beiduo Chen, Tiancheng Hu, Caiqi Zhang, Robert Litschko, Anna Korhonen, Barbara Plank
机构
*
MaiNLP
;
Center for Information and Language Processing, LMU Munich(信息与语言处理中心,慕尼黑大学)
;
LMU Munich, Germany(慕尼黑大学,德国)
;
Munich Center for Machine Learning (MCML), Munich, Germany(慕尼黑机器学习中心(MCML),慕尼黑,德国)
;
Language Technology Lab, University of Cambridge, United Kingdom(语言技术实验室,剑桥大学,英国)
Parallel Test-Time Scaling for Latent Reasoning Models
潜在推理模型的并行测试时缩放
Runyang You, Yongqi Li, Meng Liu, Wenjie Wang, Liqiang Nie, Wenjie Li
机构
*
Hong Kong Polytechnic University(香港理工大学)
;
Shandong Jianzhu University(山东建筑大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
Using large language models for embodied planning introduces systematic safety risks
使用大型语言模型进行具身规划引入了系统性的安全风险
Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi
机构
*
ETH Zurich(苏黎世联邦理工学院)
;
University College London(伦敦大学学院)
;
Stanford University(斯坦福大学)
;
Northwestern University(西北大学)
;
National University of Singapore(新加坡国立大学)
Retrieval as Generation: A Unified Framework with Self-Triggered Information Planning
检索即生成:一个统一框架与自触发信息规划
Bo Li, Mingda Wang, Gexiang Fang, Shikun Zhang, Wei Ye
机构
*
National Engineering Research Center for Software Engineering, Peking University(软件工程国家工程研究中心,北京大学)
;
School of Computer Science, Peking University(北京大学计算机学院)
;
School of Health Sciences and Biomedical Engineering, Hebei University of Technology(河北工业大学健康科学与生物医学工程学院)