From Profiling to Synthesis: Benchmarking Implicit Behavioral Alignment in Personalized LLM Agents
从分析到综合:个性化大语言模型智能体中的隐式行为对齐基准测试
Jiajia Song, Bobo Li, Haiwen Yi, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu
机构
*
National University of Singapore(新加坡国立大学)
;
University of Toronto(多伦多大学)
;
University of Minnesota Twin Cities(明尼苏达大学双城分校)
;
Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))
;
University of Oxford(牛津大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Quantifying Frontier LLM Capabilities for Container Sandbox Escape
量化前沿大语言模型突破容器沙盒的能力
Rahul Marchand, Art O Cathain, Jerome Wynne, Philippos Maximos Giavridis, Stuart Jennings, Freddy Tuxworth, Tolga H. Dur, Sam Deverett, John Wilkinson, Jason Gwartz, Harry Coppock
机构
*
University of Oxford(牛津大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
CogAdapt: Adapting Clinical ECG Foundation Models for Wearable Cognitive Load Assessment
CogAdapt: 通过导联适应将临床心电图基础模型迁移至可穿戴认知负荷评估
Amir Mousavi, Erfan Nourbakhsh, Mohammad Sadegh Sirjani, Mimi Xie, Rocky Slavin, Leslie Neely, John Davis, John Quarles
机构
*
Department of Computer Science, College of AI, Cyber and Computing, The University of Texas at San Antonio(计算机科学系,人工智能、网络与计算学院,德克萨斯大学圣安东尼奥分校)
;
Department of Educational Psychology, College of Education and Human Development, The University of Texas at San Antonio(教育心理学系,教育与人类发展学院,德克萨斯大学圣安东尼奥分校)
Journal refIn Findings of the Association for Computational Linguistics: ACL 2026, pages 35478-35507, San Diego, California, United States. Association for Computational Linguistics, 2026
Beyond On-Policy Exploration: Integrating External Policy Rollouts for Reinforcement Learning in Diffusion Language Models
超越在线策略探索:将外部策略 rollout 整合用于扩散语言模型中的强化学习
Wonseok Lee, Jimyeong Kim, Jungmin Ko, Wonjong Rhee
机构
*
Seoul National University(首尔大学)
;
Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔大学人工智能交叉项目)
;
Artificial Intelligence Institute, Seoul National University(首尔大学人工智能研究院)
;
Department of Intelligence and Information, Seoul National University(首尔大学智能与信息系)
专题命中
评测与基准
:language model(title,abstract);large language model(abstract);分类 cs.LG
A Survey of Large Audio Language Models: Generalization, Trustworthiness, and Outlook
大型音频语言模型综述:通用性、可信度与展望
Kaiwen Luo, Zhenhong Zhou, Leyan Wang, Liang Lin, Tianyu Shao, Yuanhe Zhang, Yang Xiao, Yuxuan Li, Miao Yu, Kailin Lyu, Jiaming Zhang, Li Sun, Songze Li, Yueming Wu, Ting Dang, Xiaojun Jia, Dongrui Liu, Kai Li, Rohan Kumar Das, Siyuan Liang, Xinfeng Li, Qiankun Li, Jing Chen, Xingjun Ma, Kun Wang, Junhao Dong, Deqing Zou, Yu Cheng, Xia Hu, Zhigang Zeng, Sen Su, Yang Liu, Yu-Gang Jiang, Philip S. Yu, Yew-Soon Ong
机构
*
Nanyang Technological University(南洋理工大学)
;
Independent Researcher(独立研究者)
;
The University of Melbourne(墨尔本大学)
;
North China Electric Power University(华北电力大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
University of Science and Technology of China(中国科学技术大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Huazhong University of Science and Technology(华中科技大学)
;
Tsinghua University(清华大学)
;
Fortemedia Singapore(富媒体新加坡)
;
Tencent(腾讯)
;
Fudan University(复旦大学)
;
Wuhan University(武汉大学)
;
Chinese University of Hong Kong(香港中文大学)
;
Chongqing University of Posts and Telecommunications(重庆邮电大学)
;
University of Illinois Chicago(伊利诺伊大学芝加哥分校)
专题命中
评测与基准
:language model(title,abstract);large language model(abstract)
FinDeepIndicator: Benchmarking Deep Research Agents in End-to-End Financial Indicator Construction
FinDeepIndicator:端到端金融指标构建中深度研究智能体的基准测试
Chaoqun Yang, Fengbin Zhu, Xinyu Lin, Long Bai, Xiaoluan Liu, Ke-Wei Huang, Roger Zimmermann, Tat-Seng Chua
机构
*
School of Computing, National University of Singapore(新加坡国立大学计算机学院)
;
China Economics and Management Academy, Central University of Finance and Economics(中央财经大学中国经济与管理研究院)
;
Asian Institute of Digital Finance, National University of Singapore(新加坡国立大学亚洲数字金融研究所)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中
评测与基准
:large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI