BioBlue: Systematic runaway-optimiser-like LLM failure modes on biologically and economically aligned AI safety benchmarks for LLMs with simplified observation format
PersonaTree: Structured Lifecycle Memory for Person Understanding in LLM Agents
PersonaTree: 面向LLM智能体人物理解的结构化生命周期记忆
Yubo Hou, Jingwei Song, Hongbo Zhang, Zhisheng Chen, Bang Xiao, Tao Wan, Zengchang Qin
机构
*
School of ASEE, Beihang University, Beijing, China(北京航空航天大学航空科学与工程学院)
;
The University of Hong Kong, Hong Kong, China(香港大学)
;
Peking University, Beijing, China(北京大学)
;
University of Chinese Academy of Sciences, Beijing, China(中国科学院大学)
;
School of BME, Beihang University, Beijing, China(北京航空航天大学生物医学工程学院)
;
CAIR and CECS, VinUniversity, Hanoi, Vietnam(越南河内 Vin 大学 CAIR 和 CECS)
100-LongBench: Are de facto Long-Context Benchmarks Literally Evaluating Long-Context Ability?
100-LongBench:事实上的长上下文基准是否真的在评估长上下文能力?
Wang Yang, Hongye Jin, Shaochen Zhong, Song Jiang, Qifan Wang, Vipin Chaudhary, Xiaotian Han
机构
*
Case Western Reserve University(凯斯西储大学)
;
Texas A&M University(德克萨斯A&M大学)
;
Rice University(里德大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Meta
MesaNet: Sequence Modeling by Locally Optimal Test-Time Training
MesaNet: 通过局部最优测试时训练进行序列建模
Johannes von Oswald, Nino Scherrer, Seijin Kobayashi, Luca Versari, Songlin Yang, Sarthak Mittal, Maximilian Schlegel, Kaitlin Maile, Yanick Schimpf, Oliver Sieberling, Alexander Meulemans, Rif A. Saurous, Guillaume Lajoie, Charlotte Frenkel, Razvan Pascanu, Blaise Agüera y Arcas, João Sacramento
机构
*
Google(谷歌)
;
Paradigms of Intelligence Team(智能范式团队)
;
Google DeepMind(谷歌DeepMind)
;
MIT CSAIL(麻省理工学院CSAIL)
SaliMory: Orchestrating Cognitive Memory for Conversational Agents
SaliMory: 为对话代理编排认知记忆
Kai Zhang, Xinyuan Zhang, Hongda Jiang, Shiun-Zu Kuo, Hyokun Yun, Ejaz Ahmed, Shereen Oraby, Ziyun Li, Sanat Sharma, Ann Lee, Ahmed A Aly, Anuj Kumar, Raffay Hamid, Xin Luna Dong