VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora
VeriTrip: 面向非结构化网络语料的旅行规划智能体可验证基准
Yuting Xu, Jiayi Tian, Jian Liang, Xin Xiong, Hang Zhang, Mu Xu, Xiao-Yu Zhang
机构
*
Institute of Information Engineering, CAS(中国科学院信息工程研究所)
;
School of Cyber Security, UCAS(中国科学技术大学网络安全学院)
;
Amap, Alibaba Group(阿里巴巴集团阿地图)
;
NLPR & MAIS, Institute of Automation, CAS(中国科学院自动化研究所神经信息处理实验室及机器智能研究所)
;
School of Artificial Intelligence, UCAS(中国科学技术大学人工智能学院)
机构
*
Zhejiang University(浙江大学)
;
Shanghai AI Laboratory(上海人工智能实验室)
;
Tencent(腾讯)
;
Ningbo Global Innovation Center, Zhejiang University(宁波全球创新中心,浙江大学)
;
Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字智能服务技术重点实验室)
机构
*
Arizona State University(亚利桑那州立大学)
;
Clemson University(克莱姆森大学)
;
Washington University in St. Louis(圣路易斯华盛顿大学)
;
University of Notre Dame(诺特丹大学)
;
Florida State University(佛罗里达州立大学)
;
Rice University(里德大学)
;
NVIDIA(英伟达)
;
Mayo Clinic(梅奥诊所)
ProvMind: Provenance-grounded reasoning for materials synthesis
ProvMind:基于来源的材料合成推理
Yiming Zhang, Ryo Tamura, Koji Tsuda
机构
*
Center for Basic Research on Materials, National Institute for Materials Science(材料基础研究センター,国家材料科学研究所)
;
RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)
Roles with Rails: Contract-Preserving Role Evolution in Multi-Agent Structured Reasoning
角色与轨道:多智能体结构化推理中保持契约的角色演化
Ling-Yue Ge, Lan-Zhe Guo
机构
*
National Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室)
;
School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院)
Do LLMs Build World Models From Text? A Multilingual Diagnostic of Spatial Reasoning
LLMs 是否从文本构建世界模型?多语言空间推理诊断
Zhikai Pan, Chih-Ting Liao, Chunrui Liu, Xi Xiao, Yitong Qiao, Chunlei Meng, Zhangquan Chen, Xin Cao
机构
*
University of New South Wales(新南威尔士大学)
;
Essential Energy
;
University of Alabama at Birmingham(阿拉巴马大学伯明翰分校)
;
Zhejiang University(浙江大学)
;
Fudan University(复旦大学)
;
Tsinghua University(清华大学)
Break the Block: Dynamic-size Reasoning Blocks for Diffusion Large Language Models via Monotonic Entropy Descent with Reinforcement Learning
打破块限制:通过单调熵下降与强化学习为扩散大语言模型实现动态大小推理块
Yan Jiang, Ruihong Qiu, Zi Huang
机构
*
School of Electrical Engineering and Computer Science, The University of Queensland, Brisbane, Queensland, Australia(电气工程与计算机科学学院,昆士兰大学,布里斯班,昆士兰,澳大利亚)
机构
*
Department of Computer Science and Engineering(计算机科学与工程系)
;
Department of Electrical and Electronic Engineering(电气与电子工程系)
;
Islamic University of Technology(伊斯兰技术大学)
机构
*
SIAT, Chinese Academy of Sciences(中国科学院深圳先进技术研究院)
;
University of Chinese Academy of Sciences(中国科学院大学)
;
Alibaba Group(阿里巴巴集团)
;
University of New South Wales(新南威尔士大学)
Playing with Words, Improving with Rewards: Training Language Models for Creative Association
玩文字游戏,用奖励改进:训练语言模型进行创意联想
Vijeta Deshpande, Namrata Shivagunde, Sherin Muckatira, Hadrien Glaude, Mikhail Gronas, Claire Stevenson, Roger Beaty, Anna Rumshisky
机构
*
University of Massachusetts Lowell(马萨诸塞大学洛市分校)
;
Dartmouth College(达特茅斯学院)
;
University of Amsterdam(阿姆斯特丹大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
Amazon AGI(亚马逊人工智能研究院)
Gradient Transformer: Learning to Generate Updates for LLMs
梯度变换器:学习为大语言模型生成更新
Binh-Nguyen Nguyen, Khang Tran, NhatHai Phan, Issa Khalil
机构
*
Department of Data Science, New Jersey Institute of Technology, Newark, NJ, USA(数据科学系,新泽西理工学院,新泽西州诺克斯维尔)
;
Qatar Computing Research Institute, HBKU, Doha, Qatar(卡塔尔计算研究所,HBKU,多哈)