arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-08-11 至 2026-08-11 共收录 36
2608.09771 2026-08-11 cs.RO 新提交

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09613 2026-08-11 cs.CV 新提交

Marrying Optimal Transport and ODEs for Unified Continuous-Time 4D Reconstruction and Tracking

融合最优传输与常微分方程的统一连续时间4D重建与跟踪

Liying Yang, Hao Mo, Jialun Liu, Chen Liu, Xinxing Yu, Chenhao Guan, Hui Ma, Xiao Cao, Ajian Liu, Yanyan Liang

机构 * Macau University of Science and Technology(澳门科技大学) The University of Queensland(昆士兰大学) Great Bay University(大湾区大学) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所)

AI总结 本文提出Uni4R框架,通过最优传输与常微分方程协同学习连续速度场,结合流匹配引导解码器与积分一致性训练策略,实现统一连续时间4D重建与点跟踪,在相关任务及新基准上达SOTA性能。

Comments Preliminary version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09591 2026-08-11 cs.RO cs.CV 新提交

FactorDrive: Adaptive Multi-Step Reasoning Driven by Planning-Critical Factors for End-to-End Autonomous Driving

FactorDrive:面向端到端自动驾驶的、由规划关键因素驱动的自适应多步推理

Guolei Huang, Tengfei She, Yuxuan Lu, Yao Huang, Yuqi Ye, Yongjun Shen

机构 * Southeast University(东南大学) Universiti Malay(马来亚大学) Ant Group(蚂蚁集团) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 该研究针对现有端到端自动驾驶方法在空间物理证据融合、推理适应及推理路径优化上的不足,提出FactorDrive框架,通过PCF-CoT数据集与QS-GRPO算法优化推理,在两类基准上取得最优规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09586 2026-08-11 cs.AI cs.GT cs.MA 新提交

ICM Out! Better Tournament Strategy from Computed Continuations, vs. Solvers and LLMs

ICM 失效!基于计算延续的更优锦标赛策略——与求解器及大语言模型(LLMs)的对比

Boning Li, Longbo Huang

机构 * Tsinghua University(清华大学)

AI总结 该研究提出战略延续优化(SCO)策略构建方法,通过锦标赛实验对比发现,SCO 策略比基于解析 ICM 的策略更优,且在替换对手为 LLMs 等时仍保持优势,明确了 ICM 作为锦标赛策略构建目标的局限性。

Comments 34 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09571 2026-08-11 cs.SD 新提交

SonicWeave: Chunk-Routed Mixture-of-Experts for Unified Audio Scene Generation

SonicWeave:用于统一音频场景生成的分块路由混合专家模型

Yunrui Cai, Xu Li, Yucheng Zhou, Jinchao Li, Dingdong Wang, Dongchao Yang, Xixin Wu, Chen Zhang, Zhiyong Wu, Pengfei Wan, Helen Meng

机构 * Kuaishou Technology(快手科技) The Chinese University of Hong Kong(香港中文大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 本文提出SonicWeave,一种带CPE-MoE的流匹配模型,可通过单一权重集生成含语音、音乐等的统一音频场景,在多项基准及复杂场景评估中表现优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09380 2026-08-11 cs.AI 新提交

OpenLoopEvolve: A Verifiable Self-Evolution Framework for Loop Policies in Long-Horizon Complex Tasks

OpenLoopEvolve:面向长周期复杂任务中循环策略的可验证自进化框架

Siqi Wang, Xinlin Li, Zhenglin Li, Li Li

机构 * Tsinghua University(清华大学)

AI总结 OpenLoopEvolve是面向长周期复杂任务的可验证自进化框架,通过在线与离线两种进化模式优化循环策略,在YC-Bench基准上提升了任务性能、成功率与风险指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09343 2026-08-11 cs.AI 新提交

LLM-Guided Heuristic Design from Simulation Traces: A Case Study in Dynamic Production and AGV Scheduling

基于模拟轨迹的大语言模型引导式启发式设计:动态生产与自动导引车调度的案例研究

Jinbo Li, Chuanhao Li

机构 * Tsinghua University(清华大学)

AI总结 该研究提出LLM引导的启发式设计框架,通过模拟轨迹诊断优化AGV与生产调度策略,在多组实验中优于多种基线方法,证实模拟轨迹可指导代码层面的策略改进。

Comments 33 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09333 2026-08-11 cs.RO 新提交

DH-VLM: Dual-Horizon Cooperative Latent Reasoning for Autonomous Driving

DH-VLM:面向自动驾驶的双时域协同隐层推理框架

Ziyi Song, Chen Xia, Hang Yu, Sheng Zhou, Zhisheng Niu

机构 * Tsinghua University(清华大学)

AI总结 本文提出DH-VLM双时域协同隐层推理框架,结合基础设施与自车实现非对称语义协同,构建协同QA数据集支撑推理,在规划性能、通信成本等指标上优于现有方法,为协同自动驾驶提供实用鲁棒范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09311 2026-08-11 cs.CV 新提交

Degraded Infrared Small Object Detection via Degradation-Adapted Physics-Guided Restoration

面向退化红外小目标检测的退化自适应物理引导恢复方法

Xinkai Lu, Wenjun Chen, Yi Li, Yi Chang, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Ocean Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院海洋工程学院)

AI总结 针对红外小目标检测中退化泛化性差的问题,提出DAISOD框架,结合退化识别、专用分支处理与物理引导恢复,构建对应数据集,实验表明其性能优于现有方法。

Comments Accept by ICIG2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09286 2026-08-11 cs.LG cs.AI 新提交

VeinCast: Physics-Guided Dynamic Field Graphs with Graph-Conditioned Fusion for Global Medium-Range Weather Forecasting

VeinCast:用于全球中期天气预报的物理引导动态场图与图条件融合框架

Zhisheng Chen, Jinhan Li, Yuxuan Li, Yuan Gao, Hao Wu, Zheng Lu, Jinlong Du, Kun Wang, Bo An

机构 * Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Peking University(北京大学) Tongji University(同济大学)

AI总结 本文提出VeinCast框架,通过物理引导动态场图与图条件融合,在1.5° ERA5基准上,于14天提前期的69个气象场预报任务中取得与主流模型相当的竞争力,证实关系级物理引导的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09264 2026-08-11 cs.CV 新提交

Task-Adaptive 3D Cross-Field MRI Translation via Field-Conditioned Content-Style Pretraining

基于场条件内容-风格预训练的任务自适应3D跨场MRI转换

Haowen Pang, Yingqi Hao, Pengli Zhu

机构 * School of Integrated Circuits and Electronics, Beijing Institute of Technology(北京理工大学集成电路与电子学院) School of Biomedical Engineering, Tsinghua Medicine, Tsinghua University(清华大学医学院生物医学工程学院) Department of Electronic Engineering, The Chinese University of Hong Kong(香港中文大学电子工程系)

AI总结 针对跨场MRI转换的域偏移问题,提出基于场条件内容-风格预训练的3D非配对转换框架,适配三项挑战赛任务,可保留三维解剖结构。

Comments MICCAI 2026 Workshop on MRIxFields

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09109 2026-08-11 cs.AI 新提交

Different Feedback, Different Updates: Selective Self-Learning from User Interactions for Large Language Models

不同反馈,不同更新:针对大语言模型的用户交互选择性自学习

Xuanchen Li, Haitao Li, Yujia Zhou, Qingyi Pan, Heng Wang, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学) Tencent(腾讯)

AI总结 针对LLM用户反馈的泛化范围差异问题,提出选择性自学习框架SLIFT,通过训练两个互补LoRA适配器,在MemoryBench和WildFB上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08749 2026-08-11 cs.RO 新提交

OnEvoMemory: Evolving Memory through Online Robot Rollouts for Pretrained Robot Policies

OnEvoMemory:通过机器人在线试跑演化预训练机器人策略的记忆机制

Zhongxi Chen, Shenqi Zong

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学)

AI总结 针对现有机器人记忆机制依赖外部模型的问题,提出OnEvoMemory价值引导记忆模块,结合离线初始化与在线试跑优化记忆选择,提升了基础VLA策略在长时程机器人操作中的性能。

Comments 6 pages, 1 figure. Accepted as a poster at the ECCV 2026 Workshop on Embodied Multimodal Reasoning in Physical Environments (EMR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08604 2026-08-11 cs.LG 新提交

Multi-Agent Reinforcement Learning via Agent-Specific Preference

基于智能体特定偏好的多智能体强化学习

Ni Mu, Yao Luan, Yiqin Yang, Qing-Shan Jia

机构 * Tsinghua University(清华大学) Chinese Academy of Sciences(中国科学院) CFINS BNRist Institute for Embodied Intelligence and Robotics(嵌入式智能与机器人研究所) Institute of Automation(自动化研究所)

AI总结 本文提出多智能体偏好集成学习(MAGPIE),通过智能体特定偏好建模解决多智能体强化学习中全局奖励设计难题,经理论证明与实验验证,其性能可媲美奖励工程基线,为奖励工程不适用场景提供有效策略学习方案。

Comments This article has been accepted for publication in IEEE Transactions on Automation Science and Engineering. This is the author's version, which has not been fully edited, and the content may change prior to final publication. \c{opyright} 2026 IEEE. All rights reserved, including rights for text and data mining and training of artificial intelligence and similar technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08555 2026-08-11 cs.CV 新提交

SC-Diff: Semantically Calibrated Diffusion for Visible-to-Infrared Image Translation

SC-Diff:用于可见光到红外图像转换的语义校准扩散模型

Junyin Zhang, Siyu Huang, Jianxiong Ye, Haowei Gong, Ruicheng Zhang, Deyu Meng, Chenqiang Gao

机构 * School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区智能系统工程学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of Mathematics and Statistics, Xi’an Jiaotong University(西安交通大学数学与统计学院)

AI总结 SC-Diff 是一种语义校准潜扩散框架,通过结合语义先验作为条件与自注意力校准,提升可见光转红外图像的语义一致性,生成更适用于红外目标检测的合成训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08392 2026-08-11 cs.AI cs.CL 新提交

CAP: A Scalable Benchmark for Evaluating Cross-Site Browser Agents with Complex Actions and Perception

CAP:用于评估具备复杂动作与感知能力的跨站点浏览器智能体的可扩展基准

Zejun Xu, Taiyi Chen, Jin Li, Yongtong Gu, Qi Cheng, Aixuan Lv, Shuai Zhu, Pengfei Zhu, Kaichen Yang, Boyu Sun, Yixian Yang, Mulong Xie, Xin Liu, Dagang Li, Xiaoteng Ma, Hongru Wang

机构 * Macau University of Science and Technology(澳门科技大学) Tsinghua University(清华大学) Southeast University(东南大学) FellouAI ARGUS Lab(ARGUS实验室) The University of Edinburgh(爱丁堡大学)

AI总结 研究人员推出可扩展基准CAP,通过分解-重组流程构建420项跨站点网页任务,实验发现当前浏览器智能体在感知密集型交互上存在明显瓶颈,与真实需求差距较大。

Comments Accepted to COLM 2026. Project page: https://warriorxu0302.github.io/CAP-Bench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08210 2026-08-11 cs.AI 新提交

Illusion of Alignment: Detecting Hidden Disagreement in Collaborative Dialogue

对齐的错觉:检测协同对话中的隐藏分歧

Kaiming Liu, Fuwen Luo, Ziyue Wang, Jinrui Ju, Yuxuan Liu, Xuanyu Lei, Yunghwei Lai, Peng Li, Yang Liu

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute for AI, Tsinghua University(清华大学人工智能研究院)

AI总结 本研究针对协同对话中存在的对齐的错觉(IoA)问题,构建IoA-Suite数据集,训练IoA-Prober-8B模型检测隐藏分歧,该模型可揭示真人会议中未表达的分歧,还能提升多智能体协作的下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08021 2026-08-11 cs.CV cs.AI 新提交

Evidence-RL: Towards Evidence-intensive Visual Reasoning

Evidence-RL:面向证据密集型视觉推理

Haojie Huang, Xinlei Yu, Chengming Xu, Zhangquan Chen, Cheng Yang, Qingdong He, Yu Yang, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学) Fudan University(复旦大学) Tsinghua University(清华大学) Tencent(腾讯)

AI总结 针对视觉-语言模型依赖语言先验等问题,提出反事实证据解缠方法,结合GRPO框架在9个基准和4种骨干模型上优于现有基于RL的后训练方法。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07905 2026-08-11 cs.AI cs.RO 新提交

GraphThink: Graph-Enhanced LLM Thinking for Long-Horizon Embodied Task Planning

GraphThink:用于长视距具身任务规划的图增强大语言模型思维

Chen Li, Sijie Cheng, Yuelin Zhang, Junxi Li, Maozhi Huang, Yang Liu, Wenbing Huang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 GraphThink框架结合任务图与场景图,通过上下文提示、迭代优化、GRPO奖励设计及事件驱动重规划,在ALFRED基准上实现最优性能,具强泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07722 2026-08-11 cs.LG physics.flu-dyn 新提交

Neural Operators for Immersed-Boundary Soft Swimmers Locomotion

用于浸式边界柔性游泳体运动的神经算子

Mohammad Sadegh Eshaghi, Yizheng Wang, Navid Valizadeh, Xiaoying Zhuang, Timon Rabczuk

机构 * Leibniz University Hannover(莱布尼茨汉诺威大学) Tsinghua University(清华大学) Bauhaus-Universität Weimar(魏玛包豪斯大学)

AI总结 该研究针对浸式边界柔性游泳体运动,开发神经算子代理模型预测其流场,平面与体积型模型分别达到对应精度,验证了该代理模型的可行性并明确了后续改进方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05144 2026-08-11 cs.AI 版本更新

Argus: A General-Purpose Agentic Reasoning Runtime for Long-Horizon Tasks

Argus:面向长程推理的通用智能体运行时

Boxiu Li, Zimo Wen, Yijia Fan, Chuan Wen, Fan Yang, Hangxi Guo, Jiaao Wu, Jiachen Zhang, Junxiang Lei, Mukai Li, Ruize Tang, Runjing Gu, Shibo Hu, Sihan Chen, Sufeng Guo, Wanbo Zhang, Xian Zhang, Xiaoyu Chen, Xuanhe Zhou, Xuyao Huang, Yifei Gao, Yifei Shen, Yilin Chen, Yuheng Wu, Yuzhe Zhang, Zelong Zhao, Zhijie Deng

机构 * Microsoft(微软公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Nanjing University(南京大学) Tsinghua University(清华大学) The University of Hong Kong(香港大学) Peking University(北京大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Donghua University(东华大学)

AI总结 Argus是面向长程推理的通用智能体运行时,通过多角色协作与自进化,在多个基准测试中表现优于同类方法,还完成了实际应用任务并产出结构化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10180 2026-08-11 cs.RO cs.AI 版本更新

ActiveFly-Bench: Aligning Embodied Question Answering with Vision-Language-Action for Aerial Embodied Perception

ActiveFly-Bench:将具身问答与视觉-语言-动作对齐用于空中具身感知

Weichen Zhang, Shiquan Yu, Yinan Zhu, Peizhi Tang, Shilong Ji, Zhiyuan Deng, Tianyi Lyu, Haoyang Wang, Xin Zeng, Chen Gao, Yong Li, Xinlei Chen

机构 * Tsinghua University(清华大学) Manifold AI(流形人工智能)

AI总结 介绍用于无人机具身感知的ActiveFly-Bench基准测试,它分解主动感知为三个层次任务,收集数据集,开发集成视觉语言推理与细粒度控制的ActiveFly智能体,实验表明当前无人机智能体有困难,该基准成为具身空中智能新测试平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04425 2026-08-11 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新

UI-MOPD: Multi-Platform On-Policy Distillation for Unified GUI Agents

UI-MOPD:用于持续GUI智能体学习的多平台策略蒸馏

Niu Lian, Tongbo Chen, Zhehao Yu, Chengzhen Duan, Fazhan Liu, Hui Liu, Pei Fu, Jian Luan, Heng Qu, Shu-Tao Xia, Jinpeng Wang

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Xiaomi(小米) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Zhejiang University(浙江大学) Peng Cheng Laboratory(鹏城实验室)

AI总结 针对构建多平台GUI智能体的挑战,构建高质量数据集Uni-GUI,提出UI-MOPD方法,通过多教师策略蒸馏实现持续学习,动态选教师并转移行为先验,实验证明其能平衡跨平台能力保留与新平台适应。

Comments Technical report. 27 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02501 2026-08-11 cs.RO cs.CV cs.OS 版本更新

Embodied.cpp: A Portable Inference Runtime of Embodied AI Models on Heterogeneous Robots

Embodied.cpp:面向异构机器人的具身AI模型可移植推理运行时

Ling Xu, Borui Li, Hao Wu, Chuyu Han, Xiangyu Li, Mohan Hua, Shiqi Jiang, Ting Cao, Chuanyou Li, Sheng Zhong, Shuai Wang

机构 * Southeast University(东南大学) Nanjing University(南京大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR))

AI总结 提出Embodied.cpp,一个基于C++的可移植推理运行时,通过五层架构支持多速率执行、延迟优先融合推理和可扩展接口,在异构机器人上高效部署VLA和世界动作模型。

Comments 18 pages, 2 figures, Project website: https://github.com/SEU-PAISys/Embodied.cpp

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30345 2026-08-11 cs.LG cs.AI 版本更新

DRIFT: Difficulty Routing Self-DIstillation with Rhythm-Gated Exploration and Success BuFfer Training

DRIFT: 基于难度路由的自我蒸馏与节奏门控探索及成功缓冲训练

Haisen Luo, Yiwei Liu, Haoning Wang, Dan Liu, Junxi Yin, Haotian Wang, Lei Zhang, Xiaoyu Tian, Shuaiting Chen, Yuansheng Song, Baoyan Guo, Xiongfei Yan, Bolan Yang, Chengwei Liu, Ming Cui, Jiong Chen

机构 * Tsinghua University(清华大学) ENS Paris-Saclay(巴黎-萨克雷大学) Beike Language and Intelligence(贝克语言与智能)

AI总结 提出DRIFT框架,通过难度路由和节奏门控动态分配自蒸馏与强化学习信号,结合成功缓冲和两阶段课程学习,提升大模型在复杂推理任务中的自我进化稳定性,在五个基准上平均得分79.5%,超越GRPO和SDPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10794 2026-08-11 cs.AI 版本更新

READER: Dynamic LLM Provenance from Query-Varying Interactions

READER: 基于提取表示的鲁棒证据作者身份解码

Jiaxu Liu, Sunnan Mu, Dong Huang, Liuyin Wang, Jing Shao, Jie Zhang

机构 * National University of Singapore(新加坡国立大学) Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

AI总结 针对黑盒LLM来源识别问题,提出READER框架,通过冻结代理LLM读取隐藏作者证据,利用贝叶斯证据累积实现多查询归因,在Agent500数据集上显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09730 2026-08-11 cs.AI 版本更新

SearchSwarm: Towards Delegation Intelligence in Agentic LLMs for Long-Horizon Deep Research

SearchSwarm:面向长周期深度研究的代理LLM委托智能

Xiaochong Lan, Quan Chen, Kun Tao, Xinyu Tang, Tianshu Wang, Qianggang Cao, Xinyu Kong, Zujie Wen, Zhiqiang Zhang, Jun Zhou

机构 * Tsinghua University(清华大学) Peking University(北京大学) Ant Group(蚂蚁集团) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学高瓴人工智能学院)

AI总结 提出SearchSwarm框架,通过监督微调将任务分解与委托决策内化到模型权重中,在BrowseComp和BrowseComp-ZH上取得同规模最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01629 2026-08-11 cs.CL 版本更新

Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

基准测试LLM作为裁判在长文本输出评估中的应用

Junjie Chen, Yuxi Dong, Haitao Li, Weihang Su, Yujia Zhou, Min Zhang, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology Beijing(北京科技大学)

AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24396 2026-08-11 cs.AI 版本更新

Understanding and Mitigating Premature Confidence for Better LLM Reasoning

理解并缓解过早自信以提升大语言模型推理能力

Jingchu Gai, Guanning Zeng, Christina Baek, Chen Wu, J. Zico Kolter, Andrej Risteski, Aditi Raghunathan

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

AI总结 针对大语言模型长思维链中逻辑跳跃和过早自信问题,提出渐进式自信塑造强化学习目标,无需外部标签或奖励模型,通过奖励逐步自信增长并惩罚过早承诺,显著提升推理准确性和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏