arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-31 至 2026-07-31 共收录 13
2607.28374 2026-07-31 cs.LG 新提交

LEDGERMIND: Provenance-Constrained Multimodal Agentic Reasoning with a Structured Evidence Ledger

LEDGERMIND:基于结构化证据账本的溯源约束多模态智能体推理

Enjun Du, Hange Zhou, Chenxu Du, Siyi Liu, Zirong Chen, Ziyu Zheng, Yongqi Zhang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Tsinghua University(清华大学) University of Sussex(萨塞克斯大学)

AI总结 该研究提出LedgerMind,通过结构化证据账本及三层依据协议等组件,解决多模态智能体推理中最终答案准确率无法反映轨迹可信度的问题,在多模态基准上同时提升了答案准确率与轨迹可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28263 2026-07-31 cs.CL 新提交

Understanding Is Done Early: A Depth Division of Labor in Large Language Models and Its Use for Unbounded-Context Memory

理解在早期完成:大语言模型的深度分工及其在无界上下文记忆中的应用

Hanzuo Liu, Xuan Qi, Chunyu Liu, Haotian Zhong, Yulong Wang, Rayying, Key, Alex Lamb, Mingyu Gao

机构 * Tsinghua University(清华大学) Tencent(腾讯)

AI总结 该研究提出CoMem方法,利用大语言模型的深度分工构建无界上下文记忆,在RULER、LoCoMo等基准上性能优于全上下文KV-Direct,内存占用低、预填充速度快,证明长上下文记忆可沿层轴组织。

Comments 19 pages, 4 figures, 27 tables. Submitted to ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28079 2026-07-31 cs.LG cs.AI 新提交

Chem World: A Large-Scale Benchmark and Physics-Informed Framework for Trustworthy Chemical Property Prediction

Chem World:用于可信赖化学性质预测的大规模基准及物理信息框架

Tianyou Bai, Huan Wang, Mingchen Gao, Fangyue Lin, Pinze Ren, Zhenlin Zhao, Siming Dong

机构 * Cleer Science(克利尔科学公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Imperial College London(伦敦帝国学院) Tsinghua University(清华大学)

AI总结 本研究推出整合17类超80万分子样本的Chem World化学性质预测基准,并提出Mixture-PINN物理信息神经网络框架,经实验验证其可提升预测性能,为可信赖AI系统研发奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28058 2026-07-31 cs.CV 新提交

Temporal Concentration from Rollout Errors: Implicit Preference Optimization for Text-to-Video Diffusion

基于回退误差的时间集中:文本到视频扩散的隐式偏好优化

Henglin Liu, Fangyuan Kong, Jing Wang, Yizhou Lin, Nisha Huang, Chang Liu, Xintao Wang, Pengfei Wan, Kun Gai, Xiu Li

机构 * Tsinghua University(清华大学) Kuaishou Technology(快手科技) Sun Yat-sen University(中山大学)

AI总结 针对文本到视频扩散模型的时间稀疏伪影问题,本文提出集中式隐式偏好优化(cIPO)框架,通过回退误差推导隐式偏好信号,将优化集中于高误差片段,有效提升了视频的真实性与时间连贯性。

Comments project page: https://henglin-liu.github.io/cIPO_vis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28022 2026-07-31 cs.LG cs.AI 新提交

Flux-OPD: On-Policy Distillation with Evolving Contexts

Flux-OPD:基于演化上下文的在线策略蒸馏

Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang, Yifan Dai, Yang Shi, Bozhou Li, Chengzhuo Tong, Daili Hua, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team(KLING团队) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院)

AI总结 该研究针对开放域大语言模型训练缺乏可验证奖励的问题,提出Flux-OPD范式,利用演化上下文作为监督,通过分解反向KL目标优化,在开放域任务上性能优于现有OPD范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27747 2026-07-31 cs.CL cs.AI 新提交

Can LVLMs Uncover the Truth Behind Visual Illusions? An Analysis of Perceptual and Reasoning Capabilities

大型视觉语言模型(LVLMs)能否揭示视觉错觉背后的真相?感知与推理能力分析

Liangjie Zhao, Jiaqing Lyu, Kexin Tang, Zecheng Fang, Rong Yin, Yulan Hu, Da Li, Jianing Li

机构 * Adelaide University(阿德莱德大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Amap, Alibaba Group(阿里巴巴集团高德地图) Beihang University(北京航空航天大学)

AI总结 本文利用IllusionReasoning基准,以视觉错觉为诊断工具评估LVLMs,发现多款LVLMs的推理能力不及宣称水平,为其优化提供了新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27654 2026-07-31 cs.CL cs.AI 新提交

From Single- to Cross-Document: Benchmarking Multi-Granularity Event Analysis of Large Language Models

从单文档到跨文档:大语言模型多粒度事件分析的基准测试

Tao Wen, Shuai Shao, Pei Ke, Xu Han, Jie Zou, Guannan Li, Tao Tian, Jinjie Qiu, Lan Wang, Ke Qin

机构 * University of Electronic Science and Technology of China(电子科技大学) Tsinghua University(清华大学)

AI总结 本文推出MiGUE-Bench基准及MiGUE-Pipeline框架,通过四项核心任务评估LLMs多粒度事件分析能力,明确其能力边界与缺陷,为该领域改进提供方向。

Comments 9 pages. Published in the Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR 2026)

Journal ref Proceedings of the 49th International ACM SIGIR Conference on Research and Development in Information Retrieval (SIGIR '26), pp. 3464-3472, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27617 2026-07-31 cs.AI 新提交

Hidden APIs in Language Models: Discovering Reusable Causal Interfaces from Forked Futures

语言模型中的隐藏API:从分叉未来中发现可复用的因果接口

SiYuan Ma, Yiqin Luo, Zhangji, Canran Xiao, Albert Gao, Wei-Hsing Huang, Wei Wang, Qiwei Wu, Xinran Li, Jinfeng Wei, Qixin Zhang

机构 * Nanyang Technological University(南洋理工大学) Southern University of Science and Technology(南方科技大学) Tianjin University(天津大学) Sun Yat-sen University(中山大学) Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) The Hong Kong Polytechnic University(香港理工大学) Shenzhen University(深圳大学) Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本研究从分叉未来采样后续操作以比较语言模型隐藏状态,发现共享接口在多模型评估中表现最优,支持测试操作库中存在可复用因果接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27557 2026-07-31 cs.CL 新提交

Training Skills Like Parameters via Self-Supervised Semantic Diffusion

通过自监督语义扩散将技能像参数一样训练

Mo Li, Zixin Yin, Ting Cao, Yunxin Liu

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology(香港科技大学)

AI总结 该研究提出受扩散模型启发的无监督自进化智能体框架,通过自监督信号更新外部文本技能库,提升了智能体在短剧剧本创作领域的生成能力。

Comments Preprint, work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27348 2026-07-31 cs.CV 新提交

Bunraku: Turning a Single Illustration into an Editable Live2D Character

Bunraku:将单张插图转换为可编辑的Live2D角色

Junhao Chen, Jingjia Mao, Dayong Li, Chenghai Li, Saining Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

机构 * Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) SparcAI Inc.(SparcAI公司)

AI总结 本文提出Bunraku系统,可从单张插图端到端生成可编辑Live2D角色,构建分层扩散与联合位移预测方法,发布首个相关基准Live2D-Bench及8884模型语料库,解决了Live2D模型手动构建效率低的问题。

Comments Project page: https://bunraku-live2d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08167 2026-07-31 cs.LG cs.AI 版本更新

Explaining Data Mixing Scaling Laws

解释数据混合缩放定律

Rui Dai, Shuran Zheng

机构 * Beijing Institute of Technology(北京理工大学) IIIS, Tsinghua University(清华大学智能产业研究院)

AI总结 提出统一框架解释多领域数据混合中模型损失行为,基于能力竞争和噪声减少两个关键因素,在多个尺度上有效预测高性能混合。

Comments Published to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08825 2026-07-31 cs.CV 版本更新

Rethinking Event-Based Object Detection through Representation-Level Temporal Aggregation and Model-Level Hypergraph Reasoning

重新思考基于事件的对象检测:通过表示层面的时间聚合和模型层面的超图推理

Meisen Wang, Hao Deng, Wei Bao, Chengjie Wang, Zhiqiang Tian, Shaoyi Du, Siqi Li, Yue Gao

机构 * Xi’an Jiaotong University(西安交通大学) Tsinghua University(清华大学) China Mobile System Integration(中国移动系统集成) Inner Mongolia Agricultural University(内蒙古农业大学)

AI总结 本文提出Ev-DTAD框架,结合表示层面的时间编码与模型层面的时间超图推理,提升事件基于对象检测的准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09411 2026-07-31 cs.CV 版本更新

RiO-DETR: DETR for Real-time Oriented Object Detection

RiO-DETR:面向实时的定向目标检测DETR

Zhangchi Hu, Yifan Zhao, Yansong Peng, Wenzhang Sun, Xiangchen Yin, Jie Chen, Peixi Wu, Hebei Li, Xinghao Wang, Dongsheng Jiang, Xiaoyan Sun

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Technologies Co., Ltd.(华为技术有限公司) Tsinghua University(清华大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院)

AI总结 RiO-DETR通过任务原生设计解决实时定向检测中的角度估计、周期性细化和密集监督问题,实现速度与精度的平衡。

Comments Accepted by ECCV 2026, 31 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏