arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4517
2607.06537 2026-07-14 cs.RO 版本更新

UniLM-Nav: A Unified Framework for Zero-Shot Last-Mile Navigation

UniLM-Nav:零样本最后一英里导航的统一框架

Zhuofan Zhang, Tianxu Wang, Guoxi Zhang, Yixiong Lin, Xilin Wang, Hongming Xu, Qing Li, Song-Chun Zhu, Lifeng Fan

机构 * Tsinghua University(清华大学) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,字节跳动公司人工智能研究院) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

AI总结 研究移动操作中最后一英里导航问题,提出UniLM-Nav统一框架,通过多模态大语言模型后端分解任务为视图选择、功能接地和姿态推理,在OVMM基准上优于现有方法,还验证了在实际机器人上的适用性。

Comments Project page: https://unilm-nav.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02502 2026-07-14 cs.LG cs.AI 版本更新

DemoPSD: Disagreement-Modulated Policy Self-Distillation

DemoPSD: 分歧调节的策略自蒸馏

Yunhe Li, Hao Shi, Wenhao Liu, Mengzhe Ruan, Hanxu Hou, Zhongxiang Dai, Shuang Qiu, Linqi Song

机构 * City University of Hong Kong(香港城市大学) Tsinghua University(清华大学) Shenzhen University of Advanced Technology(深圳理工大学) Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 提出DemoPSD框架,通过选择性采纳教师指导,平衡学生从教师学习和保持自身推理能力,解决特权信息泄露和探索抑制问题,在科学推理任务上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21587 2026-07-14 cs.LG cs.AI 版本更新

FAST: A Framework for Aligned Sampling and Training in Parallel Reinforcement Learning for Autonomous Driving

FAST:面向自动驾驶并行强化学习中的对齐采样与训练框架

Bonan Wang, Letian Tao, Bin Shuai, Jiaxin Gao, Wenxin Zhao, Wei Xiong, Kehua Sheng, Bo Zhang, Yang Guan, Shengbo Eben Li

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) Didi Voyager Labs, DiDi Autonomous Driving(滴滴自动驾驶沃芽实验室) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 提出FAST框架,通过动态并行采样对齐和缩放掩码填充优化,解决并行强化学习中的掉队者效应和采样效率瓶颈,实现至少1.78倍加速且保持统计无偏性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15753 2026-07-14 cs.RO cs.CV 版本更新

Hierarchical and Holistic Open-Vocabulary Functional 3D Scene Graphs for Indoor Spaces

层次化和整体化的开放词汇功能3D场景图用于室内空间

Xinggang Hu, Chenyangguang Zhang, Alexandros Delitzas, Xiangkui Zhang, Marc Pollefeys, Francis Engelmann, Xiangyang Ji

机构 * Tsinghua University(清华大学) ETH Zürich(苏黎世联邦理工学院) MPI for Informatics(信息研究所) Dalian University of Technology(大连理工大学) Microsoft(微软) Stanford University(斯坦福大学) University of Lugano(卢加诺大学)

AI总结 本文提出一种开放词汇管道,结合2D视觉定位和3D图优化,解决小规模密集相似实例的场景图推理问题,通过时间图优化和全局层次塑造提升室内空间的功能3D场景图生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10332 2026-07-14 cs.AI 版本更新

EmbodiSkill: Skill-Aware Reflection for Self-Evolving Embodied Agents

EmbodiSkill:基于技能的反思以实现自我进化的具身智能体

Ruofei Ju, Xinrui Wang, Xin Ding, Yifan Yang, Hao Wu, Shiqi Jiang, Qianxi Zhang, Hao Wen, Xiangyu Li, Weijun Wang, Kun Li, Yunxin Liu, Haipeng Dai, Wei Wang, Ting Cao

机构 * Nanjing University(南京大学) Huazhong University of Science and Technology(华中科技大学) University of Science and Technology of China(中国科学技术大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR) Tsinghua University(清华大学人工智能产业研究院)

AI总结 本文提出EmbodiSkill,一种无需训练的具身技能自我进化框架,通过技能感知反思和针对性修订提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03636 2026-07-14 stat.ML cs.LG math.ST stat.AP stat.ME stat.TH 版本更新

Likelihood Matching for Diffusion Models

扩散模型的似然匹配

Lei Qian, Wu Su, Yanqi Huang, Song Xi Chen

机构 * Center for Data Science(数据科学中心) Peking University(北京大学) Guanghua School of Management(光华管理学院) Department of Statistics and Data Science(统计与数据科学系) Tsinghua University(清华大学)

AI总结 研究提出似然匹配方法训练扩散模型,通过建立目标数据分布似然与反向扩散样本路径似然的等价关系,利用拟似然近似反向转移密度,估计得分和海森矩阵函数,引入随机采样器,建立一致性并提供收敛保证,经评估验证了该方法的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02161 2026-07-14 cs.CV 版本更新

TIIF-Bench: How Does Your T2I Model Follow Your Instructions?

TIIF-Bench:你的文本到图像模型如何遵循指令?

Xinyu Wei, Jinrui Zhang, Zeqing Wang, Hongyang Wei, Zhen Guo, Bairui Li, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学) OPPO Research Institute(OPPO研究院)

AI总结 研究旨在评估T2I模型遵循指令能力,提出TIIF-Bench基准,含多维度、多难度提示及新评估指标,利用大语言模型知识开发可重现评估器,通过对主流模型测试分析其优缺点及现有基准局限性。

Comments 35 pages, 14 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18610 2026-07-14 cs.CL 版本更新

PM-KVQ: Progressive Mixed-precision KV Cache Quantization for Long-CoT LLMs

PM-KVQ:用于长思维链语言模型的渐进式混合精度键值缓存量化

Tengxuan Liu, Shiyao Li, Jiayi Yang, Tianchen Zhao, Feng Zhou, Xiaohui Song, Guohao Dai, Shengen Yan, Huazhong Yang, Yu Wang

机构 * Tsinghua University(清华大学) Infinigence-AI Columbia University(哥伦比亚大学) OPPO AI Center(OPPO人工智能中心) Shanghai Jiaotong University(上海交通大学)

AI总结 针对长思维链语言模型因键值缓存内存开销大导致性能下降的问题,提出渐进式混合精度KV缓存量化(PM-KVQ),通过渐进量化策略和逐块内存分配减少累积误差,用带位置插值的校准策略增加校准长度,提升了推理性能和吞吐量。

Comments Accepted by ICLR 2026. Code available at https://github.com/thu-nics/PM-KVQ

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09661 2026-07-13 cs.CV 新提交

PanoWorld: Real-World Panoramic Generation

全景世界:真实世界全景生成

Haoyuan Li, Dizhe Zhang, Yuemei Zhou, Xiangkai Zhang, Haoran Feng, Xiaofan Lin, Wenjie Jiang, Bo Du, Ming-Hsuan Yang, Lu Qi

机构 * Insta360 Research(影石创新科技研究院) Institute of Automation Chinese Academy of Sciences(中国科学院自动化研究所) Tsinghua University(清华大学) Wuhan University(武汉大学) UC Merced(加州大学默塞德分校)

AI总结 该研究旨在解决全景世界模型的远程记忆挑战,提出PanoWorld,利用旋转等变特性简化相机轨迹,通过DPRC和GMA进行建模与记忆增强,经三阶段训练优化,构建World360数据集验证其有效性,优于其他方法且将公开模型、代码和数据集。

Comments Project page: https://lihaoy-ux.github.io/panoworld-page/ Code:https://github.com/Insta360-Research-Team/PanoWorld

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09537 2026-07-13 cs.LG 新提交

GatedLinear: Adaptive Routing of Complementary Linear Bases for Time Series Forecasting

门控线性:用于时间序列预测的互补线性基的自适应路由

Qitai Tan, Ruiwen Gu, Yilin Su, Mo Li, Xu Lin, Xiao-Ping Zhang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

AI总结 针对时间序列预测中多样动态难以用单一机制处理的问题,提出门控线性框架,通过三种专门机制及三因式融合门实现互补线性基的自适应路由,实验显示其在精度、可解释性和参数规模上表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09526 2026-07-13 cs.CV cs.AI 新提交

ALICE: Learning a General-Purpose Pathology Foundation Model from Vision, Vision-Language, and Slide-Level Experts

ALICE:从视觉、视觉语言和玻片级专家学习通用病理学基础模型

Jiawen Li, Tian Guan, Huijuan Shi, Xitong Ling, Mingxi Fu, Anjia Han, Chao He, Yonghong He

机构 * Institute of Biopharmaceutical and Health Engineering, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学生物医药与健康工程研究院,清华大学深圳国际研究生院) Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Pathology, The First Affiliated Hospital of Sun Yat-sen University(中山大学附属第一医院病理科) Medical Optical Technology R&D Center, Research Institute of Tsinghua, Pearl River Delta(清华珠三角研究院医学光学技术研发中心)

AI总结 研究提出通过多阶段凝聚蒸馏训练的ALICE统一基础模型,将多种教师模型知识整合到单个主干。它在大量图像上预训练,经多场景多任务评估,在任务匹配病理基础模型中平均排名最佳,证明凝聚蒸馏可整合能力用于广泛病理学应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06988 2026-07-13 cs.RO cs.AI 新提交

WAM-TTT: Steering World-Action Models by Watching Human Play at Test Time

WAM-TTT:在测试时通过观察人类行为来引导世界行动模型

Yusen Feng, Bingchen Han, Jiangran Lyu, Kai Liu, Yixin Zheng, Yuxuan Wan, Weiheng Liu, Sun Han, Ruiqin Li, Yulong Zhang, Fangfu Liu, Xuesong Shi, Libin Liu, Yizhou Wang, Zhizheng Zhang, He Wang

机构 * Peking University(北京大学) Galbot CASIA(中国科学院自动化所) Tsinghua University(清华大学)

AI总结 研究旨在解决引导机器人基础模型的难题,提出WAM-TTT框架,通过自监督视频预测吸收人类视频到自适应内存,经元训练阶段对齐人机行为,测试时仅用未标记人类视频,实现高效可重复引导且优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04261 2026-07-13 cs.AI 新提交

Shortcut Learning in Legal Judgment Prediction: Empirical Evidence from the UK Employment Tribunal

法律判决预测中的捷径学习:来自英国就业法庭的实证证据

Joe Watson, Joana Ribeiro de Faria, Marcus Tomalin, Måns Magnusson, Huiyuan Xie, Hao Tian Yeung, Christine Carter, Jonathan Rutherford, Felix Steffek

机构 * Faculty of Law, University of Cambridge(剑桥大学法学院) The Psychometrics Centre, Cambridge Judge Business School, University of Cambridge(剑桥大学心理学测量中心,剑桥Judge商学院) Faculty of English, University of Cambridge(剑桥大学英语学院) Department of Statistics, Uppsala University(乌普萨拉大学统计系) Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Engineering, University of Cambridge(剑桥大学工程系)

AI总结 研究英国就业法庭判决中索赔结果预测的捷径学习,用33158条索赔语料库预测结果,发现基于事后司法文本训练的法律判决预测系统性能或被夸大,去除泄漏特征后模型仍能提取有用信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29858 2026-07-13 cs.CL 版本更新

Smooth Scaling Laws Hide Stepwise Token Learning

平滑缩放定律隐藏了逐步的令牌学习

Pingjie Wang, Zechen Hu, Peiru Yang, Fu Guo, Debing Zhang

机构 * Dots Studio, Xiaohongshu Inc.(dots studio,小红书公司) Shanghai Jiao Tong University(上海交通大学) Tsinghua university(清华大学)

AI总结 本文提出令牌级框架,将缩放定律分解为上下文令牌的局部学习事件,通过拟合S形曲线发现令牌学习集中在局部转换中,并利用学习时间谱定量重建验证损失导数,进而通过重塑训练分布实现11%的验证损失加速降低。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31271 2026-07-13 cs.CV 版本更新

DriveMA: Driving Vision-Language-Action Models with verifiable Meta-Actions

DriveMA:基于可验证元动作的驾驶视觉-语言-动作模型

Weicheng Zheng, Yixin Huang, Qiao Sun, Derun Li, Hang Zhao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) Tsinghua University(清华大学) Tongji University(同济大学)

AI总结 提出DriveMA框架,通过可验证元动作弥合语言与动作的差距,结合动作中心监督训练和强化学习实现端到端驾驶规划,在Waymo Open Dataset上取得最优性能。

Comments arXiv admin note: text overlap with arXiv:2605.21273

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15849 2026-07-13 cs.CV 版本更新

Memory-SAM: Human-Prompt-Free Tongue Segmentation via Retrieval-to-Prompt

Memory-SAM:无需人工提示的舌头分割:通过检索生成提示

Joongwon Chae, Lihui Luo, Xi Yuan, Dongmei Yu, Zhenglin Chen, Lian Zhang, Peiwu Qin

机构 * Tsinghua University, China(清华大学) The Fifth Affiliated Hospital of Wenzhou Medical University, China(温州医科大学第五附属医院) Shenzhen Traditional Chinese Medicine Hospital, China(深圳中医医院) Wenzhou Medical University, China(温州医科大学) The First Hospital of Hebei Medical University, China(河北医科大学第一医院) Chinese Medicine Guangdong Laboratory/Hengqin Laboratory, China(广东中医实验室/横琴实验室)

AI总结 Memory-SAM通过检索生成提示实现无需人工提示的舌头分割,利用密集DINOv3特征和FAISS检索自动生成有效提示,提升分割精度与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12939 2026-07-13 cs.RO 版本更新

RoboStream: Weaving Spatio-Temporal Reasoning with Memory in Vision-Language Models for Robotics

RoboStream: 用记忆融合时空推理提升视觉语言模型在机器人中的应用

Yuzhi Huang, Jie Wu, Weijue Bu, Ziyi Xiong, Gaoyang Jiang, Ye Li, Kangye Ji, Shuzhao Xie, Yue Huang, Chenglei Wu, Jingyan Jiang, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(深圳国际研究生院,清华大学) YXGN Robotics(YXGN机器人) China University of Mining and Technology(中国矿业大学) Shenzhen Technology University(深圳技术大学) Huazhong University of Science and Technology(华中科技大学) Xiamen University(厦门大学)

AI总结 RoboStream通过时空融合令牌和因果时空图实现持久记忆,解决机器人长时间任务中的几何锚定和状态追踪问题,提升长期任务表现。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10260 2026-07-13 cs.CV cs.AI 版本更新

H3Former: Hypergraph-based Semantic-Aware Aggregation via Hyperbolic Hierarchical Contrastive Loss for Fine-Grained Visual Classification

H3Former:基于超图的语义感知聚合,通过双曲层次对比损失进行细粒度视觉分类

Yongji Zhang, Siqi Li, Kuiyang Huang, Yue Gao, Yu Jiang

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) College of Software, Jilin University(吉林大学软件学院) School of Software, Tsinghua University(清华大学软件学院)

AI总结 针对细粒度视觉分类难题,提出H3Former框架,通过语义感知聚合模块利用多尺度上下文线索构建加权超图捕捉高阶语义依赖,引入双曲层次对比损失增强语义约束,实验验证了该框架在FGVC任务中的优越性。

Comments Accepted by IEEE Transactions on Image Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08646 2026-07-10 cs.CL cs.AI 新提交

UltraX: Refining Pre-Training Data at Scale with Adaptive Programmatic Editing

UltraX:通过自适应编程编辑大规模精炼预训练数据

Xinlong Zhao, Dongsheng Liu, Hengyu Zhao, Zixuan Fu, Zheng Wang, Jie Cai, Jie Zhou, Qiang Ma, Xuanhe Zhou, Xu Han, Yudong Wang, Zhiyuan Liu

机构 * Peking University(北京大学) ModelBest Inc.(ModelBest公司) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究针对训练数据极限下大语言模型高质量数据利用问题,提出UltraX框架,通过引入插入完善编辑功能空间,构建程序监督生成管道,经实验验证其在各语料库平均性能最高,数据效率和精炼可靠性强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08198 2026-07-10 cs.CV 新提交

Unpaired Joint Distribution Modeling via Multi-Scale Image Representations

通过多尺度图像表示进行无配对联合分布建模

Yihang Zou, Hui Zhang, Zuowei Shen, Chenglong Bao

机构 * Yau Mathematical Sciences Center, Tsinghua University(丘成桐数学科学中心,清华大学) Department of Mathematical Sciences, Tsinghua University(清华大学数学科学系) Qiuzhen College, Tsinghua University(清华大学求真书院) Department of Mathematics, National University of Singapore(新加坡国立大学数学系) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究院) State Key Laboratory of Membrane Sciences, Tsinghua University(清华大学膜生物学国家重点实验室)

AI总结 研究从边际观测学习联合分布问题,提出LUD - MSR框架,通过辅助表示建模并优化证据下界,建立误差上界揭示权衡,引入MSR映射,实验证明该框架在真实去噪基准测试中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08161 2026-07-10 cs.CL cs.CV 新提交

SQuaD-SQL: Efficient Text-to-SQL with Small Language Models via LLM-Guided Knowledge Distillation

SQuaD-SQL:通过大语言模型引导的知识蒸馏,利用小语言模型实现高效的文本到SQL转换

Wangyu Wu, Xiaojian Lin, Rong Fu, Zaiyang Yu, Xuhang Chen, Wenjun Yu, Zhenhong Chen

机构 * The University of Liverpool(利物浦大学) University of Macau(澳门大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Microsoft(微软) Shanghai University of International Business and Economics(上海国际经贸管理大学) Huizhou University(惠州市大学)

AI总结 研究如何让小语言模型在文本到SQL任务中接近大语言模型性能。核心方法是通过知识蒸馏和合成数据生成,包含基于大语言模型的合成数据生成、参数高效微调和领域自适应微调三个关键组件。主要贡献是在WikiSQL数据集上执行准确率达86.9%,推理更快、内存使用更低。

Comments Accepted at IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08080 2026-07-10 cs.CL 新提交

MASTE: A Multi-Agent Pipeline for Zero-Shot Aspect Sentiment Triplet Extraction

MASTE:一种用于零样本方面情感三元组提取的多智能体管道

Ao Hong, Lehang Wang, Zhirun Yue, Mingxin Wang, Zihan Wang, Houde Liu

机构 * Tsinghua University(清华大学) Wuhan University(武汉大学)

AI总结 研究针对方面情感三元组提取问题,提出多智能体管道MASTE,将其分解为四个阶段,由专门智能体处理不同子任务,实现完全无训练的零样本提取,在多个基准测试中显著优于基线,缩小与全监督方法差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24477 2026-07-10 cs.CV cs.AI cs.SD 新提交

video-SALMONN-R$^3$: Learning to ReWatch, ReAsk, and ReAnswer for Efficient Video Understanding

video-SALMONN-R$^3$: 学习重看、重问和重答以实现高效视频理解

Yixuan Li, Guangzhi Sun, Yudong Yang, Chao Zhang

机构 * Tsinghua University(清华大学) ByteDance(字节跳动) University of Cambridge(剑桥大学)

AI总结 提出video-SALMONN-R$^3$,首个通过强化学习实现重看机制的视频大语言模型,无需链式思维冷启动,采用重答和重问策略提升视频问答效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15920 2026-07-10 cs.CV 新提交

OmniOPSD: Rationale-Privileged On-Policy Self-Distillation for Affective Computing

OmniOPSD:面向情感计算的理性特权在线自蒸馏

Zebang Cheng, Shuimu Chen, Boxue Yang, Yuanshen Guan, Jingyi Chen, Zheng Lian, Xiaojiang Peng, Fei Ma, LaiZhong Cui, Qi Tian

机构 * Shenzhen University(深圳大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东省人工智能与数字经济实验室(深圳)) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) University of Science and Technology of China(中国科学技术大学) Shenzhen Technology University(深圳技术大学) Tongji University(同济大学) Huawei(华为)

AI总结 针对多模态大模型在复杂推理任务中奖励稀疏的问题,提出OmniOPSD框架,利用前沿模型生成的理性作为教师特权证据而非学生模仿目标,通过在线自蒸馏提供密集令牌级监督,在MER-UniBench上取得84.19平均分的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22951 2026-07-10 cs.AI cs.CL cs.LG 版本更新

The Power of Power Law: Asymmetry Enables Compositional Reasoning

幂律的力量:不对称性使组合推理成为可能

Zixuan Wang, Xingyu Dang, Jason D. Lee, Kaifeng Lyu

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of California, Berkeley(加州大学伯克利分校)

AI总结 本文研究了幂律分布对组合推理任务的影响,发现其在状态跟踪和多步算术等任务中优于均匀分布,通过理论分析揭示了幂律分布通过引入有益的不对称性,使模型能更高效地学习长尾技能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13230 2026-07-10 cs.LG cs.NE 版本更新

Does Dimensionality Reduction via Random Projections Preserve Landscape Features?

通过随机投影进行降维是否能保持景观特征?

Iván Olarte Rodríguez, Anja Jankovic, Thomas Bäck, Elena Raponi

机构 * Leiden Institute of Advanced Computer Science, Leiden University(莱顿高级计算机科学研究所,莱顿大学) RTWH Aachen University(亚琛工业大学) Institute for Clarity in Documentation(文档清晰研究所) Inria Paris-Rocquencourt(巴黎-罗quentourt研究所) Rajiv Gandhi University(拉贾·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

AI总结 本文研究了通过随机高斯嵌入进行降维对探索性景观分析特征的鲁棒性,发现线性随机投影会改变与ELA相关的几何和拓扑结构,大多数特征对嵌入高度敏感。

Comments 9 Pages, 5 figures, Submitted and accepted to Proceedings of The Genetic and Evolutionary Computation Conference 2026,

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10180 2026-07-10 cs.DC cs.LG 版本更新

Tessera: Unlocking Heterogeneous GPUs through Kernel-Granularity Disaggregation

Tessera:通过内核粒度解耦解锁异构GPU

Tiancheng Hu, Jin Qin, Zheng Wang, Junhao Hu, Yuzheng Wang, Lei Chen, Yizhou Shan, Mingxing Zhang, Ting Cao, Chunwei Xia, Huimin Cui, Tao Xie, Chenxi Wang

机构 * Peking University(北京大学) Key Lab of HCST (PKU), MOE(高可信软件技术教育部重点实验室(北京大学)) University of Chinese Academy of Sciences(中国科学院大学) Institute for AI Industry Research, Tsinghua University(清华大学人工智能研究院) Tsinghua University(清华大学) University of Leeds(利兹大学) Huawei Cloud(华为云)

AI总结 Tessera通过内核粒度解耦提升异构GPU上的大模型推理性能和成本效率,利用离线分析与在线适应结合,实现计算与硬件能力的匹配。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12742 2026-07-10 cs.CV 版本更新

Effective Gaussian Management for High-fidelity Scene Reconstruction

高保真物体重建的有效高斯管理

Jiateng Liu, Hao Gao, Jiu-Cheng Xie, Chi-Man Pun, Jian Xiong, Haolun Li, Junxin Chen, Feng Xu

机构 * School of Automation, Nanjing University of Posts and Telecommunications(南京邮电大学自动化学院) school of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院) School of Software, Dalian University of Technology(大连理工大学软件学院) Department of Computer and Information Science, University of Macau(澳门大学计算机与信息科学系) School of Software and BNRist, Tsinghua University(清华大学软件学院和BNRist)

AI总结 提出一种高斯管理框架,通过选择性激活属性、自适应表示和任务解耦剪枝,结合正则化表面重建模块,在减少参数的同时实现高保真外观与几何重建。

Comments 15 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15543 2026-07-10 cs.CL cs.AI 版本更新

ParamMute: Suppressing Knowledge-Critical FFNs for Faithful Retrieval-Augmented Generation

ParamMute:抑制知识关键的前馈神经网络以实现忠实的检索增强生成

Pengcheng Huang, Zhenghao Liu, Yukun Yan, Haiyan Zhao, Xiaoyuan Yi, Hao Chen, Zhiyuan Liu, Maosong Sun, Tong Xiao, Ge Yu, Chenyan Xiong

机构 * School of Computer Science and Engineering, Northeastern University, China(东北大学计算机科学与工程学院) Department of Computer Science and Technology, Institute for AI, Tsinghua University, China(清华大学人工智能研究院计算机科学与技术系) Microsoft Research Asia, Beijing, China(微软亚洲研究院) Language Technologies Institute, Carnegie Mellon University, United States(卡内基梅隆大学语言技术研究所)

AI总结 研究RAG中LLMs不忠实生成问题,提出ParamMute框架抑制相关FFNs激活并校准模型,通过CoFaithfulQA基准评估,显著提升忠实性,减少对参数记忆依赖,为提高LLM在RAG中的可信度提供新方向。

Comments 26 pages, 7 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19422 2026-07-10 cs.CV 版本更新

LlamaSeg: Image Segmentation via Autoregressive Mask Generation

LlamaSeg:通过自回归掩码生成进行图像分割

Jiru Deng, Tengjin Weng, Tianyu Yang, Wenhan Luo, Zhiheng Li, Wenhao Jiang

机构 * Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济实验室) Tsinghua University(清华大学) Shenzhen University(深圳大学) Meituan(美团) Division of AMC and Department of ECE, HKUST(HKUST AMC 分部和电子工程系)

AI总结 LlamaSeg是通过自然语言指令统一图像分割任务的视觉自回归框架,将分割视为视觉生成,编码掩码为视觉令牌。引入数据标注管道和SA-OVRS数据集,能基于文本提示定位对象并生成掩码,实验显示其在分割基准上表现出色。

Journal ref ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏