arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

2026-07-21 至 2026-07-21 共收录 17
2607.18231 2026-07-21 cs.RO 新提交

FM-VLA: Force-based Memory for Vision-Language-Action Models in Contact-Rich Manipulation

FM-VLA:用于接触丰富操作中视觉-语言-动作模型的基于力的记忆

Ruicheng Li, Qixiu Li, Ruichun Ma, Yu Deng, Lin Luo, Zhiying Du, Jianfeng Xiang, Huizhi Liang, Ruicheng Wang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research(微软研究院) Fudan University(复旦大学) USTC(中国科学技术大学)

AI总结 研究针对视觉-语言-动作模型在接触丰富操作中的时间上下文推理问题,提出FM-VLA模型,通过基于力的记忆编码及投影,利用累积接触事件历史指导操作,在相关任务上评估,轻量级力记忆表现出色,显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18110 2026-07-21 cs.LG cs.CL 新提交

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

大语言模型作为教练:不可验证任务的体验式学习

Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) Peking University(北京大学)

AI总结 研究不可验证任务,提出体验式学习(EL),将LLM反馈模型从评判转为教练,通过提炼体验知识提供密集监督,在开放式任务上表现优于基于规则的RL,泛化性好且减轻奖励作弊。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17897 2026-07-21 cs.LG 新提交

Distributional Soft Bellman Operator under the Cramér Geometry

在克拉默几何下的分布软贝尔曼算子

Keru Wang, Yixin Deng, Yao Lyu, Stephen Redmond, Shengbo Eben Li

机构 * School of Electrical and Electronic Engineering, University College Dublin(都柏林大学学院电气与电子工程学院) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与运载学院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院)

AI总结 研究分布软策略迭代中策略评估步骤里的固定策略分布软贝尔曼算子,基于克拉默几何,制定CDF级算子并证明其收缩性质,获得唯一不动点,还通过共轭得到谱域表示,为DSPI式算法研究提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17745 2026-07-21 cs.AI 新提交

WuYu-EnvLE-Bench: A Benchmark for Evaluating Large Language Models in Environmental Law Enforcement

吴语-环境执法基准:评估大语言模型在环境执法中的基准

Ziliang Yang, Yi Zhang, Kaijun Lin, Jiachao Ke, Haihong Xu, Zongguo Wen

机构 * School of Environment, Tsinghua University(清华大学环境学院) College of Economics and Management, Beijing University of Technology(北京工业大学经济与管理学院) State Key Laboratory of Iron and Steel Industry Environmental Protection, School of Environment, Tsinghua University(清华大学环境学院钢铁工业环境保护国家重点实验室) Appraisal Center for Environmental Engineering, Ministry of Ecology and Environment(生态环境部环境工程评估中心)

AI总结 该研究针对大语言模型在环境执法中生成可追溯决策能力不明的问题,构建吴语-环境执法基准,含多任务多子领域实例,用AES和IEI评估模型,发现其在部分任务表现不佳,强调证据与规则感知的执法推理需求。

Comments 98 pages, 45 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17733 2026-07-21 cs.LG cs.AI 新提交

MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference

MXSens:用于高效大语言模型推理的灵敏度感知混合精度量化

Simla Burcu Harma, Danila Mishin, Zhengyuan Su, Ayan Chakraborty, Elizaveta Kostenok, Dongho Ha, Babak Falsafi, Martin Jaggi, Yunho Oh, Amir Yazdanbakhsh

机构 * EPFL(洛桑联邦理工学院) Tsinghua University(清华大学) MangoBoost Inc.(芒果助推公司) Korea University(韩国大学) Google DeepMind(谷歌DeepMind)

AI总结 研究针对大语言模型推理中4位量化因异常值致精度降的问题,提出MXSens方法,基于列和层灵敏度分配混合尾数比特宽度,无需训练,利用MXINT块结构,在多模型任务中优于现有方法,平衡了量化的准确性与资源效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17621 2026-07-21 cs.AI 新提交

Mechanistic Attention Guidance for Agent Memory Refinement

用于智能体内存优化的机制性注意力引导

Yechao Hong, Haiquan Qiu, Yaqing Wang, Quanming Yao

机构 * Tsinghua University(清华大学) Beijing Institute of Mathematical Sciences and Applications(北京应用数学科学研究院)

AI总结 研究如何优化智能体内存,提出注意力引导内存优化框架AGMR,利用检索头注意力揭示内存使用模式,指导段级内存更新,经实验验证其能提升任务性能与内存效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17523 2026-07-21 cs.CV cs.AI cs.CL 新提交

Thinking in Video: Can Video Generators Really Reason About the Real World?

视频中的思考:视频生成器真的能对现实世界进行推理吗?

Yongheng Zhang, Guang Yang, Ruihan Hou, Qiguang Chen, Ziang Liu, Xiaolong Liu, Manman Zhang, Yanchao Hao, Zheng Wei, Hao Wu, Libo Qin, Peishan Dai, Yinghui Li, Di Yin, Xing Sun

机构 * Central South University(中南大学) Tencent(腾讯) Tsinghua University(清华大学)

AI总结 探讨视频生成器能否对现实世界推理,引入因果生成双判断(CGDJ)评估,发现开源模型无明确因果感知却有合理动态,先进闭源系统推理与生成一致性有限,还揭示了视听失调问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17340 2026-07-21 cs.CV 新提交

Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection

用于域增量目标检测的正交知识刷新

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Nankai University(南开大学) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 研究域增量目标检测问题,提出正交知识刷新(OKR)框架,通过构建特定域子空间、采用正交刷新策略和拓扑感知一致性,减少知识干扰和语义碎片化,实验表明该方法在mAP上比最佳无范例方法有显著提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17099 2026-07-21 cs.CV cs.AI 新提交

DepthART: Scaling Foundation Monocular Depth to Tiny Models

DepthART:将基础单目深度模型扩展到小型模型

Feng Xue, Wu Chen, Mingshuai Zhao, Guofeng Zhong, Anlong Ming, Haozhe Wang, Dianqiao Lei, Zhaowen Lin, Haiyang Zhang, Nicu Sebe

机构 * University of Trento(特伦托大学) Beijing University of Posts and Telecommunications(北京邮电大学) The Hong Kong University of Science and Technology(香港科技大学) Tsinghua University(清华大学)

AI总结 研究旨在将基础单目深度模型扩展到小型模型,核心方法是结合抗偏差数据采样与相机条件微调策略的DepthART,主要贡献是在多数据集上取得更好的零样本泛化和度量精度,还提供了可扩展模型家族。

Comments Accepted in ACM Multimedia 2026 ; Code: https://github.com/xuefeng-cvr/DepthART ; Project page: https://xuefeng-cvr.github.io/DepthART ;

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17097 2026-07-21 cs.CV 新提交

HarmoHOI: Harmonizing Appearance and 3D Motion for Multi-view Hand-Object Interaction Synthesis

HarmoHOI:用于多视图手-物体交互合成的外观与3D运动协调

Lingwei Dang, Juntong Li, Zonghan Li, Hongwen Zhang, Liang An, Wei Min, Yebin Liu, Qingyao Wu

机构 * South China University of Technology(华南理工大学) Beijing Normal University(北京师范大学) Tsinghua University(清华大学) Shadow AI(影谱科技)

AI总结 研究针对多视图手-物体交互合成难题,提出HarmoHOI统一扩散框架,用多视图扩散Transformer混合模型联合建模视频与点轨迹,结合全局运动对齐扩散确保一致性,采用混合数据学习策略,实现多视图HOI高质量合成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17095 2026-07-21 cs.AI 新提交

Fourier Geometric Wind Power Forecasting with Numerical Weather Prediction

基于数值天气预报的傅里叶几何风力发电预测

Shiyuan Piao, Fan Zehui, Yang Liu, Hong Cheng, Juepeng Zheng, Jie Zhou, Fugee Tsung

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Goldwind Science and Technology Co.,Ltd(金风科技股份有限公司)

AI总结 研究针对风力发电预测难题,提出多模态框架,整合SCADA数据与NWP预测。先分解输入特征,再用几何编码器和傅里叶神经算子建模,实验表明该模型优于现有基线,凸显基于物理设计的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17070 2026-07-21 cs.AI 新提交

Bridging the Information Gap: Semantic Densification and Hindsight Distillation for Cold-Start Prediction

弥合信息差距:冷启动预测的语义致密化与事后蒸馏

Hao Duong Le, Yifei Gao, Huan Li, Lun Jiang, Chen Bai, Ke Xing, Chen Zhang

机构 * Tsinghua University(清华大学) Meituan(美团)

AI总结 针对电子商务平台新用户冷启动预测难题,SemRaD框架利用结构化语义推理管道和事后感知蒸馏网络,有效弥合信息差距,提升了LTV和CVR,减少训练数据用量,在工业数据集和在线测试中均取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17050 2026-07-21 cs.CV cs.AI 新提交

EvoGUI: An Evolution-Aware Benchmark for GUI State-Transition Understanding

EvoGUI:用于GUI状态转换理解的进化感知基准测试

Yaohan Yang, Minglei Shi, Borui Zhang, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学)

AI总结 研究GUI状态转换理解,提出EvoGUI诊断框架,将GUI轨迹转化为视觉问答探针,无需额外注释。通过Mind2Web和WebLINX实例化EvoGUI-Bench并零样本评估28种模型配置,结果显示其可补充端到端评估,揭示理解提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16841 2026-07-21 cs.CV cs.MM 新提交

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

回答前看清楚:通过显著性驱动的感知重新对齐减轻LVLMs中的幻觉

Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

机构 * Xidian University(西安电子科技大学) Tsinghua University(清华大学) Shanghai Road Transport Development Center(上海市道路运输发展中心) Hunan Institute of Advanced Technology(湖南先进技术研究院)

AI总结 研究针对LVLMs易产生幻觉问题,提出无需训练的SDPR框架,通过显著性驱动注意力重新分配、缓存对齐及先验约束对比解码,整体对齐视觉意识,在多基准测试中优于现有方法,无需额外训练且开销小。

Comments Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16828 2026-07-21 cs.CV 新提交

UniNDM: A Unified Noise-driven Detection and Mitigation Framework Against Sexual Content in Text-to-Image Generation

UniNDM:文本到图像生成中针对性内容的统一噪声驱动检测与缓解框架

Yao Huang, Yitong Sun, Huanran Chen, Ruochen Zhang, Shouwei Ruan, Ranjie Duan, Maoxun Yuan, Yinpeng Dong, Hui Xue, Xiaochun Cao, Xingxing Wei

机构 * Institute of Artificial Intelligence, State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室人工智能研究院) College of Artificial Intelligence, Tsinghua University(清华大学人工智能学院) Security Department, Alibaba Group(阿里巴巴集团安全部) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-Sen University(中山大学深圳校区网络科学与技术学院)

AI总结 针对文本到图像生成易受隐式性提示影响的问题,提出UniNDM统一噪声驱动框架。利用早期预测噪声的可分离性开发轻量级检测器,引入噪声增强自适应负引导缓解问题,扩展到扩散变压器架构,实验显示比现有方法有显著改进。

Comments 18 pages, 10 figures, accepted by TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16427 2026-07-21 cs.CL 新提交

Multi-level context Modeling for consistent expert selection in Mixture-of-Experts

用于混合专家模型中一致专家选择的多层次上下文建模

Shuhan Huang, Naifan Zhang, Yuanbo Tang, Yang Li, Wai Kin Victor Chan

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) School of AI, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)人工智能学院)

AI总结 研究混合专家模型中专家选择问题,提出多层次上下文融合MoE框架,通过整合跨层语义聚合和局部令牌级交互信号构建上下文感知表示,提升路由一致性和下游性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16247 2026-07-21 cs.LG cs.CV 新提交

Self-Evolving Just-In-Time Memory for Proactive Embodied Safety

用于主动具身安全的自进化即时记忆

Bingrui Sima, Lizhong Wang, Xiaoya Lu, Kun He, Xiao Yang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学)

AI总结 研究视觉语言模型在闭环交互中应对动态危险的问题,提出自进化即时记忆框架,含RSG、事实记忆和经验记忆,并通过自动测试-验证-写入循环完善元技能,实验证明该框架大幅提升安全成功率且不阻碍任务进展。

详情

展开后加载摘要…

URL PDF HTML 收藏