arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Tsinghua University(清华大学)

共收录 4547
2506.08125 2026-04-20 cs.LG cs.CL

Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning

并非所有标记都重要:通过强化学习中的标记重要性实现高效的LLM推理

Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里云文大模型应用团队) Microsoft(微软) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院 ubiquitous 数据赋能重点实验室)

AI总结 本文提出通过标记重要性优化强化学习,减少冗余并提升LLM推理效率和准确性,实验显示响应长度显著缩短且正确性保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15272 2026-04-17 cs.PL cs.AI cs.LG

Prism: Symbolic Superoptimization of Tensor Programs

Prism: 张量程序的符号超优化

Mengdi Wu, Xiaoyu Jiang, Oded Padon, Zhihao Jia

机构 * Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学) Weizmann Institute of Science(魏茨曼科学研究院)

AI总结 Prism通过符号化层级表示实现张量程序的符号超优化,结合符号推理与自动调优,提升效率并减少优化时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15090 2026-04-17 cs.CV

Beyond Visual Cues: Semantic-Driven Token Filtering and Expert Routing for Anytime Person ReID

超越视觉线索:基于语义的标记过滤和专家路由用于即时人物重识别

Jiaxuan Li, Xin Wen, Zhihang Li

机构 * Tsinghua University(清华大学) Independent Researcher(独立研究者) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出STFER框架,利用大视觉-语言模型生成身份一致的文本,提升对服装变化和模态转换的鲁棒性,通过语义驱动的标记过滤和专家路由实现多场景鲁棒性,实验表明模型在AT-USTC数据集上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04116 2026-04-17 cs.AI

Searching Meta Reasoning Skeleton to Guide LLM Reasoning

通过搜索元推理骨架来指导大语言模型推理

Ziying Zhang, Yaqing Wang, Quanming Yao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Beijing Institute of Mathematical Sciences and Applications(北京数学科学与应用研究所) State Key laboratory of Space Network and Communications, Tsinghua University(清华大学空间网络与通信国家重点实验室)

AI总结 本文提出AutoMR框架,通过图表示搜索查询感知的元推理骨架,提升大语言模型推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14779 2026-04-17 cs.CV cs.CL

AIM: Asymmetric Information Masking for Visual Question Answering Continual Learning

AIM:面向视觉问答持续学习的非对称信息掩码

Peifeng Zhang, Zice Qiu, Donghua Yu, Shilei Cao, Juepeng Zheng, Yutong Lu, Haohuan Fu

机构 * Sun Yat-Sen University(中山大学) National Supercomputing Center in Shenzhen(深圳国家超算中心) Tsinghua University(清华大学)

AI总结 针对视觉问答持续学习中因模型结构不对称导致的灾难性遗忘问题,提出AIM方法,通过模态特定敏感性指导的针对性掩码平衡稳定性与可塑性,提升在VQA v2和GQA任务中的平均性能和平均遗忘度。

Comments 18 pages, 9 figures. Submitted to ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14672 2026-04-17 cs.CL

SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models

SPAGBias:揭示和追踪大型语言模型中的结构化空间性别偏见

Binxian Su, Haoye Lou, Shucheng Zhu, Weikang Wang, Ying Liu, Dong Yu, Pengyuan Liu

机构 * School of Information Science, Beijing Language and Culture University(北京语言大学信息科学学院) Libraries, Renmin University of China(中国人民大学图书馆) School of Humanities, Tsinghua University(清华大学人文学院) Shanghai University of Finance and Economics(上海财经大学) National Print Media Language Resources Monitoring & Research Center(国家印刷媒体语言资源监测与研究中心)

AI总结 本文提出SPAGBias框架,系统评估LLM中的空间性别偏见,通过62种城市微空间分类、提示库和三层诊断方法,揭示性别空间关联及偏见来源,扩展了偏见研究到空间领域。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14564 2026-04-17 cs.AI cs.CL

MARS$^2$: Scaling Multi-Agent Tree Search via Reinforcement Learning for Code Generation

MARS$^2$:通过强化学习提升多智能体树搜索用于代码生成

Pengfei Li, Shijie Wang, Fangyuan Li, Yikun Fu, Kaifeng Liu, Kaiyan Zhang, Dazhi Zhang, Yuqiang Li, Biqing Qi, Bowen Zhou

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Harbin Institute of Technology(哈尔滨工业大学) Tsinghua University(清华大学)

AI总结 MARS$^2$通过多智能体协作与树搜索结合,提升强化学习在代码生成中的性能,实验表明其在多种模型和训练设置下均有效。

Comments Accepted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14541 2026-04-17 cs.CV

Giving Faces Their Feelings Back: Explicit Emotion Control for Feedforward Single-Image 3D Head Avatars

赋予面孔情感:面向单图像3D头像的显式情绪控制

Yicheng Gong, Jiawei Zhang, Liqiang Liu, Yanwen Wang, Lei Chu, Jiahao Li, Hao Pan, Hao Zhu, Yan Lu

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

AI总结 本文提出一种显式情绪控制框架,通过双路径调节机制在不修改核心设计的情况下,将情绪作为独立控制信号注入单图像3D头像重建中,实现情绪与身份的解耦和可控情绪转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14184 2026-04-17 eess.SY cs.AI cs.SY

End-to-End Learning-based Operation of Integrated Energy Systems for Buildings and Data Centers

建筑与数据中心一体化能源系统的端到端学习操作

Zhenyu Pu, Yu Yang, Liang Yu, Xiaohong Guan

机构 * School of Automation Science and Engineering, Xi’an Jiaotong University(西安交通大学自动化科学与工程学院) College of Automation, Nanjing University of Posts and Telecommunications(南京邮电大学自动化学院) Center for Intelligent and Networked Systems, Department of Automation, Tsinghua University(清华大学自动化系智能与网络化系统中心)

AI总结 本文提出端到端学习方法优化建筑与数据中心一体化能源系统,通过回收数据中心废热提升能效,并在不确定性下实现运营优化。

Comments 7 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14160 2026-04-17 cs.AI

NuHF Claw: A Risk Constrained Cognitive Agent Framework for Human Centered Procedure Support in Digital Nuclear Control Rooms

NuHF Claw:一种面向数字核控制室的人本流程支持的风险约束认知代理框架

Xingyu Xiao, Jiejuan Tong, Jun Sun, Zhe Sui, Peng Chen, Jingang Liang, Haitao Wang

机构 * Institute of Nuclear and New Energy Technology, Tsinghua University(清华大学核能与新能源技术研究院) National Key Laboratory of Human Factors Engineering(人因工程国家重点实验室) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

AI总结 本文提出NuHF Claw框架,通过风险约束代理运行时,将认知状态推断与概率安全评估结合,实现实时自主系统行为调控,提升核控制室操作安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14158 2026-04-17 cs.CL cs.AI

MemGround: Long-Term Memory Evaluation Kit for Large Language Models in Gamified Scenarios

MemGround:用于大型语言模型在游戏化场景中的长期记忆评估套件

Yihang Ding, Wanke Xia, Yiting Zhao, Jinbo Su, Jialiang Yang, Zhengbo Zhang, Ke Wang, Wenming Yang

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) CASIA

AI总结 MemGround通过游戏化交互场景评估LLM的长期记忆能力,提出三级框架和多维指标,揭示先进模型在动态跟踪和复杂推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14041 2026-04-17 cs.CV

Seek-and-Solve: Benchmarking MLLMs for Visual Clue-Driven Reasoning in Daily Scenarios

寻找并解决:用于日常场景中视觉线索驱动推理的MLLMs基准测试

Xiaomin Li, Tala Wang, Zichen Zhong, Ying Zhang, Zirui Zheng, Takashi Isobe, Dezhuang Li, Huchuan Lu, You He, Xu Jia

机构 * Dalian University of Technology(大连理工大学) WeChat, Tencent Inc.(微信,腾讯公司) Tsinghua University(清华大学)

AI总结 本文提出DailyClue基准测试,旨在评估MLLMs在日常场景中通过视觉线索进行推理的能力,强调真实日常活动和挑战性查询设计,推动模型深入理解与推理。

Comments Accepted by ACL Findings 2026. Project page: https://xiaominli1020.github.io/DailyClue/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04738 2026-04-17 cs.CL

IF-RewardBench: Benchmarking Judge Models for Instruction-Following Evaluation

IF-RewardBench:用于指令遵循评估的评判模型基准测试

Bosi Wen, Yilin Niu, Cunxiang Wang, Xiaoying Ling, Ying Zhang, Pei Ke, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) University of Electronic Science and Technology of China(电子科技大学)

AI总结 本文提出IF-RewardBench,一个全面的指令遵循元评估基准,通过构建偏好图评估评判模型的排序能力,揭示现有模型缺陷,并展示其在下游任务中的更强相关性。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07338 2026-04-17 cs.CL

Beyond Literal Mapping: Benchmarking and Improving Non-Literal Translation Evaluation

超越字面映射:非字面翻译评估的基准测试与改进

Yanzhi Tian, Cunxiang Wang, Zeming Liu, Heyan Huang, Wenbo Yu, Dawei Song, Jie Tang, Yuhang Guo

机构 * School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程组) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

AI总结 本文提出RATE框架,通过反思核心代理动态调用专用子代理,提升非字面翻译评估的准确性,实验显示其在系统和段级相关性上比现有方法提高至少3.2分。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13671 2026-04-17 cs.CV

AgentIAD: Agentic Industrial Anomaly Detection via Adaptive Memory Augmentation

AgentIAD: 通过自适应记忆增强的代理工业异常检测

Junwen Miao, Penghui Du, Yingying Fan, Yi Liu, Yu Wang, Runze He, Lida Huang, Yan Wang

机构 * AIR, Tsinghua University(清华大学AIR) Etude AI Stony Brook University(石溪大学)

AI总结 本文提出AgentIAD框架,通过统一的动作空间实现迭代工业检测,利用视觉记忆和检索记忆进行多轮感知-行动推理,提升异常检测准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01016 2026-04-17 cs.CL

Prompt-R1: Collaborative Automatic Prompting Framework via End-to-end Reinforcement Learning

Prompt-R1: 通过端到端强化学习实现的协作自动提示框架

Wenjin Liu, Haoran Luo, Xueyuan Lin, Haoming Liu, Tiesunlong Shen, Jiapu Wang, Rui Mao, Erik Cambria

机构 * Hainan University(海南大学) Nanyang Technological University(南洋理工大学) Hithink Research(慧思研究) HKUST (Guangzhou)(香港科技大学(广州)) IDEA Research(IDEA研究院) Tsinghua University(清华大学) National University of Singapore(新加坡国立大学) Nanjing University of Science and Technology(南京理工大学)

AI总结 本文提出Prompt-R1框架,通过小规模LLM与大规模LLM协作,利用强化学习提升复杂问题解决能力,实验表明其在多个数据集上表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01014 2026-04-17 cs.CL

IF-CRITIC: Towards a Fine-Grained LLM Critic for Instruction-Following Evaluation

IF-CRITIC:面向指令遵循评估的细粒度LLM批评者

Bosi Wen, Yilin Niu, Cunxiang Wang, Pei Ke, Xiaoying Ling, Ying Zhang, Aohan Zeng, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) University of Electronic Science and Technology of China(电子科技大学) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

AI总结 本文提出IF-CRITIC,通过细粒度、高效且可靠的评估方法提升LLM指令遵循能力,采用检查清单生成器和约束级偏好优化训练模型,实验表明其优于现有基线模型。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08483 2026-04-17 cs.CL cs.AI

DeepPrune: Parallel Scaling without Inter-trace Redundancy

DeepPrune: 无需跨轨迹冗余的并行扩展

Shangqing Tu, Yaxuan Li, Yushi Bai, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海科技大学)

AI总结 本文提出DeepPrune框架,通过动态剪枝解决并行推理中的冗余问题,实现65.73%-88.50%的token减少,保持高精度。

Comments Accepted by ACL 2026 Findings, please check out the project page: https://deepprune.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23638 2026-04-17 cs.LG

LayerScope: Predictive Cross-Layer Scheduling for Efficient Multi-Batch MoE Inference on Legacy Servers

LayerScope:面向传统服务器的高效多批MoE推断的预测跨层调度

Enda Yu, Dezun Dong, Zhaoning Zhang, Zhe Bai, Weiling Yang, Haojie Wang, Dongsheng Li, Yongwei Wu, Xiangke Liao

机构 * National University of Defense Technology(国防科技大学) Tsinghua University(清华大学)

AI总结 LayerScope通过预测驱动的专家调度系统,解决MoE模型在传统服务器上部署时的内存和PCIe延迟瓶颈问题,提升吞吐量和降低延迟。

Comments publishing in ICS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20705 2026-04-17 cs.LG cs.AI

EEGDM: Learning EEG Representation with Latent Diffusion Model

EEGDM: 通过潜在扩散模型学习EEG表示

Shaocong Wang, Tong Liu, Yihan Li, Ming Li, Kairui Wen, Pei Yang, Wenqi Ji, Minjing Yu, Yong-Jin Liu

机构 * Tsinghua University(清华大学) Tianjin University(天津大学)

AI总结 EEGDM提出一种基于潜在扩散模型的自监督框架,通过生成EEG信号来捕捉全局动态和长程依赖,实现高质量的EEG信号重建和鲁棒表示学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14016 2026-04-16 cs.LG cs.AI

MAny: Merge Anything for Multimodal Continual Instruction Tuning

MAny:为多模态连续指令微调合并任何内容

Zijian Gao, Wangwang Jia, Xingxing Zhang, Pengfei Qian, Tao Sun, Bo Ding, Yong Dou, Huaimin Wang, Kele Xu

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院) National Key Laboratory of Parallel and Distributed Computing, National University of Defense Technology(国防科技大学并行与分布式计算国家重点实验室) State Key Laboratory of Complex & Critical Software Environment(复杂与关键软件环境国家重点实验室) School of Computer Science, Tsinghua University(清华大学计算机科学与技术系)

AI总结 针对多模态连续指令微调中感知漂移和推理崩溃问题,提出MAny框架,通过跨模态投影合并和低秩参数合并实现任务知识融合,提升模型鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13942 2026-04-16 cs.RO

Goal2Skill: Long-Horizon Manipulation with Adaptive Planning and Reflection

Goal2Skill:基于自适应规划与反思的长时程操作

Zhen Liu, Xinyu Ning, Zhe Hu, Xinxin Xie, Weize Li, Zhipeng Tang, Chongyu Wang, Zejun Yang, Hanlin Wang, Yitong Liu, Zhongzhu Pu

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Tsinghua University(清华大学)

AI总结 本文提出双系统框架,通过分离高层语义推理与低层运动执行,提升长时程操作的鲁棒性和适应性,实验表明其在RMBench任务中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13863 2026-04-16 cs.CV

PostureObjectstitch: Anomaly Image Generation Considering Assembly Relationships in Industrial Scenarios

姿态物体拼接:考虑装配关系的异常图像生成

Zebei Tong, Hongchang Chen, Yujie Lei, Gang Chen, Yushi Liu, Zhi Zheng, Hao Chen, Jieming Zhang, Ying Li, Dongpu Cao

机构 * Beijing Institute of Technology(北京理工大学) The Hong Kong Polytechnic University(香港理工大学) Tsinghua University(清华大学)

AI总结 本文提出PostureObjectStitch方法,通过解耦多视角图像特征和引入条件损失与几何先验,实现工业场景中考虑装配关系的准确异常图像生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13841 2026-04-16 cs.CV

DiffMagicFace: Identity Consistent Facial Editing of Real Videos

DiffMagicFace: 实现实时视频中人脸的恒定身份编辑

Huanghao Yin, Shenkun Xu, Kanle Shi, Junhai Yong, Bin Wang

机构 * Tsinghua University(清华大学)

AI总结 本文提出DiffMagicFace框架,通过整合文本和图像控制模型,实现视频中人脸编辑时保持身份一致性和内容一致性,无需依赖视频数据集,效果在视觉和量化指标上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13817 2026-04-16 cs.LG

RPS: Information Elicitation with Reinforcement Prompt Selection

RPS: 通过强化提示选择进行信息获取

Tao Wang, Jingyao Lu, Xibo Wang, Haonan Huang, Su Yao, Zhiqiang Hu, Xingyan Chen, Enmao Diao

机构 * Department of Computer Science, Southwestern University of Finance and Economics(西南财经大学计算机科学学院) China Telecom Corporation Limited(中国电信有限公司) Tsinghua University(清华大学) Beijing University of Posts and Telecommunications(北京邮电大学) Eindhoven University of Technology(埃因霍温理工大学)

AI总结 本文提出RPS框架,通过强化学习实现对话中自适应的信息获取,引入IELegal数据集验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13800 2026-04-16 cs.RO

EmbodiedClaw: Conversational Workflow Execution for Embodied AI Development

EmbodiedClaw:基于对话的多任务多场景多模型具身AI开发流程执行

Xueyang Zhou, Yihan Sun, Xijie Gong, Guiyao Tie, Pan Zhou, Lichao Sun, Yongchao Chen

机构 * School of Cyber Science and Engineering, Huazhong University of Science and Technology(华中科技大学信息科学与工程学院) School of Mechanical Science and Engineering, Huazhong University of Science and Technology(华中科技大学机械科学与工程学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Lehigh University(莱斯大学) College of AI, Tsinghua University(清华大学人工智能学院)

AI总结 本文提出EmbodiedClaw,通过对话实现具身AI开发流程的自动规划与执行,减少人工工程工作量,提升可执行性、一致性和可重复性。

Comments 13 pages, 7 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13016 2026-04-16 cs.LG cs.AI cs.CL

Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe

重新思考大型语言模型的在线策略蒸馏:现象、机制和配方

Yaxuan Li, Yuxin Zuo, Bingxiang He, Jinqian Zhang, Chaojun Xiao, Cheng Qian, Tianyu Yu, Huan-ang Gao, Wenkai Yang, Zhiyuan Liu, Ning Ding

机构 * Tsinghua University(清华大学) ShanghaiTech University(上海交通大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Renmin University of China(中国人民大学)

AI总结 本文系统研究了在线策略蒸馏的动态和机制,发现成功关键在于师生思维模式兼容及教师提供新能力,提出两种恢复失败蒸馏的策略,并指出密集奖励的表面优势背后存在代价。

Comments 30 pages, 23 figures. Code: https://github.com/thunlp/OPD

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01773 2026-04-16 cs.RO

IGen: Scalable Data Generation for Robot Learning from Open-World Images

IGen: 为机器人学习从开放世界图像中实现可扩展的数据生成

Chenghao Gu, Haolan Kang, Junchao Lin, Jinghe Wang, Duo Wu, Shuzhao Xie, Fanding Huang, Junchen Ge, Ziyang Gong, Letian Li, Hongying Zheng, Changwei Lv, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The University of Hong Kong(香港大学) Beijing University of Chemical Technology(北京化工大学) Shanghai Jiao Tong University(上海交通大学) Shenzhen University of Infomation Technology(深圳信息大学)

AI总结 本文提出IGen框架,通过开放世界图像生成高质量的视觉-运动数据,验证了其在机器人学习中的有效性。

Comments 8 pages, 8 figures; Accepted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07019 2026-04-16 cs.CL cs.AI cs.LG

Native Hybrid Attention for Efficient Sequence Modeling

原生混合注意力机制用于高效序列建模

Jusen Du, Jiaxi Hu, Tao Zhang, Weigao Sun, Yu Cheng

机构 * Tsinghua University(清华大学) Shanghai AI Laboratory(上海人工智能实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出原生混合注意力机制,结合线性与全注意力,通过滑动窗口和线性RNN实现长上下文保留与短上下文增强,提升效率与召回率。

Comments Accepted by ACL 2026, 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13133 2026-04-16 cs.LG

Automated co-design of high-performance thermodynamic cycles via graph-based hierarchical reinforcement learning

基于图的分层强化学习的高性能热力学循环自动协同设计

Wenqing Li, Xu Feng, Peixue Jiang, Yinhai Zhu

机构 * Key Laboratory for Thermal Science and Power Engineering of Ministry of Education, Beijing Key Laboratory of CO2 Utilization and Reduction Technology, Department of Energy and Power Engineering, Tsinghua University(教育部热科学与能源工程重点实验室,北京二氧化碳利用与减排技术重点实验室,清华大学能源与动力工程系) Shanxi Research Institute for Clear Energy Tsinghua University(清华大学清能研究院山西分院)

AI总结 本文提出基于图的分层强化学习方法,用于自动设计热力学循环结构参数,通过图表示、热物性代理和管理者-工人学习,实现高效自动编码、解码和协同优化,发现新型热泵和热机循环并提升性能。

Comments 21 pages,8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏