arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

The Hong Kong University of Science and Technology(香港科技大学)

共收录 2796
2510.12635 2026-05-08 cs.AI

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

记忆作为行动:面向长周期智能任务的自主上下文编纂

Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

机构 * School of Computer Science and Technology, Beijing Jiaotong University(北京交通大学计算机科学与技术学院) Hithink Research(慧思科技) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Huawei Noah’s Ark Lab(华为诺亚实验室) Peng Cheng Lab(鹏城实验室)

AI总结 本文提出MemAct框架,将工作记忆管理作为可学习的策略动作,通过端到端强化学习优化信息保留与任务表现,实验显示其在保持准确性的同时显著减少上下文长度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05850 2026-05-08 cs.CV

Align3D-AD: Cross-Modal Feature Alignment and Dual-Prompt Learning for Zero-shot 3D Anomaly Detection

Align3D-AD:跨模态特征对齐与双提示学习用于零样本3D异常检测

Letian Bai, Xuanming Cao, Juan Du, Chengyu Tao

机构 * Smart Manufacturing Thrust, The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)智能制造方向) The Hong Kong University of Science and Technology(香港科技大学) College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院)

AI总结 本文提出Align3D-AD框架,通过跨模态特征对齐和双提示学习解决零样本3D异常检测中的领域差距问题,实验表明其在多个数据集上均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05838 2026-05-08 cs.LG cs.NE

MDN: Parallelizing Stepwise Momentum for Delta Linear Attention

MDN:并行化步进动量用于Delta线性注意力

Yulong Huang, Xiang Liu, Hongxiang Huang, Xiaopeng Lin, Zunchang Liu, Xiaowen Chu, Zeke Xie, Bojun Cheng

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))

AI总结 本文提出MDN模型,通过几何重排更新系数开发了分块并行算法,利用动量规则提升线性注意力的训练效率与效果,实验表明其在多个基准测试中优于基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05833 2026-05-08 cs.AI

On the Role of Language Representations in Auto-Bidding: Findings and Implications

语言表示在自动出价中的作用:发现与启示

Guanyu Zhu, Jining Luan, Hanwen Du, Xinyu Fang, Sibo Xu, Ersheng Ni, Hongji Li, Jincheng Fang, Ronghao Chen, Huacan Wang, Xuanqi Lan, Yongxin Ni, Yiqi Sun, Youhua Li

机构 * City University of Hong Kong(香港城市大学) South China Agricultural University(华南农业大学) University of Electronic Science and Technology of China(电子科技大学) The Ohio State University, Columbus(俄亥俄州立大学) Hefei University of Technology(合肥工业大学) School of Economics and Management, Wuhan University(武汉大学经济管理学院) Faculty of Engineering, The University of Queensland(昆士兰大学工程学院) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) The Hong Kong University of Science and Technology(香港科学大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) Santa Clara University(圣克拉拉大学) Boston University(波士顿大学) The University of Hong Kong(香港大学)

AI总结 本文研究语言表示在自动出价中的作用,提出SemBid框架,通过整合语义与数值信息提升出价可控性和泛化能力,实验表明其在多种场景下优于现有方法。

Comments 19 page

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05789 2026-05-08 cs.CR cs.CV

Stego Battlefield: Evaluating Image Steganography Attacks and Steganalysis Defenses

隐写战场:评估图像隐写术攻击与隐写分析防御

Zhen Sun, Zongmin Zhang, Leyi Sheng, Yule Liu, Yifan Liao, Ke Li, Xinhu Zheng, Jiaheng Wei, Wenyuan Yang, Xinlei He

机构 * Wuhan University(武汉大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Sun Yat-sen University(中山大学)

AI总结 本文提出SADBench基准,系统评估隐写攻击能力和隐写分析防御能力,揭示攻击稳定性、检测成本及转移性差异,揭示现实威胁在社交媒体中持续存在。

Comments 23 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26799 2026-05-08 cs.CV cs.GR cs.MM

MesonGS++: Post-training Compression of 3D Gaussian Splatting with Hyperparameter Searching

MesonGS++: 3D高斯散射的后训练压缩与超参数搜索

Shuzhao Xie, Junchen Ge, Weixiang Zhang, Jiahang Liu, Chen Tang, Yunpeng Bai, Shijia Ge, Jingyan Jiang, Yuzhi Huang, Fengnian Yang, Cong Zhang, Xiaoyi Fan, Zhi Wang

机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Hong Kong University of Science and Technology(香港科技大学) Harbin Institute of Technology(哈尔滨工业大学) The Chinese University of Hong Kong(香港中文大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Shenzhen Technology University(深圳技术大学) Xiamen University(厦门大学) Simon Fraser University(西蒙弗雷泽大学) Jiangxing Intelligence Inc.(江兴智能有限公司)

AI总结 MesonGS++提出了一种基于超参数搜索的3D高斯散射后训练压缩方法,通过联合重要性剪枝、八叉树几何编码等技术,实现34倍压缩并保持渲染质量,优于现有方法并精准满足目标存储预算。

Comments https://github.com/mmlab-sigs/mesongs_plus

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22812 2026-05-08 cs.CV

LC4-DViT: Land-cover Creation for Land-cover Classification with Deformable Vision Transformer

LC4-DViT:基于变形视觉Transformer的土地覆盖创建用于土地覆盖分类

Kai Wang, Siyi Chen, Weicong Pang, Chenchen Zhang, Renjun Gao, Ziru Chen, Cheng Li, Dasa Gu, Rui Huang, Alexis Kai Hon Lau

机构 * HKUST(香港科技大学) SSE, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)电子工程系) JHU(约翰·霍普金斯大学) NUS(新加坡国立大学) MUST(慕斯大学)

AI总结 本文提出LC4-DViT框架,结合生成数据创建与变形感知视觉Transformer,提升高分辨率土地覆盖制图精度,优于基线模型和传统网络。

Comments This work has been submitted to the IEEE for possible publication.The project is available at https://github.com/weicongpang/LVC2-DViT.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21471 2026-05-08 cs.AI

SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition

SpatialBench: 多模态大语言模型空间认知的基准测试

Peiran Xu, Sudong Wang, Yao Zhu, Jianing Li, Gege Qi, Yunjian Zhang

机构 * Sun Yat-Sen University(中山大学) HKUST (GZ)(香港科技大学) Zhejiang University(浙江大学) Peking University(北京大学) CAICT(中国科学院电子技术研究所) UCAS(中国科学技术大学) CUC(中国科学技术大学)

AI总结 本文提出SpatialBench基准,通过五级空间认知框架评估多模态大语言模型的空间能力,揭示模型在感知与符号推理间的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01468 2026-05-05 cs.CV cs.AI

Decision Boundary-aware Generation for Long-tailed Learning

面向长尾学习的决策边界感知生成

Jiacheng Yang, Ruichi Zhang, Chikai Shang, Mengke Li, Xinyi Shang, Junlong Gao, Yonggang Zhang, Yang Lu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China(中国教育部多媒体可信感知与高效计算重点实验室) Xiamen University(厦门大学) College of Computer Science and Software Engineering(计算机科学与软件工程学院) Shenzhen University(深圳大学) Department of Statistical Science(统计科学系) University College London(伦敦大学学院) Division of Arts and Machine Creativity(艺术与机器创造力 division) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出DBG框架,通过生成边界附近样本提升表示学习,缓解长尾数据分布不均问题,提升尾类和整体准确率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01427 2026-05-05 cs.RO

SixthSense: Task-Agnostic Proprioception-Only Whole-Body Wrench Estimation for Humanoids

SixthSense:面向人类oid的无任务依赖的本体感知-only全身 wrench 估计

Xingzhou Chen, Xiayan Xu, Yan Ning, Jiyu Yu, Yizheng Zhang, Siyi Qian, Lingzhu Xiang, Jiahao Chen, Yuquan Wang, Haodong Zhang, Ling Shi

机构 * The Hong Kong University of Science and Technology(香港理工大学) Zhejiang University(浙江大学) Tencent Robotics X(腾讯机器人实验室)

AI总结 本文提出SixthSense,一种基于本体感知和IMU数据的无任务依赖方法,用于估计人类oid的全身接触时间和位置及外部wrench,解决浮动物理动力学和不确定接触位置的难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01357 2026-05-05 cs.CL

On Stable Long-Form Generation: Benchmarking and Mitigating Length Volatility

关于稳定长形式生成:基准测试与缓解长度波动

Zhitao He, Haolin Yang, Rui Min, Zeyu Qin, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港理工大学)

AI总结 本文提出VOLTBench基准测试,通过分析注意力轨迹发现长形式生成中的波动原因,并提出GLoBo方法提升生成稳定性与准确性,实验验证了主流模型的长形式输出不稳定问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01293 2026-05-05 cs.AI

Lifting Traces to Logic: Programmatic Skill Induction with Neuro-Symbolic Learning for Long-Horizon Agentic Tasks

将轨迹提升到逻辑:基于神经符号学习的程序化技能诱导用于长视界代理任务

Jie-Jing Shao, Haiyan Yin, Yueming Lyu, Xingrui Yu, Lan-Zhe Guo, Ivor Tsang, James Kwok, Yu-Feng Li

机构 * State Key Laboratory of Novel Software Technology, Nanjing University, China(新型软件技术国家重点实验室,南京大学) School of Artificial Intelligence, Nanjing University, China(人工智能学院,南京大学) School of Intelligence Science and Technology, Nanjing University, China(智能科学与技术学院,南京大学) Centre for Frontier AI Research(前沿人工智能研究中心) Institute of High Performance Computing, Agency for Science, Technology and Research, Singapore(高性能计算研究所,新加坡科技研究局) Department of Computer Science and Engineering, Hong Kong University of Science and Technology, China(香港科学与技术大学计算机科学与工程系)

AI总结 本文提出NSI框架,通过将交互轨迹提升为模块化逻辑 grounded 程序,使代理能从少量示例中归纳技能并适应新目标,优于现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01255 2026-05-05 cs.LG

Activation Compression in LLMs: Theoretical Analysis and Efficient Algorithm

LLMs中的激活压缩:理论分析与高效算法

Wen-Da Wei, Han-Bin Fang, Yang-Di Liu, Jiang-Xin Shi, James Kwok, Yu-Feng Li

机构 * Nanjing University(南京大学) Tsinghua University(清华大学) Huazhong University of Science and Technology(华中科技大学) Hong Kong University of Science and Technology(香港科学大学)

AI总结 本文提出一种激活-梯度联合压缩方法,通过低秩因子压缩线性层梯度,无需额外计算,提升LLM训练效率与压缩性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01250 2026-05-05 cs.AI

EO-Gym: A Multimodal, Interactive Environment for Earth Observation Agents

EO-Gym: 一种多模态、交互式环境用于地球观测代理

Sai Ma, Zhuang Li, Sichao Li, Xinyue Xu, Ruibiao Zhu, Tony Boston, John A. Taylor

机构 * The Australian National University(澳大利亚国立大学) Royal Melbourne Institute of Technology(皇家墨尔本理工学院) University of Sydney(悉尼大学) The Hong Kong University of Science and Technology(香港科学与技术大学)

AI总结 EO-Gym通过构建多模态交互环境,解决地球观测分析中不确定性处理问题,提供9078条轨迹和34604步的基准数据,评估10种VLMs显示通用模型在时空和跨模态任务上表现不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00974 2026-05-05 cs.CR cs.CL

SRTJ: Self-Evolving Rule-Driven Training-Free LLM Jailbreaking

SRTJ:自演化规则驱动的无训练LLM jailbreaking

Jindong Li, Ying Liu, Yali Fu, Jinjing Zhu, Leyao Wang, Menglin Yang, Rex Ying

机构 * HKUST (GZ)(香港科技大学(广州)) Jilin University(吉林大学) Yale University(耶鲁大学)

AI总结 SRTJ通过交互反馈系统发现、组合和优化攻击策略,无需更新模型参数,有效平衡探索与利用,提升攻击鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04106 2026-05-05 cs.AI

InsTraj: Instructing Diffusion Models with Travel Intentions to Generate Real-world Trajectories

InsTraj: 通过旅行意图指导扩散模型生成真实世界轨迹

Yuanshao Zhu, Yuxuan Liang, Xiangyu Zhao, Liang Han, Xinwei Fang, Xun Zhou, Xuetao Wei, James Jianqiao Yu

机构 * Southern University of Science and Technology(南方科技大学) City University of Hong Kong(香港城市大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科学理工大学(广州)) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) University of York(约克大学)

AI总结 InsTraj通过自然语言描述指导扩散模型生成真实、多样且符合指令的轨迹,解决传统方法在理解和生成复杂用户意图及约束条件上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00815 2026-05-05 cs.AI

Resource-Efficient Reinforcement for Reasoning Large Language Models via Dynamic One-Shot Policy Refinement

通过动态单次策略细化实现大规模语言模型推理的资源高效强化学习

Yunjian Zhang, Sudong Wang, Yang Li, Peiran Xu, Conghao Zhou, Xiaoyue Ma, Jianing Li, Yao Zhu

机构 * UCAS(中国科学院大学) HKUST(GZ)(香港科技大学(广州)) Tsinghua University(清华大学) Sun Yat-Sen University(中山大学) Xidian University(西安电子科技大学) George Mason University(乔治·梅森大学) Peking University(北京大学) Zhejiang University(浙江大学)

AI总结 本文提出动态单次策略细化方法,通过减少训练样本数量和计算开销,提升大规模语言模型推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05534 2026-05-05 cs.LG cs.AI

A Unified Theory of Sparse Dictionary Learning in Mechanistic Interpretability: Piecewise Biconvexity and Spurious Minima

稀疏字典学习在机制可解释性中的统一理论:分段双凸性与虚假极值

Yiming Tang, Harshvardhan Saini, Zhaoqian Yao, Zheng Lin, Yizhen Liao, Jingyi Cui, Yisen Wang, Mengnan Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Indian Institute of Technology, Dhanbad(印度德里理工学院) Chinese University of Hong Kong(香港中文大学) Hong Kong University of Science and Technology(香港科学与技术大学) Peking University(北京大学)

AI总结 本文提出稀疏字典学习的统一理论,揭示其分段双凸性及虚假极值问题,通过线性表示基准揭示路径学,提出特征锚定技术提升特征恢复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00529 2026-05-04 cs.LG cs.AI cs.IR

Hierarchical Abstract Tree for Cross-Document Retrieval-Augmented Generation

分层抽象树用于跨文档检索增强生成

Ziwen Zhao, Menglin Yang

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

AI总结 本文提出Ψ-RAG框架,通过迭代'合并与坍缩'过程构建分层抽象树索引,并引入多粒度检索代理,解决传统树状RAG在跨文档多跳问题中的分布适应性、结构隔离和抽象粗粒度等挑战,实验表明其在跨文档多跳问答任务中表现更优。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00517 2026-05-04 cs.CV

PhysiGen: Integrating Collision-Aware Physical Constraints for High-Fidelity Human-Human Interaction Generation

PhysiGen:整合碰撞感知的物理约束以生成高保真的人-人交互

Nan Lei, Yuan-Ming Li, Ling-An Zeng, Liang Xu, Zhi-Wei Xia, Hui-Wen Huang, Fa-Ting Hong, Wei-Shi Zheng

机构 * Sun Yat-sen University(中山大学) The Hong Kong University of Science and Technology(香港科学与技术大学) Shanghai Jiao Tong University(上海交通大学) Guilin University of Electronic Technology(桂林电子科技大学)

AI总结 本文提出PhysiGen方法,通过简化人体网格和优化碰撞区域,提升多人体交互生成的现实感和物理合理性。

Comments 15 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00501 2026-05-04 cs.LG

LambdaRankIC: Directly Optimizing Rank IC for Financial Prediction

LambdaRankIC:直接优化金融预测中的排名IC

Yan Lin, Yihong Su, Yi Yang

机构 * University of Macau(澳门大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出LambdaRankIC,直接优化Rank IC,通过推导lambda梯度闭式表达式解决排名操作非可导问题,实验证明其在金融预测中优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00052 2026-05-04 cs.CV

Two-View Accumulation as the Primary Training Lever for Hybrid-Capture Gaussian Splatting: A Variance-Decomposition View of When Gradient Surgery Helps

双视图累积作为混合捕捉高斯点划法的主要训练杠杆:一种方差分解视角下的当梯度手术帮助时的情形

Sungjun Cho

机构 * The Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出通过双视图累积提升混合捕捉高斯点划法性能,分析方差分解机制,验证结构化与随机配对在方差上的等效性,展示其在不同场景下的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28139 2026-05-04 cs.SE cs.AI

Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows

Claw-Eval-Live: 一个用于评估进化现实工作流的活体代理基准

Chenxin Li, Zhengyang Tang, Mingxin Huang, Yunlong Lin, Shijue Huang, Shengyuan Liu, Bowen Ye, Rang Li, Lei Li, Benyou Wang, Yixuan Yuan

机构 * The Chinese University of Hong Kong(香港中文大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) South China University of Technology(华南理工大学) Xiamen University(厦门大学) Peking University(北京大学) The Hong Kong University of Science and Technology(香港科学与技术大学) The University of Hong Kong(香港大学)

AI总结 本文提出Claw-Eval-Live活体基准,通过分离可刷新信号层和可复现的发布快照,评估代理在动态工作流需求下的表现,发现可靠工作流自动化仍待解决,领先模型仅完成66.7%的任务。

Comments Project page: https://claw-eval-live.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26173 2026-05-04 cs.LG cs.AI cs.CL

Entropy Centroids as Intrinsic Rewards for Test-Time Scaling

熵中心作为测试时缩放的内在奖励

Wenshuo Zhao, Qi Zhu, Xingshan Zeng, Fei Mi, Lifeng Shang, Yi R., Fung

机构 * HKUST(香港科技大学) ZJU(浙江大学) Huawei(华为)

AI总结 本文提出熵中心作为测试时缩放的内在奖励,通过分析不确定性的时间结构提升模型响应质量,在不同规模模型上均优于现有基线。

Comments Under Review, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16243 2026-05-04 cs.CV

Find, Fix, Reason: Context Repair for Video Reasoning

寻找、修复、推理:视频推理中的上下文修复

Haojian Huang, Chuanyu Qin, Yinchuan Li, Yingcong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)

AI总结 本文提出了一种上下文修复方法,通过冻结的教师模型提供最小证据补丁,帮助学生模型在保持问题不变的情况下快速定位目标区域,提升视频推理的准确性和泛化能力。

Comments 22 pages, 7 figures, 17 tables. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20948 2026-05-04 cs.AI

Controllable Logical Hypothesis Generation for Abductive Reasoning in Knowledge Graphs

用于知识图谱中演绎推理的可控逻辑假设生成

Yisen Gao, Jiaxin Bai, Tianshi Zheng, Qingyun Sun, Ziwei Zhang, Xingcheng Fu, Jianxin Li, Yangqiu Song

机构 * Department of Computer Science and Engineering(计算机科学与工程系) The Hong Kong University of Science and Technology(香港理工大学) Beihang University(北航) Key Lab of Education Blockchain and Intelligent Technology(教育区块链与智能技术重点实验室) Guangxi Normal University(广西师范大学)

AI总结 本文提出CtrlHGen框架,通过监督学习和强化学习解决知识图谱中假设生成的可控性问题,提升假设生成的准确性和实用性。

Comments Accepted by ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28138 2026-05-01 cs.OS cs.AI

Crab: A Semantics-Aware Checkpoint/Restore Runtime for Agent Sandboxes

Crab:一种语义感知的检查点/恢复运行时用于智能体沙盒

Tianyuan Wu, Chaokun Chang, Lunxi Cao, Wei Gao, Wei Wang

机构 * HKUST(香港科技大学)

AI总结 Crab通过桥接智能体与操作系统间的语义鸿沟,提升检查点恢复的准确性,减少检查点流量,提高执行效率。

Comments 15 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28115 2026-05-01 cs.RO cs.CV

FreeOcc: Training-Free Embodied Open-Vocabulary Occupancy Prediction

FreeOcc: 无需训练的具身开放词汇占用预测

Zeyu Jiang, Changqing Zhou, Xingxing Zuo, Changhao Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) MBZUAI

AI总结 FreeOcc通过四层流程实现无需3D标注的开放词汇占用预测,相比传统方法在EmbodiedOcc-ScanNet上提升IoU和mIoU超过2倍,并引入ReplicaOcc基准测试新环境性能。

Comments RSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.28078 2026-05-01 cs.CV

AesRM: Improving Video Aesthetics with Expert-Level Feedback

AesRM:通过专家级反馈提升视频美学

Yujin Han, Yujie Wei, Yefei He, Xinyu Liu, Tianle Li, Zichao Yu, Andi Han, Shiwei Zhang, Tingyu Weng, Difan Zou

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科学与技术大学) University of Sydney(悉尼大学) Alibaba Group(阿里巴巴集团)

AI总结 本文提出AesRM框架,通过分解视频美学为视觉美学、视觉保真度和视觉合理性三个维度,构建了专家标注的AesVideo-Bench基准,并开发了AesRM-Base和AesRM-CoT模型,提升了视频美学评估的准确性和可解释性。

Comments 37 pages, 14 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27955 2026-05-01 cs.AI cs.CV

GUI Agents with Reinforcement Learning: Toward Digital Inhabitants

具有强化学习的图形用户界面代理:迈向数字居民

Junan Hu, Jian Liu, Jingxiang Lai, Jiarui Hu, Yiwei Sheng, Shuang Chen, Jian Li, Dazhao Du, Song Guo

机构 * Shandong University(山东大学) The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University(香港大学) Shanghai Jiao Tong University(上海交通大学) Tencent(腾讯)

AI总结 本文探讨了强化学习与GUI代理的结合,提出分类体系及趋势分析,旨在指导下一代鲁棒GUI自动化及基础设施发展。

Comments Project Page: https://github.com/Steve2457/Awesome-RL-GUI-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏