arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

University of Chinese Academy of Sciences(中国科学院大学)

共收录 1952
2506.08797 2026-07-27 cs.CV 版本更新

HunyuanVideo-HOMA: Generic Human-Object Interaction in Multimodal Driven Human Animation

混元视频-HOMA:多模态驱动人体动画中的通用人机交互

Ziyao Huang, Zixiang Zhou, Juan Cao, Yifeng Ma, Yi Chen, Zejing Rao, Zhiyong Xu, Hongmei Wang, Qin Lin, Yuan Zhou, Qinglin Lu, Fan Tang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Tencent Hunyuan(腾讯混元)

AI总结 针对人体-物体交互视频生成的局限,提出混元视频-HOMA弱条件多模态驱动框架,通过稀疏解耦运动引导等方法,将外观和运动信号编码融合,经优化训练,在弱监督下性能达先进水平,还具文本生成和物体操纵通用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20587 2026-07-24 stat.ML cs.LG 新提交

SPECTRA: State-Space Exogenous Context and Temporal-Frequency Resolution Architecture for Probabilistic Energy Forecasting

SPECTRA:用于概率能源预测的状态空间外部上下文和时频分辨率架构

Hang Ye, Xinyan Jiang, Yuedong Shi, Yangxin Zhu, Jianming Wei, Tian Zheng, Xiaoying Zheng, Yongxin Zhu

机构 * Shanghai Advanced Research Institute, Chinese Academy of Sciences(中国科学院上海先进研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Physical Science and Technology, Shanghaitech University(上海科技大学物理科学与技术学院) State Power Investment Corporation Limited(国家电力投资集团有限公司) China University of Petroleum(中国石油大学)

AI总结 针对现代电力系统概率能源预测问题,提出状态空间外部上下文和时频分辨率架构,通过自适应分离、对齐及建模等操作,实现预测。实验表明该方法在多种预测中表现出色,并支持确定性 - 随机分离为有效设计原则。

Comments 10 pages, 4 figures, 3 tables. Submitted to IEEE Transactions on Power Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21438 2026-07-24 cs.CV 新提交

DAPM: UAV Monocular Depth Estimation from Any Height, Pitch, Roll and FOV

DAPM:从任意高度、俯仰、横滚和视场角进行无人机单目深度估计

Tong Ling, Wenhui Diao, Yingchao Feng, Hanbo Bi, Zhongyan Hou, Xian Sun

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) University of Chinese Academy of Sciences(中国科学院大学) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室)

AI总结 研究针对无人机单目深度估计在多样视角和大尺度深度分布下的难题,提出DAPM模型,通过建立视角定量表示,引入IGD和PQB模块,在UAPD数据集上实验,该模型在深度和相机姿态估计方面达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21404 2026-07-24 cs.CL 新提交

MemTools: A Unified Research Framework for Interoperable Agent Memory

MemTools:用于可互操作智能体内存的统一研究框架

Chengfeng Zhao, Jinhui Chen, Sirui Liang, Shizhu He, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, CAS(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

AI总结 研究针对智能体内存架构碎片化问题,提出MemTools框架,通过解耦组件与环境、规范生命周期、分离数据集与协议、提供统一接口,实现跨系统组件集成等功能,为智能体内存研究提供实用可扩展基础设施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21027 2026-07-24 cs.CV 新提交

GroupVideo: Multi-Identity Customized Text-to-Video Generation

GroupVideo:多身份定制文本到视频生成

Xinyang Song, Libin Wang, Jianxin Sun, Qi Li, Dandan Zheng, JingDong Chen, Zhenan Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Ant Group(蚂蚁集团)

AI总结 研究多身份定制文本到视频生成问题,提出GroupVideo框架,融合多模态身份对齐及相关模块,构建高质量数据集,在生成多角色视频时能保持身份一致且动作自然,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20862 2026-07-24 cs.CL 新提交

CSPF: A Constrained Shared-Private Fusion Method for Non-Verifiable Preference Evaluation

CSPF:一种用于不可验证偏好评估的约束共享-私有融合方法

Hehao Zhang, Danli Wang, Xinyuan Wang, Xuange Gao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

AI总结 针对不可验证任务评估难问题,提出CSPF方法,将异构冻结奖励模型作互补评估器,在人类偏好监督下整合隐藏状态表示,经实验验证,该方法在主要指标上性能最佳,为不可验证偏好任务提供实用评估途径。

Comments 15 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20486 2026-07-24 cs.AI 新提交

OPTScientist: Multi-Agent Discovery of Typed Optimizer Programs for Transformer Pretraining

OPTScientist:用于Transformer预训练的类型化优化器程序的多智能体发现

Zhongzheng Li, Tiancan Feng, Wenhao Li, Qingsong Ran, Shikun Feng, Xiaoyuan Zhang, Yue Wang, Xiaoguang Zhao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村科学院)

AI总结 研究针对深度学习优化器设计难题,提出OPTScientist多智能体框架,在类型化DSL中结合进化搜索与第二阶段机制,发现RS-MR优化器改进Transformer预训练,为自动优化器科学提供新路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20434 2026-07-24 cs.CL cs.AI 新提交

Break Through the Compression Bottleneck: From Theory to Practice

突破压缩瓶颈:从理论到实践

Xiusheng Huang, Lu Wang, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

AI总结 研究语言模型压缩瓶颈问题,通过数学证明和实验验证低秩分解与量化非正交,组合会致性能降,进而提出对角粘合方法(DAM),可有效结合二者并减轻性能损失,为相关研究奠定基础。

Comments 18 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19747 2026-07-24 cs.CL 版本更新

Beyond Relevance-Centric Retrieval: Rubric-Oriented Document Set Selection and Ranking

超越以相关性为中心的检索:面向评分标准的文档集选择与排序

Kailin Jiang, Lei Liu, Jian Xi, Hui Xu, Junlin Liu, Baochen Fu, Bin Li, Vichwang, Yu Lu, Haibo Shi

机构 * University of Science and Technology of China(中国科学技术大学) Yuanbao Team, Tencent(腾讯元宝团队) University of Chinese Academy of Sciences(中国科学院大学) Shandong University(山东大学)

AI总结 研究针对大语言模型和人工智能代理对搜索结果质量需求,提出评估-诊断-优化框架。设计SetwiseEvalKit评估基准,评估多种重排器。在此基础上提出Rubric4Setwise方法,无需训练,能以更少文档和搜索轮次实现最佳下游生成性能,验证了闭环有效性。

Comments Project Page: https://rubric4setwise.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28241 2026-07-24 cs.CV

PointQ-Bench: Benchmarking Diagnostic and Interpretable Point Cloud Quality Assessment

PointQ-Bench:诊断性和可解释的点云质量评估基准

Duanchu Wang, Cheng Li, Junjie Yang, Jing Huang, Zihang Cheng, Zhi Gao, Bohong Zhu, Di Wang

机构 * Xi’an Jiaotong University(西安交通大学) Xidian University(西安电子科技大学) University of Chinese Academy of Sciences(中国科学院大学) Ningxia University(宁夏大学)

AI总结 提出PointQ-Bench基准,通过异常感知、缺陷诊断、可用性分级和开放式质量报告任务,将点云质量评估从标量评分扩展到全面质量理解,并揭示当前模型在感知与诊断之间的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05704 2026-07-24 cs.CR cs.AI 版本更新

SafeHarbor: Defining Precise Decision Boundaries via Hierarchical Memory-Augmented Guardrail for LLM Agent Safety

SafeHarbor:用于LLM智能体安全的分层记忆增强防护栏

Zhe Liu, Zonghao Ying, Wenxin Zhang, Quanchen Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang, Hao Peng

机构 * School of Cyber Science and Technology, Beihang University, Beijing, China(北京航空航天大学网络安全学院) Institute of Artificial Intelligence, Beihang University, Beijing, China(北京航空航天大学人工智能研究院) University of Chinese Academy of Sciences, Beijing, China(中国科学院大学) AI Security Lab, Beijing, China(360人工智能安全实验室)

AI总结 提出SafeHarbor框架,通过分层记忆系统和信息熵自进化机制,在保持高安全拒绝率的同时提升对良性请求的响应能力。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20174 2026-07-23 cs.CV cs.AI 新提交

StreamHOI: Interaction-aware Temporal Memory Adaptation for Streaming HOI Video Generation

StreamHOI:用于流式HOI视频生成的交互感知时间记忆适应

Zejing Rao, Haoxian Zhang, Xiaoqiang Liu, Yiping Meng, Guoxin Zhang, Pengfei Wan, Fan Tang, Tong-Yee Lee

机构 * Kling AI Research(克林人工智能研究院) University of Chinese Academy of Sciences(中国科学院大学) National Cheng Kung University(国立成功大学)

AI总结 针对现有HOI视频生成方法不适用于实时交互应用的问题,提出StreamHOI框架。通过分析Transformer块的历史记忆偏好,进行离线分析与偏差引导训练,并引入内存距离缩放模块,实现高效长时HOI视频生成,兼具多种优势且效率高。

Comments Code and models are available at https://github.com/KlingAIResearch/StreamHOI

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20116 2026-07-23 cs.CV 新提交

RIM: A Retrieval-In-Matching Framework for Cross-Domain Global Visual Localization of UAVs

RIM:无人机跨域全局视觉定位的检索匹配框架

Xin Li, Siyuan Duan, Shang Wang, Zhimin Mao, Bingliang Hu, Geng Zhang

机构 * University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究无人机跨域全局视觉定位问题,提出检索匹配框架RIM,通过采样参考视图、两阶段微调SALAD及冻结检索器蒸馏解码器等方法,在多数据集零样本评估中表现出色,建立了高效可部署的定位管道。

Comments 56 pages, 10 figures, and 18 tables. Supplementary material is included

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14047 2026-07-23 cs.RO cs.HC cs.SY eess.SY 版本更新

Zero2Skill: Bootstrapping Robot Skills through Autonomous Data Collection, Training, and Deployment

PhysClaw-0:一种通过语言修正实现机器人自主的共生智能体系统

Boyuan Wang, Zhenyuan Zhang, Zhiqin Yang, Peijun Gu, Shuya Wang, Xiaofeng Wang, Xianghui Ze, Yifan Chang, Guosheng Zhao, Jiangnan Shao, Guan Huang, Hengyu Liu, Yonggang Zhang, Wei Xue, Chunyuan Guan, Chenglin Pu, Yike Guo, Xingang Wang, Zheng Zhu

机构 * GigaAI(字节跳动人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) Hong Kong University of Science and Technology(香港科技大学) University of Leeds(利兹大学) Cornell University(康奈尔大学) Tsinghua University(清华大学) Nanjing University of Science and Technology(南京理工大学) The Chinese University of Hong Kong(香港中文大学) FAWTD(一汽技术开发部)

AI总结 研究针对自主数据收集问题,提出PhysClaw-0共生智能体系统,通过跨轮保留和重用修正、自主收集验证等方式,在真实机器人测试中减少人力时间,提高成功率,并提升验证者与人类一致性。

Comments WebPage: https://open-gigaai.github.io/Zero2Skill

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01051 2026-07-23 cs.LG 版本更新

SwiftRepertoire: Few-Shot Immune-Signature Synthesis via Dynamic Kernel Codes

SwiftRepertoire: 通过动态核码实现少样本免疫特征合成

Rong Fu, Yang Li, Yabin Jin, Jiekai Wu, Chunlei Meng, Youjin Wang

机构 * University of Macau(澳门大学) Peking University(北京大学) University of Chinese Academy of Sciences(中国科学院大学) The First People’s Hospital of Foshan(佛山第一人民医院) Juntendo University(立命馆大学) Shanghai AI Laboratory(上海人工智能实验室) Fudan University(复旦大学) Renmin University of China(中国人民大学) Minzu University of China(民族大学) Tsinghua University(清华大学) Capital Medical University(首都医科大学)

AI总结 本文提出SwiftRepertoire框架,通过动态核码实现少样本免疫特征合成,利用轻量任务描述符和原型字典生成紧凑任务特定参数化,实现快速适应新任务,提升临床和研究场景下的模型实用性与可解释性。

Comments 19 pages, 8 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19040 2026-07-22 cs.CV 新提交

Gaze-DETR: Top-Down Guidance Through Priority Maps for Infrared Weak-Small UAV Detection with DETR

Gaze-DETR:通过优先级地图进行自上而下的引导,用于基于DETR的红外弱小型无人机检测

Nian Liu, Yuxin Yang, Shubo Lin, Sikui Zhang, Liang Li, Boyu Cai, Yizheng Wang, Weiming Hu, Jin Gao

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) ShanghaiTech University(上海科技大学) Beijing Institute of Basic Medical Sciences(北京基础医学研究所)

AI总结 针对红外弱小型无人机检测难题,提出Gaze-DETR探测器,通过学习内部优先级地图,经优先级头预测、特征调制和锚点查询注入等步骤,并采用多种监督方案训练,实验证明其能提供预定位指导,补充边界框监督。

Comments Code: https://github.com/nliu-25/Gaze-DETR-Top-Down-Guidance-Through-Priority-Maps-for-Infrared-Weak-Small-UAV-Detection-with-DETR

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18508 2026-07-22 cs.CV 新提交

Style over Substance: A Shortcut Audit of Emotion-Description Preference Evaluation

形式高于内容:情感描述偏好评估的捷径审计

Jiabing Yang, Yixiang Chen, Yuan Xu, Qisen Ma, Tao Yu, Peiyan Li, Yingda Li, Yan Huang, Liang Wang

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 研究多模态情感理解中EmoPrefer评估指标,通过内容盲探针审计发现仅用描述长度和生成器标识的逻辑回归性能与复杂模型相当,揭示当前得分可不验证描述与视频达成,建议未来评估采用源平衡配对等方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03328 2026-07-22 cs.CV cs.IR 版本更新

Beyond Post-Quantization: Native Hash Learning with a Dedicated HASH Token

超越后量化:使用专用哈希令牌的原生哈希学习

Xinze Liu, Ding Wang, Dayan Wu, Hengjie Zhu, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, CAS(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Department of Applied Mathematics and Statistics, Johns Hopkins University(约翰霍普金斯大学应用数学与统计系)

AI总结 研究高效图像检索的紧凑表示问题,提出HashViT框架,通过专用哈希令牌及相关设计在Transformer内生成二进制表示,经统一目标优化,实验表明其性能优且保留汉明码效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14727 2026-07-22 cs.LG 版本更新

Geometric Capacity of Transformers: A Tropical Geometry Perspective

Transformer 的表达能力:从热带几何学视角出发

Ye Su, Yong Liu

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学) Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院)

AI总结 本文从热带几何学角度研究Transformer的几何表达能力,通过将自注意力建模为向量值热带有理映射,证明其在零温极限下精确生成幂 Voronoi 图,并推导出Transformer线性区域数量的紧渐进行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.10051 2026-07-22 cs.CV 版本更新

EAR-Net: Pursuing End-to-End Absolute Rotations from Multi-View Images

EAR-Net:从多视图图像中求解端到端绝对旋转

Yuzhen Liu, Qiulei Dong

机构 * State Key Laboratory of Multimodel Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Center for Excellence in Brain Science and Intelligence Technology, Chinese Academy of Sciences(脑科学与智能技术卓越创新中心,中国科学院)

AI总结 研究从多视图图像估计绝对旋转问题,提出EAR-Net方法,由极线置信图构建模块和置信感知旋转平均模块组成,能有效处理异常情况,实验表明该方法在准确性和速度上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17340 2026-07-21 cs.CV 新提交

Orthogonal Knowledge Refreshing for Domain-Incremental Object Detection

用于域增量目标检测的正交知识刷新

Aoting Zhang, Dongbao Yang, Chang Liu, Xiaopeng Hong, Can Ma, Yu Zhou

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) Nankai University(南开大学) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院) Tsinghua University(清华大学) Harbin Institute of Technology(哈尔滨工业大学)

AI总结 研究域增量目标检测问题,提出正交知识刷新(OKR)框架,通过构建特定域子空间、采用正交刷新策略和拓扑感知一致性,减少知识干扰和语义碎片化,实验表明该方法在mAP上比最佳无范例方法有显著提升。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03387 2026-07-21 cs.RO 版本更新

Feeling the Unexpected: ResTacVLA for Contact-Rich Manipulation via Residual Tactile Representation

感受意外:通过残差触觉表示实现用于丰富接触操作的ResTacVLA

Pengwei Zhang, Bin Xie, Xinpan Meng, Xinyu Guo, Ce Hao, Fang Deng, Long Cheng, Tiancai Wang

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Zhongguancun Academy(中关村科学城) Dexmal(德克斯马尔)

AI总结 为解决触觉感知融入视觉语言动作模型时的模态坍塌问题,提出ResTacVLA,将触觉数据转为残差触觉表示,过滤视觉可预测动态,经矢量量化瓶颈离散化,利用视觉先验不确定性自适应控制触觉整合。

Comments 8 pages, 6 figures, 3 tables. Accepted by IROS 2026, Project page: https://awilekong.github.io/ResTacVLA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28634 2026-07-21 cs.RO 版本更新

PrimitiveVLA: Learning Reusable Motion Primitives for Efficient and Generalizable Robotic Manipulation

PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作

Yutai Li, Shaohui Peng, Jiaming Guo, Di Huang, Zihao Zhang, Yuxuan Guo, Yunkai Gao, Siming Lan, Ling Li, Xing Hu, Yunji Chen

机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Cambricon Technologies(寒武科技) Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) University of Science and Technology of China(中国科学技术大学)

AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07008 2026-07-21 cs.CV cs.LG 版本更新

Where Not to Learn: Prior-Aligned Training with Subset-based Attribution Constraints for Reliable Decision-Making

不应学习的地方:基于子集归因约束的先验对齐训练以实现可靠的决策制定

Ruoyu Chen, Shangquan Sun, Xiaoqing Guo, Sanyi Zhang, Kangwei Liu, Shiming Liu, Zhangcheng Wang, Qunli Zhang, Wei Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) Communication University of China(中国传媒大学) Imperial College London(伦敦帝国学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院)

AI总结 本文提出了一种基于归因的先验对齐方法,通过子集选择归因技术约束模型依赖于人类先验区域,从而提升决策的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08556 2026-07-21 cs.SD 版本更新

Global Rotation Equivariant Phase Modeling for Speech Enhancement with Deep Magnitude-Phase Interaction

全局旋转等变相位建模用于语音增强的深度幅度-相位交互

Chengzhong Wang, Andong Li, Dingding Yao, Junfeng Li

机构 * Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所) Key Laboratory of Speech Acoustics and Content Understanding, Institute of Acoustics, Chinese Academy of Sciences(中国科学院声学研究所语音声学与内容理解重点实验室) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 本文提出一种全局旋转等变的幅度-相位双流框架,通过强制相位流保持全局旋转等变性,提升语音增强中的相位建模效果,实验显示在相位检索、去噪、去回声和带宽扩展任务中均优于现有方法。

Comments Accepted to IEEE Transactions on Audio, Speech and Language Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02522 2026-07-21 cs.CL cs.LG 版本更新

Implicit Actor Critic Coupling via a Supervised Learning Framework for RLVR

通过监督学习框架实现隐式Actor-Critic耦合的RLVR方法

Jiaming Li, Longze Chen, Ze Gong, Yukun Chen, Lu Wang, Wanwei He, Run Luo, Min Yang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) University of Chinese Academy of Sciences(中国科学院大学)

AI总结 PACS通过监督学习框架实现隐式Actor-Critic耦合,提升RLVR中奖励信号的稳定性与训练效率。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13420 2026-07-21 cs.CV 版本更新

VOPE: Revisiting Hallucination of Vision-Language Models in Voluntary Imagination Task

VOPE:重新审视视觉语言模型在自愿想象任务中的幻觉现象

Xingming Long, Jie Zhang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of AI Safety of CAS, Institute of Computing Technology, Chinese Academy of Sciences (CAS)(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学) Zhongguancun Academy(中关村学院)

AI总结 研究聚焦视觉语言模型在自愿想象任务中的幻觉问题,引入VOPE评估基准,通过构建数据集应用于主流模型和缓解方法,发现多数模型幻觉严重,现有缓解方法效果有限,为该领域未来研究指明重要方向。

Comments Accepted at ACM MM 2026 Dataset Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17356 2026-07-21 cs.AI cs.LG 版本更新

Comprehend, Divide, and Conquer: Feature Subspace Exploration via Multi-Agent Hierarchical Reinforcement Learning

理解、划分与征服:通过多智能体分层强化学习进行特征子空间探索

Weiliang Zhang, Xiaohan Huang, Yi Du, Ziyue Qiao, Qingqing Long, Zhen Meng, Yuanchun Zhou, Meng Xiao

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Great Bay University(Great Bay大学) Duke-NUS Medical School, National University of Singapore(新加坡国立大学杜克-奈素医学院)

AI总结 研究针对特征选择问题,提出HRLFS方法,先利用基于大语言模型的混合状态提取器捕捉特征特性并聚类,构建分层智能体,通过多智能体分层强化学习进行特征子空间探索,提升了下游机器学习性能并加速运行

Comments 25 pages, keywords: Automated Feature Engineering, Tabular Dataset, Multi-Agent Reinforcement Learning, Feature Selection, Accepted by ACM Transactions on Knowledge Discovery from Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.00930 2026-07-21 cs.AI cs.LG cs.LO 版本更新

SATQuest: A Verifier for Logical Reasoning Evaluation and Reinforcement Fine-Tuning of LLMs

SATQuest:用于大语言模型逻辑推理评估和强化微调的验证器

Yanxiao Zhao, Yaqian Li, Zihao Bo, Rinyoichi Takezoe, Haojia Hui, Mo Guang, Lei Ren, Xiaolin Qin, Kaiwen Long

机构 * Chengdu Institute of Computer Applications, Chinese Academy of Sciences(中国科学院成都计算机应用研究所) School of Computer Science and Technology, University of Chinese Academy of Sciences(中国科学院大学计算机科学与技术学院)

AI总结 研究旨在为大语言模型逻辑推理评估及强化微调提供工具。核心方法是SATQuest,它能从CNF实例生成推理任务并客观检查答案,从多维度评估。主要贡献是通过该工具发现模型逻辑推理差距,证明强化微调有效果但跨格式鲁棒性待提升,还提供了相关研究基础设施。

Comments 23 pages, 8 figures. ACL 2026 Main Conference long paper (oral presentation)

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pp. 2109-2131. Association for Computational Linguistics, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏