arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 共 2211 篇
2609.31620 2026-09-28 cs.CV 新提交

FuseReg: Regularizing Layer Fusion Mitigates the Reconstruction-Generation Gap in Representation Autoencoders

FuseReg:正则化层融合缓解表示自编码器中的重建-生成差距

Hongyang Du, Yunfei Xie, Junjie Ye, Jiawei Yang, Xiaoyan Cong, Haodong Zhang, Yongchao Huang, Haiyu Wu, Zongxia Li, Shihang Gui, Dawei Liu, Runhao Li, Jingcheng Ni, Chen Wei, Randall Balestriero, Yue Wang

机构 * USC PSI Lab(南加州大学PSI实验室) ; Brown University(布朗大学) ; Rice University(莱斯大学) ; University of Aberdeen(阿伯丁大学) ; University of Notre Dame(圣母大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; University of Pennsylvania(宾夕法尼亚大学)

AI总结 FuseReg通过随机子集训练正则化层融合,缓解表示自编码器的重建-生成差距,仅替换解码器即可降低27%的gFID,联合正则化可降低29%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31619 2026-09-28 cs.AI cs.CL cs.LG 新提交

Learning to Stop without Learning to Stop: Self-Supervised Confidence Training Improves Reasoning Efficiency

学习停止而不学习停止:自监督置信度训练提高推理效率

Parsa Hosseini, Akasha Tigalappanavara, Sumit Nawathe, Chenrui Fan, Sourya Basu, Genta Indra Winata, Anirban Das, Soheil Feizi, Nima Chitsazan

机构 * University of Maryland(马里兰大学) ; AI Foundations, Capital One(第一资本人工智能基础部)

AI总结 通过自监督置信度训练,仅用600个问题微调推理模型预测中间置信度,无需显式优化长度或早停,即可在匹配准确率下减少最多25%的生成token,效率提升媲美直接优化短推理的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31606 2026-09-28 cs.RO 新提交

Learning Robot Policies from Sparse Success Signals via STL-Guided Stein Variational Policy Gradient

通过STL引导的Stein变分策略梯度从稀疏成功信号中学习机器人策略

Hongrui Zheng, Cristian Ioan Vasile, Antonio Loquercio, Rahul Mangharam

机构 * University of Pennsylvania(宾夕法尼亚大学) ; Lehigh University(里海大学)

AI总结 提出STL-SVPG方法,利用平滑STL鲁棒性作为轨迹级目标,从稀疏成功信号中学习机器人策略,在六个基准中的五个上取得最高平均成功率,并实现仿真到现实的迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31603 2026-09-28 cs.LG cs.CL 新提交

User Model Extraction via Belief Self-Distillation

通过信念自蒸馏进行用户模型提取

Ali Holmov, Yiran Huang, Kirill Bykov, Zeynep Akata

机构 * Technical University of Munich(慕尼黑工业大学) ; Helmholtz Zentrum München(亥姆霍兹慕尼黑中心)

AI总结 本文提出信念自蒸馏(BSD)框架,从冻结LLM中提取可读且可因果写入的用户表征,实现比隐藏状态引导更强的干预,并发现跨模型共享的用户表征几何结构,对AI安全有重要启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31600 2026-09-28 cs.LG 新提交

New LoRA Skills Should Read but Never Write

新LoRA技能应只读而不写

Zeyan Li, Panqi Yang, Qirong Guo, Shengda Zhuo, SIyuan Qiu, Hu Xu, Chun Li, Jianfeng Xu

机构 * Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Jinan University(暨南大学)

AI总结 本文提出READ方法,通过规范分解和单向耦合解决LoRA适配器组合中的干扰问题,使新技能只读旧技能输入子空间,在多个基准上显著提升组合性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31595 2026-09-28 cs.CV 新提交

GraphWrit3R: End-to-End 3D Scene Graph Writing

GraphWrit3R:端到端三维场景图生成

Luka Milivojevic, Nikola Popovic, Sayan Deb Sarkar, Sebastian Koch, Iro Armeni, Luc Van Gool, Danda Pani Paudel

机构 * INSAIT, Sofia University “St. Kliment Ohridski”(索非亚大学圣克莱门特奥赫里德大学INSAIT研究所) ; Stanford University(斯坦福大学) ; Ulm University(乌尔姆大学)

AI总结 GraphWrit3R提出端到端三维场景图生成方法,输入点云或高斯泼溅,直接输出结构化JSON场景图,避免多阶段流水线、真实标注依赖和专有模型,在3DSSG基准上达到最先进性能。

Comments Project page at https://graphwrit3r.insait.ai

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31589 2026-09-28 cs.LG cs.NE 新提交

Common-Mode Collapse and Recovery in Direct Feedback Alignment

直接反馈对齐中的共模坍缩与恢复

Varun Reddy, Bernardo L. Sabatini, Houman Safaai

机构 * Kempner Institute for the Study of Natural and Artificial Intelligence at Harvard University(哈佛大学肯普纳自然与人工智能研究所) ; Howard Hughes Medical Institute(霍华德·休斯医学研究所) ; Harvard Medical School(哈佛医学院)

AI总结 本文揭示直接反馈对齐中误差共模导致tanh单元饱和坍缩,通过均值-协方差分解定位机制,提出校准读出和减去批次均值可抑制坍缩并加速学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31586 2026-09-28 cs.LG 新提交

Trust Guided Decision Transformer

信任引导的决策变换器

Chainesh Gautam, Raghuram Bharadwaj Diddigi, Chandramouli Kamanchi, Pankaj Dayama, Sumanta Mukherjee, Kameshwaran Sampath

机构 * International Institute of Information Technology Bangalore(国际信息技术学院班加罗尔) ; IBM Research Bangalore(IBM研究院班加罗尔)

AI总结 针对决策变换器在长程轨迹中因上下文漂移导致的性能下降,提出信任引导的决策变换器(TGDT),通过预测误差校准选择可信上下文,再用评论家选动作,在D4RL任务上提升回报并减少持续高误差。

Comments To appear in Neurips 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31577 2026-09-28 cs.RO 新提交

Generate, Track, Improve: Perceptive Multi-Skill Humanoid Locomotion with RL-Fine-Tuned Motion Generators

生成、跟踪、改进:基于强化学习微调运动生成器的感知型多技能人形机器人 locomotion

Zachary Olkin, William D. Compton, Aaron D. Ames

机构 * California Institute of Technology(加州理工学院)

AI总结 提出两层人形机器人运动架构,结合流匹配生成器与感知跟踪策略,通过离线强化学习微调提升地形穿越和技能选择性能。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31573 2026-09-28 cs.CV 新提交

How Far Can INRs Go? Cross-Domain Parameter-efficient INR-Based Semantic Segmentation for Brain MRI

INR能走多远?基于跨域参数高效的INR脑MRI语义分割

Ziyao Shang, Pouya Sadeghi, Letian Jiang, Alexander Wong, Sirisha Rambhatla

机构 * University of Waterloo(滑铁卢大学)

AI总结 本研究分析跨域脑MRI分割中INR的性能机制,发现其在低参数下优势显著,并提出层次化架构HierINRSeg,较MetaSeg在域内外Dice分别提升5.6和8.2个百分点。

Comments 26 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31572 2026-09-28 cs.CV cs.AI 新提交

OC-GS: Gaussian Splatting for Irregular Turntable Capture

OC-GS:面向不规则转台拍摄的高斯泼溅

Jae Joong Lee, Bedrich Benes

机构 * Purdue University(普渡大学)

AI总结 针对转台拍摄中旋转不均与丢帧导致等角假设失效的问题,提出OC-GS,通过轨道一致的细化联合优化图像几何与角度,在共享运动模型下提升稀疏不规则拍摄的重建质量,超越多个无姿态基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31571 2026-09-28 cs.CL 新提交

Strategically Diverse Sampling for Self-Training

策略性多样采样用于自训练

Alexander Gurung, Esmeralda S. Whitammer, Mirella Lapata

机构 * University of Edinburgh(爱丁堡大学)

AI总结 本文提出策略性多样采样(含GROOT和言语化采样)构建自训练数据,证明方法多样性比正确性或教师规模更重要,能提升困难任务性能并增强RL与测试时扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31568 2026-09-28 cs.AI 新提交

DeepEdu-v1: Efficient and Scalable Agentic LLMs for Vietnamese Education

DeepEdu-v1:面向越南教育的高效可扩展智能体大语言模型

Quang Nguyen, Hieu Nguyen, Hien Hoang, Toan Pham, Cong Tran, Nam Vu

机构 * Posts and Telecommunications Institute of Technology(邮政与电信技术学院)

AI总结 DeepEdu-v1提出基于SCALE框架的越南教育AI辅导系统,通过长上下文推理引擎和自改进智能体层,实现2倍TTFT加速并将智能体准确率从70.0%提升至79.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31564 2026-09-28 cs.LG 新提交

Weight Pair Encoding: Inducing a Smaller Grammar in Neural Network Weights

权重对编码:在神经网络权重中诱导更小的文法

Irene Tallini, Daniele Solombrino, Alberto Cazzaniga, Emanuele Rodolà

机构 * Area Science Park Trieste(的里雅斯特科技园) ; Sapienza University of Rome(罗马大学) ; Université Côte d’Azur(蔚蓝海岸大学) ; Inria(法国国家信息与自动化研究所) ; Paradigma

AI总结 本文提出权重对编码(WeightPE),通过直通估计器内嵌有损Re-Pair压缩器,将文法大小作为显式训练目标,在ViT模型上显著缩小文法规模,仅损失少量准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31560 2026-09-28 cs.LG 新提交

Generalization behavior of OPTQ and the role of regularization

OPTQ的泛化行为与正则化的作用

Erin George, Rayan Saab

机构 * University of California, San Diego(加州大学圣迭戈分校)

AI总结 本研究分析OPTQ量化算法的泛化误差,证明其与校准误差的关系及随机OPTQ的误差界,并基于正则化项λ提出新选择建议,实验验证其优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31559 2026-09-28 cs.LG eess.SP 新提交

Online Learning via Learned Latent Bayesian Tracking

基于学习潜变量贝叶斯跟踪的在线学习

Guy Gerson, Tomer Raviv, Nir Shlezinger, Tirza Routtenberg, Osvaldo Simeone

机构 * Ben-Gurion University(本-古里安大学) ; Northeastern University London(东北大学伦敦校区)

AI总结 针对非平稳环境下高维模型在线学习计算困难的问题,提出AURA元学习框架,通过学习低维潜状态空间模型并利用扩展卡尔曼滤波实现高效在线适应,在无线接收机和图像分类任务上显著提升适应速度与精度。

Comments Accepted at NeurIPS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31558 2026-09-28 cs.CV cs.CR 新提交

Region-Level Black-Box Defense Against Stealthy Embedding-Space Backdoors in CLIP

区域级黑盒防御:针对CLIP中隐蔽嵌入空间后门攻击

Ahmed Abdelnaby, Mohamed Elmahallawy

机构 * Washington State University(华盛顿州立大学)

AI总结 针对CLIP嵌入空间后门攻击,提出轻量级全黑盒防御CLIPGuard,通过分段扰动检测与语义修复净化恶意区域,实验将攻击成功率降至1.05%,保持准确率86.34%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31553 2026-09-28 cs.CL cs.CV 新提交

MexHat: A Dataset for Hate Speech Detection in Mexican Spanish Videos

MexHat:用于墨西哥西班牙语视频中仇恨言论检测的数据集

Itzel Tlelo-Coyotecatl, Hugo Jair Escalante

机构 * INAOE(国家天体物理、光学与电子学研究所) ; The University of Texas at El Paso(德克萨斯大学埃尔帕索分校)

AI总结 本文提出MexHat数据集,包含约1000个墨西哥西班牙语视频片段,用于仇恨言论检测,涵盖三分类及细粒度子类别标注,并报告基线结果以揭示任务挑战。

Comments Preprint submitted to CIARP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31546 2026-09-28 cs.LG 新提交

BeatGraph: Self-Supervised Heartbeat Graphs for Infant ECG Representations from the Home Environment

BeatGraph:家庭环境下婴儿心电表征的自监督心跳图

Mohammad Nur Hossain Khan, M. S. Krafczyk, Beverly G. Bolster, Nancy McElwain, Mark A. Hasegawa-Johnson, Bashima Islam

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 针对现有ECG基础模型忽略心脏结构、难以适应婴儿高心率的问题,提出BeatGraph,以心跳为基本单元构建图表示,通过自监督预训练和微调,在多项婴儿任务上显著提升性能,并发布首个公共婴儿ECG语料库。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31531 2026-09-28 cs.LG 新提交

HySTAR: Anchored Hypergraphs for Stable Credit Assignment in Cooperative Multi-Agent Reinforcement Learning

HySTAR: 用于协作多智能体强化学习中稳定信用分配的锚定超图

Xinglong Luo, Yuding Zhang, Yuheng Kuang, Shuxuan Yuan, Zhenni Zeng, Weiqiang Zhu, Zhenhai Ji, Zhengning Wang

机构 * University of Electronic Science and Technology of China(电子科技大学)

AI总结 HySTAR通过锚定重叠稀疏超图作为稳定分解基础,结合时空编码器,在部分可观测协作多智能体强化学习中解决结构目标漂移,提升信用分配性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31525 2026-09-28 cs.SD eess.AS 新提交

TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment

TinyAudio:面向低资源部署的紧凑高效文本到音频生成

Junxi Liu, Xiquan Li, Wenhao Guan, Yifan Duan, Zhikang Niu, Yanru Huo, Ziyang Ma, Xie Chen

机构 * X-LANCE Lab, Shanghai Jiao Tong University(上海交通大学X-LANCE实验室) ; Shanghai Innovation Institute(上海创新研究院) ; SJTU Paris Elite Institute of Technology, Shanghai Jiao Tong University(上海交通大学巴黎卓越工程师学院) ; Nanyang Technological University(南洋理工大学)

AI总结 本文提出TinyAudio,一种仅87M参数的紧凑流匹配文本到音频模型,通过TA-DiT、TA-CLAP和TA-VAE实现低资源部署,在AudioCaps和TTA-Bench上达到竞争性质量,并支持CPU实时生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31524 2026-09-28 cs.CV 新提交

Structured Reasoning Agentic Framework for Interpretable Critical View of Safety Assessment

结构化推理智能体框架用于可解释的安全关键视图评估

Qing Xu, Yuxiang Luo, Zhen Chen

机构 * University of Nottingham(诺丁汉大学) ; The Hong Kong Polytechnic University(香港理工大学)

AI总结 提出ReasonCVS,一种基于视觉语言模型的结构化推理智能体框架,通过解剖场景图抽象和理性感知推理分解CVS评估,在Endoscapes-CVS201上以68.1% mAP实现可解释的细粒度手术安全评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31514 2026-09-28 cs.CV 新提交

Forensic Twins: Self-Supervised Residual Learning for AI-Generated Image Forensics

法医双胞胎:面向AI生成图像取证的自我监督残差学习

Javier Muñoz-Haro, Ruben Tolosana, Ruben Vera-Rodriguez, Aythami Morales, Julian Fierrez

机构 * Universidad Autónoma de Madrid(马德里自治大学)

AI总结 本文提出法医双胞胎框架,利用自我监督残差学习在真实图像上训练,通过抑制宏观内容提取采集指纹,实现零样本AI生成图像检测与源归因,分别达到97.99% AUC和56.61%准确率。

Comments 9 pages + Supp. Material. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31509 2026-09-28 cs.CV cs.AI 新提交

ClearGS: Reliability-Aware Gaussian Splatting from Handheld Videos

ClearGS:基于手持视频的可靠性感知高斯泼溅

Xuanzhi Liu, Xinyi Wu, Hang Pan, Wensi Huang, Zhenyao Wu, Ruize Han, Song Wang

机构 * Shenzhen University of Advanced Technology(深圳理工大学) ; HONOR(荣耀) ; University of New South Wales(新南威尔士大学) ; Southern University of Science and Technology(南方科技大学)

AI总结 ClearGS提出可靠性感知视图分配与渲染引导的视频内恢复,解决手持视频中3DGS的视点不均和帧质量混合问题,在GS2E和GSOTM上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31507 2026-09-28 cs.CV cs.RO 新提交

SatNav: A Scalable Benchmark for Long-Horizon UAV Vision-Language Navigation from Satellite Imagery

SatNav:基于卫星影像的长时程无人机视觉-语言导航可扩展基准

Jiajun Jiang, Chunliang Hua, Zichun Chen, Yanxing Wu, Zeyuan Yang, Jie Song, Xiao Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; The Hong Kong University of Science and Technology(香港科技大学)

AI总结 SatNav利用卫星影像构建可扩展的长时程无人机视觉-语言导航基准,包含118K场景和三个任务族,并通过SwiftVLN框架及迁移实验验证了城市级导航的挑战性与实用性。

Comments Accepted at NeurIPS 2026, Track on Evaluations and Datasets. 32 pages, 16 figures. Project page: https://eku127.github.io/SatNav/

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31506 2026-09-28 cs.CL cs.AI 新提交

Evaluating Cultural Awareness of LLMs for Haitian Creole

评估大语言模型对海地克里奥尔语的文化意识

Christelle Clervilsson, Yanzhu Guo

机构 * Telecom Paris, Institut Polytechnique de Paris(巴黎电信学院,巴黎综合理工学院)

AI总结 本研究首次系统评估大语言模型在海地克里奥尔语中的文化意识,发现其与法语存在明显差距,且故事生成中即使正面刻画也常编码刻板印象,代码和基准已公开。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31505 2026-09-28 cs.AI 新提交

Prompt Minimization: Reducing Input Redundancy Without Sacrificing Output Fidelity

提示最小化:在不牺牲输出保真度的前提下减少输入冗余

Marius F. R. Juston, Kevin A. Karim, Jonathan Gao, Kevin C. Li, Rudhi Bashambu

机构 * UIUC University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; KTH Royal Institute of Technology(瑞典皇家理工学院)

AI总结 针对提示设计缺乏系统性的问题,提出提示最小化方法,在保持输出保真度下缩减提示长度,减少计算开销并提升推理性能,为高效提示工程开辟新方向。

Comments 14 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31491 2026-09-28 cs.AI 新提交

UQ-LOB: Uncertainty-Aware Limit Order Book Mid-Price Forecasting

UQ-LOB:不确定性感知的限价订单簿中间价预测

Derrick Gilchrist Edward Manoharan, Eljas Linna, Kestutis Baltakys, Hao Dong, Juho Kanniainen

机构 * Data Science Research Centre(数据科学研究中心) ; Tampere University(坦佩雷大学)

AI总结 本文提出UQ-LOB,一种轻量级、编码器无关的不确定性量化模块,用于限价订单簿中间价预测,通过上下文集和校准分布提供置信度,并在52亿LOB事件上显著提升选择性预测的F1分数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31482 2026-09-28 cs.AI 新提交

"AI is (not) the new...": A Diagnostic Analogy Framework for Generative AI's Cultural Impacts

“AI是(不是)新的……”:生成式AI文化影响的诊断性类比框架

Rida Qadri, Vinodkumar Prabhakaran, Remi Denton

机构 * Google Research(谷歌研究院)

AI总结 本文提出一个诊断性框架,通过认识论场所、管理逻辑和技术机制三个坐标,分析生成式AI对认知与文化实践的结构性影响,并揭示信息发现与知识综合中的治理杠杆。

详情

展开后加载摘要…

URL PDF HTML 收藏
2609.31466 2026-09-28 cs.LG 新提交

Scaffold: Support Graph Theory Based Sparsification for Graph Neural Networks

Scaffold:基于支撑图理论的图神经网络稀疏化方法

Siddhartha Shankar Das, Sai Karthik Navuluru, S M Ferdous, Ryan A. Rossi, Baris Coskunuzer, Lakshman Tamil, Edoardo Serra, Alex Pothen, Robert Rallo, Mahantesh M Halappanavar

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室) ; University of Texas at Dallas(德克萨斯大学达拉斯分校) ; University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) ; Adobe(Adobe公司) ; Boise State University(博伊西州立大学) ; Purdue University(普渡大学)

AI总结 针对图神经网络计算成本高的问题,提出基于支撑图理论的稀疏化框架Scaffold,通过联合控制扩张与拥塞保留关键通信结构,在19个基准上以10%-50%的边实现全图性能,并降低内存与训练时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
↑