arXivDaily arXiv每日学术速递 周一至周五更新
全部学科分类 1825
2608.28578 2026-08-31 cs.RO cs.AI cs.LG 新提交

Aero Hand Open: A Simulation-Ready Tendon-Driven Hand for Dexterous Manipulation Learning

Aero Hand Open:一种适用于灵巧操作学习的可仿真肌腱驱动手

Nan Wang, Mohit Yadav, Jonathan Wulff, Aidan Rosenbaum, Kezhou Chen, Yuvan Sharma, Xu Dong, Yiwei Tao

机构 * Chestnut Robotics(栗智机器人) California Institute of Technology(加州理工学院)

AI总结 本文提出Aero Hand Open这款仿真就绪的肌腱驱动拟人化手,配套仿真模型、驱动映射与强化学习包,可实现策略在仿真中训练后直接部署到实体手,无需微调与状态估计,并发布了相关全套资源。

Comments 20 pages, 9 figures. Project page: this https URL (https://tetheria.github.io/aero-hand-open/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28570 2026-08-31 cs.RO 新提交

ChainSplat: A Physics-Inspired Screw-Theoretic Model for Learning Deformable Linear Object Dynamics from Multi-View RGB Videos

ChainSplat:一种基于物理的螺旋理论模型,用于从多视角RGB视频中学习可变形线性物体的动力学

Seungyeon Kim, Noémie Jaquier

机构 * KTH Royal Institute of Technology(瑞典皇家理工学院)

AI总结 ChainSplat是一种物理启发式框架,仅从多视角RGB视频中联合学习可变形线性物体的3D几何、外观、运动学和动力学,在相关任务上达SOTA性能,支持实时估计与轨迹优化,具实用价值。

Comments 18 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28568 2026-08-31 cs.CV 新提交

SignRR: Retrieve and Refine Real Motion for Sign Language Production

SignRR:检索并优化真实手语动作以实现手语生成

Fidel Omar Tito Cruz, Angie Sanchez Marquina, Summy Farfan, Gissella Bejarano

机构 * University of Central Florida(中佛罗里达大学) Universidad Nacional Mayor de San Marcos(圣马科斯国立大学) Universidad Catolica San Pablo(圣巴勃罗天主教大学) Marist University(玛瑞斯特大学)

AI总结 针对手语生成的现有范式局限,提出 SignRR 框架,采用检索并优化的范式,在 PHOENIX14T 和 CSL-Daily 上实现了最优回译性能且姿态质量具竞争力。

Comments Accepted at the 37th British Machine Vision Conference (BMVC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28567 2026-08-31 cs.CV 新提交

GeBDA: Building Damage Assessment as Text-Based Sequence Prediction

GeBDA:基于文本序列预测的建筑物损伤评估

Olivier Dietrich, Krishna Sapkota, Konrad Schindler, Genady Beryozkin

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌公司)

AI总结 本研究提出将建筑物损伤评估(BDA)转化为文本序列预测任务,基于通用视觉语言模型(VLM),用开源Gemma模型初步实现取得了有前景的双时相卫星图像损伤制图结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28560 2026-08-31 cs.CL 新提交

A Formal Limitation on Learning Human Language From Textual Corpora

从文本语料库学习人类语言的形式化局限

Emily Cheng, Ryan Cotterell

机构 * Universitat Pompeu Fabra(庞培法布拉大学) ETH Zürich(苏黎世联邦理工学院)

AI总结 该研究从信息论角度推导了听者从话语表示恢复说话者意图含义的概率上界,通过三类实验验证了理论,表明任何文本特征提取器的表示都无法超越该上界。

Comments this is a draft; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28553 2026-08-31 cs.AI cs.MA 新提交

Logos: An Agent Harness on a Cross-Process Bus

Logos:一种跨进程总线的智能体管控工具

Hanzhang Jia, Liheng Zeng, Hao Cheng, Yi Gao, Bo Ma

机构 * University of Sussex(萨塞克斯大学) Zhejiang Gongshang University(浙江工商大学) Shanghai Shuyuan Information Technology Co., Ltd.(上海数元信息技术有限公司)

AI总结 本文基于时空可组合性演算等观察构建了跨进程智能体管控工具Logos,经实验验证其可在故障场景下保障会话恢复且无重复效果,性能优于单进程架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28552 2026-08-31 cs.LG 新提交

Advancing Interaction-Sensitive Feature Selection: Novel Relief-Based Algorithms, Expanded Comparisons, and Recommendations for Biomedical Data Mining

推进交互感知特征选择:新型基于Relief的算法、扩展比较及生物医学数据挖掘建议

Kia Kazemi-Nia, Harsh Bandhey, Philip J. Freda, Ryan J. Urbanowicz

机构 * Cedars-Sinai Health Sciences University(西达赛奈健康科学大学)

AI总结 本研究重构优化扩展scikit-rebate包,对比新型Relief类算法在基因组模拟数据中的表现,发现MultiSWRFDB等算法可有效保留主效应与交互作用,运行时间显著缩短。

Comments 18 pages, 6 figures, 2 tables, submitted for journal review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28549 2026-08-31 cs.CV cs.AI 新提交

Video Generative Models as Geometry Learner

作为几何学习者的视频生成模型

Haosen Yang, Jifei Song, Zhensong Zhang, Xiatian Zhu, Jiankang Deng

机构 * University of Surrey(萨里大学) Imperial College London(伦敦帝国学院)

AI总结 本研究提出GeoNeXt方法,将预训练视频生成模型用作统一数据高效的几何估计框架,以零样本方式在少数据下实现单目深度和表面法向量估计,性能优于同类生成式方法,可媲美数据量超100倍的判别式SOTA方法。

Comments 19 pages, 4 figures, 5 tables. Project page: this https URL (https://happy-hsy.github.io/projects/GeoNeXt/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28547 2026-08-31 cs.LG 新提交

DARTS: Decoder-Aware Representation Tuning via Surgery for Model Merging

DARTS:通过“手术”实现感知解码器的表示调优以完成模型合并

Aaryan Ajay Sharma, Sai Nishanth Padala, Seganrasan Subramanian

机构 * ServiceNow(ServiceNow(服务now公司)) University of Twente(特温特大学)

AI总结 针对模型合并中解码器存在的表示偏差挑战,本文提出DARTS方法,通过熵加权L1损失与逐位置加性偏差校正,在三类任务上较标准方法获显著改进且新增参数极少。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28541 2026-08-31 cs.LG cs.AI 新提交

An Enclosed Mode Is a Gauge Choice: Topology Relative to Reach in Certified Code World Models

闭合模式是一种规范选择:认证代码世界模型中相对于可达性的拓扑结构

Javier Aguilar Martín

机构 * AGILabs

AI总结 该研究探讨认证代码世界模型中相对于可达性的拓扑,通过LLM合成实验得出三条原则,揭示危险与可达性的关联、修复的限制及缓解措施需匹配错误维度方向的结论。

Comments 33 pages, 2 figures. Paper 3 of a series (companion papers: arXiv:2607.14169 (https://arxiv.org/abs/2607.14169), arXiv:2608.17956 (https://arxiv.org/abs/2608.17956) ). Code, data, and Lean formalization: this https URL (https://github.com/JaviMaligno/code-world-models)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28534 2026-08-31 cs.AI 新提交

InstructMesh: Selective Refinement of Generative 3D Models for Fabrication

InstructMesh:面向制造场景的生成式3D模型选择性优化

Faraz Faruqi, Ahmed Katary, Demircan Tas, Theresa Hradilak, Ning Zhang, Jiaji Li, Fabian Manhardt, Martin Nisser, Vrushank Phadnis, Ruofei Du, Federico Tombari, Megan Hofmann, Stefanie Mueller

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) Google(谷歌公司) University of Washington(华盛顿大学) Khoury College of Computer Sciences, Northeastern University(东北大学科里计算机科学学院) Google XR(谷歌XR部门)

AI总结 InstructMesh是一款交互式3D模型后生成优化工具,可通过区域选择、针对性操作及自然语言或滑块控件,帮助用户修复生成式3D模型的制造相关缺陷,新手无需专业技能即可使用,且用户偏好混合交互界面。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28508 2026-08-31 cs.CL 新提交

Phoneme- and Word-Level Metrics Using Self-Supervised Speech Representations for Forced Alignment Evaluation

基于自监督语音表示的音素级与词级指标用于强制对齐评估

V.S.D.S.Mahesh Akavarapu, Michael Daniel, Gerhard Jäger

机构 * University of Tübingen(蒂宾根大学) University of Jena(耶拿大学)

AI总结 该研究提出基于自监督语音表示的PCMI和WACS指标,用于无需人工标注时间戳的可扩展强制对齐评估,可区分对齐质量并与基准高度相关,已开源。

Comments Accepted at EMNLP-2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28499 2026-08-31 cs.LG cs.CR 新提交

REPLICANT: Learning Policies for Evading and Hardening Malware Detectors

REPLICANT:学习用于规避和加固恶意软件检测器的策略

Shae McFadden, Ilias Tsingenopoulos, Mario D'Onghia, Alexander Herzog, Myles Foley, Chris Hicks, Lorenzo Cavallaro, Fabio Pierazzi

机构 * University College London(伦敦大学学院) KU Leuven(鲁汶大学) The Alan Turing Institute(阿兰·图灵研究所) King’s College London(伦敦国王学院) Core64 Devotion AI Labs(Devotion AI实验室)

AI总结 Replicant是深度强化学习框架,在仅标签黑盒威胁模型下学习恶意软件规避策略,在7种Android恶意软件检测器上攻击成功率达78.8%,还可用于提升检测器鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28496 2026-08-31 cs.CL 新提交

Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation

混沌中的阶梯:测试时缩放何时、如何(或许还有为何)提升大语言模型的机器翻译性能

Di Wu, Sergey Troshin, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

AI总结 本研究探究LLM的序列式与并行式测试时缩放在机器翻译中的特性,发现序列式采样性能上限更高,可提升翻译流畅度但在大推理预算下会降准,还分析了其机制与鲁棒性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28493 2026-08-31 cs.SD cs.NE eess.AS 新提交

Low-Power End-to-End Cochlear Implant Speech Denoising with Spiking Neural Networks

采用脉冲神经网络的低功耗端到端人工耳蜗语音去噪

Ludovic Boulanger, Sean U. N. Wood

机构 * University of Sherbrooke(谢布鲁克大学)

AI总结 本研究针对人工耳蜗用户在嘈杂环境中语音理解困难的问题,提出受Deep ACE架构启发的脉冲神经网络,可同时实现语音增强与CI编码,在保持性能的同时能耗降低超6倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28491 2026-08-31 cs.AI cs.RO 新提交

AcrossVAM1.0: Particle World Modeling for Text-Assisted Robot Video Prediction

AcrossVAM1.0:面向文本辅助机器人视频预测的粒子世界建模

Yafei Zhang, Nan Wu

机构 * Across Physical AI(跨越物理人工智能公司) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

AI总结 该研究提出AcrossVAM1.0模型,通过分解为粒子运动与外观,在文本辅助下实现机器人视频预测,在VRS基准上显著降低轨迹误差、提升PSNR/SSIM等指标,但仍存在LPIPS未超越基线等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28482 2026-08-31 cs.LG cs.AI 新提交

How Proper Scoring Rules Shape LLM Forecasting

恰当评分规则如何塑造大语言模型(LLM)的预测

Benjamin Turtel, Paul Wilczewski, Kris Skotheim, Ville A. Satopää, Philip E. Tetlock

机构 * Lightning Rod Labs(闪电杆实验室) INSEAD(欧洲工商管理学院) School of Arts & Sciences, University of Pennsylvania(宾夕法尼亚大学文理学院)

AI总结 本文研究了5种恰当评分规则作为训练目标对LLM预测的影响,发现不同规则训练的模型在校准、概率使用等方面有差异,Brier训练模型表现最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28481 2026-08-31 cs.CL cs.AI 新提交

NL2AGBench: Benchmarking LLM Auto-Formalization for AlphaGeometry

NL2AGBench:面向AlphaGeometry的大语言模型自动形式化基准测试

Samuel Xiao, Judy Song, Rory Hu, Ziliang Zong

机构 * Valley Christian High School(谷基督高中) Vandegrift High School(范德格里夫特高中) Groton School(格罗顿学校) Texas State University(德克萨斯州立大学)

AI总结 该研究提出NL2AGBench基准,评估LLMs将英文几何问题转换为AlphaGeometry兼容形式化表示的能力,发现闭源模型可实现80%以上可执行翻译率,开源模型表现欠佳,还提出错误分类法并验证了多种缓解策略的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28478 2026-08-31 cs.CL 新提交

Blind Men and the Elephant: Probing the Epistemic Myopia of LLMs under Long-Tail Divergent Knowledge

盲人摸象:探究长尾分歧知识下大语言模型(LLM)的认知近视问题

Zhuoshi Pan, Junru Lu, Yan Qian, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) University of Warwick(华威大学)

AI总结 本研究推出ElephantBench探针,发现LLM在长尾分歧知识问答中仅52.4%的问题能同时回忆两种解释,模型规模扩大等方法无法消除认知不完整性,为评估LLM认知严谨性提供了工具。

Comments 10 pages, 10 figurs, 1 table, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28476 2026-08-31 cs.CL 新提交

ContextPilot: Teaching Agents for Proactive Context Management via Fine-grained RL

ContextPilot:通过细粒度强化学习为智能体教授主动上下文管理

Zhuoshi Pan, Qizhi Pei, Junru Lu, Honglin Lin, H. Vicky Zhao, Di Yin, Xing Sun

机构 * Tsinghua University(清华大学) Tencent(腾讯) Shanghai AI Lab(上海人工智能实验室)

AI总结 本研究针对现有主动上下文管理方法的局限,提出ContextPilot框架,通过扩充工具集并设计细粒度RL方法,在长程智能体任务中实现更紧凑上下文下的更优性能,优于现有基线。

Comments 10 pages, 6 figures, 5 tables, accepted to EMNLP 2026 (Main Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28475 2026-08-31 cs.AI 新提交

COVER: Identifiable Evaluation of Coalition Routing

COVER:联盟路由的可识别评估

Raghul Sugumar, Amrit Gopinath

机构 * Sri Sivasubramaniya Nadar College of Engineering(斯里·西瓦苏布拉马尼亚·纳达尔工程学院)

AI总结 研究针对多智能体系统路由效应无法通过端到端准确率识别的问题,提出可审计的COVER评估方法,在MuSiQue、HotpotQA等数据集及Llama模型上验证其可准确测量联盟路由遗憾,暴露选择空间且不人为制造路由胜利。

Comments 17 pages, 2 figures, 13 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28472 2026-08-31 cs.SD eess.AS 新提交

Multirate State Space Models for End-to-End Processing of Pulse Density Modulated Speech Signals

用于脉冲密度调制语音信号端到端处理的多速率状态空间模型

Ludovic Boulanger, Sean U. N. Wood

机构 * University of Sherbrooke(谢布鲁克大学)

AI总结 该研究提出多速率状态空间模型,构建PDM语音端到端处理架构,可实现调制与采样率无关的表示,在不同采样率下性能优异,大幅降低处理时间步数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28467 2026-08-31 cs.CL 新提交

Stranger, Fan, or Peer? A Systematic Study on the Role of Interlocutor in Persona-Based Dialogue Generation

陌生人、粉丝还是同伴?对对话者在基于角色的对话生成中作用的系统研究

Daniela Occhipinti, Malvina Nissim, Marco Guerini

机构 * Fondazione Bruno Kessler(布鲁诺·凯塞勒基金会) University of Groningen(格罗宁根大学)

AI总结 该研究通过分离训练、推理、评估三阶段的对话者传记可见性,发现训练阶段可见性对基于角色的对话生成影响更大,揭示了传记泄露的成因。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28461 2026-08-31 cs.CV cs.AI 新提交

Anatomy-Aware Promptable Segmentation with Online Interactive Training for AUTOPET V

面向AUTOPET V挑战的解剖结构感知可提示分割方法及在线交互式训练

Pablo Lozano-Jimenez, Sergio Romero-Tapiador, Ruben Tolosana

机构 * University of Amsterdam(阿姆斯特丹大学) BiometricsAI(生物识别AI公司) Universidad Autónoma de Madrid(马德里自治大学)

AI总结 该研究针对AUTOPET V挑战,开发了基于nnU-Net的解剖感知可提示分割模型,经分阶段训练与示踪剂分类优化,在PET/CT病灶分割任务中实现了稳定且优异的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28460 2026-08-31 cs.CV 新提交

LayerRecall: A State-Conditioned Memory Router for Long-Horizon Consistency in Video Generation

LayerRecall:用于视频生成中长时序一致性的状态条件化记忆路由

Yixuan Ding, Jiahao Kong, Wei Huang, Ruijie Quan, Yi Yang

机构 * Zhejiang University(浙江大学) The University of Hong Kong(香港大学)

AI总结 提出LayerRecall记忆路由与CHPM训练方法,在不牺牲局部连续性的前提下提升视频生成长程一致性,在MemoBench、MovieBench等数据集上取得最优结果,且具备跨主干可移植性与低推理开销。

Comments 15 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28458 2026-08-31 cs.CL cs.LG 新提交

Acquire, Repair, Preserve: A Diagnosis-Guided Post-Training Recipe for Small-Model Dialogue Game Agents

获取、修复、保留:面向小模型对话游戏智能体的诊断引导式后训练方案

Nan Li

机构 * Utrecht University(乌得勒支大学)

AI总结 本研究针对小模型对话游戏智能体提出诊断引导式后训练方案,通过三步训练在LM Playschool Challenge中大幅提升了模型的域内对话游戏表现,同时保留了通用静态性能。

Comments 14 pages, 14 tables; Accepted to the LM Playschool Workshop at EMNLP 2026; HF model card: this https URL (https://huggingface.co/chnln/Qwen3.5-2B-playpen-playornotplay)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28455 2026-08-31 cs.CV cs.AI 新提交

ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT

ARC-CT:用于3D胸部CT的解剖路由对比视觉-语言学习

Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol, Şeyda Ertekin

机构 * Harvard Medical School(哈佛医学院) METU-DTX Digital Transformation and Innovation Center(METU-DTX数字转型与创新中心)

AI总结 ARC-CT是一种基于LLM提取的报告标签、无需人工标注的区域感知对比视觉-语言框架,通过三个组件解决胸部CT全局对比学习的局限,在18种异常上实现0.86无掩码宏观AUC,性能优于高效基线和大Transformer模型。

Comments Accepted to the Thoracic Image Analysis (TIA) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28453 2026-08-31 cs.CV 新提交

Prompt-Guided Interactive Segmentation of Interstitial Lung Disease in Thoracic CT

基于提示引导的胸部CT中间质性肺疾病交互式分割

Vasilis Dedousis, Lubnaa Abdur Rahman, Lorenzo Brigatο, Ethan Dack, Andreas Christe, Christoph Frank, Manuela Funke-Chambour, Justus Roos, Adrian Huber, Lukas Ebner, Stavroula Mougiakakou

机构 * University of Bern(伯尔尼大学) Graduate School for Cellular and Biomedical Sciences(细胞与生物医学科学研究生院) Bern University Hospital(伯尔尼大学医院) Lucern Cantonal Hospital(卢塞恩州立医院) Lausanne University Hospital (CHUV) and University of Lausanne(洛桑大学医院(CHUV)与洛桑大学)

AI总结 本研究首次将MedSAM2适配到胸部CT的3D ILD交互式分割任务,经实验验证全模型微调结合BBox等提示可提升分割性能,还提出了基于自动分割先验与放射科医生提示的端到端工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28447 2026-08-31 cs.AI 新提交

Learning to Use Tools: Reinforcement Learning for Tool-Integrated Mathematical Reasoning

学习使用工具:用于工具集成数学推理的强化学习

Minghui Xu, Zi Wang

机构 * Stanford University(斯坦福大学)

AI总结 本研究针对Countdown任务,构建工具使用的SFT数据集并采用多种强化学习方法,结合计算器工具集成提升LLM数学推理,使pass@1达66.0%,显著降低计算与验证错误。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28444 2026-08-31 cs.CL cs.LG 新提交

Sliding-window beats linear attention

滑动窗口注意力优于线性注意力

Alexia Jolicoeur-Martineau, Rhea Sanjay Sukthanker, Pashmina Cameron, Emy Gervais

机构 * Microsoft(微软公司) Applied Sciences Group (ASG)(应用科学集团(ASG))

AI总结 本研究对比发现,带汇点的滑动窗口注意力(SWA)性能优于后训练的线性注意力模型,在长上下文推理任务中性能高2-10倍,且无需后训练、成本低,推荐用SWA替代线性注意力模型。

详情

展开后加载摘要…

URL PDF HTML 收藏