SP3O: Reinforcement Learning from Segment Preferences without Reward Modeling
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
高校专区
SP3O:无需奖励建模的分段偏好强化学习
机构 * University of Michigan(密歇根大学)
AI总结 SP3O是一种无需奖励建模的新型PbRL算法,利用分段级偏好反馈,通过PPO型损失函数优化策略,在机器人控制和LLM微调等长视界任务中性能优于现有算法。
GeoID-PINN:考虑地理耦合的可识别性感知区域流行病推断方法
机构 * University of Michigan(密歇根大学)
AI总结 本研究提出GeoID-PINN,一种结合地理耦合与正则化的物理信息神经网络,用于区域流行病SIRD动力学推断,在模拟数据与路易斯安那州64个县COVID-19数据上均提升了预测准确性。
Comments 11 pages, 3 figures. Accepted at the 8th epiDAMIK ACM SIGKDD Workshop on Data-driven Decision Making for Public and Population Health (epiDAMIK @ KDD 2026)
通过固定基空间中的系数映射学习算子
机构 * Department of Mathematics(数学系) ; University of Michigan(密歇根大学) ; The Hong Kong University of Science and Technology(香港科学与技术大学) ; Algorithms of Machine Learning and Autonomous Driving Research Lab(机器学习与自动驾驶算法研究实验室) ; HKUST Shenzhen-Hong Kong Collaborative Innovation Research Institute(香港科技大学深圳-香港协同创新研究机构)
AI总结 FB-C2CNet通过固定基空间中的系数映射学习算子,有效降低计算复杂度并提升训练效率。
在智能体丛林中通过历史感知的对手意识进化
机构 * University of Edinburgh(爱丁堡大学) ; University of Oklahoma(俄克拉荷马大学) ; Imperial College London(伦敦帝国学院) ; University of Michigan(密歇根大学) ; University of Southern California(南加州大学) ; Tencent(腾讯) ; Beijing Normal University(北京师范大学) ; Beijing Normal–Hong Kong Baptist University(北京师范大学-香港浸会大学联合国际学院)
AI总结 针对多智能体环境中对手策略持续进化导致静态技能修改方法失效的问题,提出OASE方法,通过历史快照锚定的配对比较选择有益技能修改,在两类场景中实现更低均衡距离与更少无效策略变更。
能否用视觉-语言模型评估城市衰败:以底特律为例
机构 * School for Environment and Sustainability(环境与可持续发展学院) ; School of Information(信息学院) ; University of Michigan(密歇根大学)
AI总结 本研究以底特律为案例,提出基于开源大视觉-语言模型的多视角住宅衰败评估框架,经实验验证该框架可低成本跟踪住房状况,为传统调查提供补充。
Comments 19 pages, 11 figures
STAR-VLM:基于汽车雷达监督的时空视觉语言模型,用于运动与速度估计
机构 * University of Michigan(密歇根大学)
AI总结 该研究提出STAR-VLM框架,利用汽车雷达监督提升时空视觉语言模型的运动推理与度量速度估计能力,在驾驶场景相关任务上实现了优于特定任务方法的最先进性能。
评分规则!文本评估指标的统计对齐与策略对齐
机构 * University of Michigan(密歇根大学) ; Peking University(北京大学) ; Microsoft Research(微软研究院) ; Northwestern University(西北大学)
AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。
生成式人工智能充斥并稀释了图书市场
机构 * Stony Brook University(纽约州立大学石溪分校) ; Columbia Law School(哥伦比亚法学院) ; University of Michigan(密歇根大学) ; MIT Initiative on the Digital Economy(麻省理工学院数字经济倡议)
AI总结 研究通过对亚马逊上自出版小说检测,发现含大量AI文本书籍占书目比重大但销售占比小,其达商业规模且重塑市场,单本销售收入下降,还影响不同类型书籍及畅销书语言借鉴情况,结果关乎版权侵权合理使用抗辩的市场效应问题。
Comments Working Paper Under Review
多层级策略分类:通过晋升与降级动态激励改进
机构 * Electrical and Computer Engineering Department, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学电气与计算机工程系,安阿伯,MI 48109,美国)
AI总结 本文提出一种多层级晋升-降级框架,通过设计分类器阈值和难度递进来激励代理人诚实努力,并证明在温和条件下代理人可通过真实改进达到任意高水平。
Comments 9 pages, 4 figures, ICML 2026
面向视觉语言赋能的无人机分类与灾害响应的系统工程框架
机构 * University of Arkansas(阿肯色大学) ; University of Michigan-Dearborn(密歇根大学迪尔伯恩分校)
AI总结 该研究提出将视觉语言模型(VLMs)作为协同智能体嵌入人-无人机回路的系统工程框架,经评估可降低人因负担、提升AI信任度,推进了高风险灾害响应的人-自主系统协同。
Comments 10 pages, 8 figures. Author accepted manuscript of AIAA Paper 2026-4010, published in the AIAA AVIATION 2026 Forum
Journal ref AIAA AVIATION 2026 Forum, AIAA Paper 2026-4010, 2026
MorphQuad:具有超人机动性、操纵性和弹性的可变形四旋翼飞行器
机构 * University of Michigan(密歇根大学)
AI总结 研究旨在实现具有高机动性、操纵性和弹性的飞行器。核心方法是硬件与控制协同设计,让四旋翼飞行器各旋翼系统独立铰接并采用全局稳定控制等。主要贡献是展示了MorphQuad在多方面的优异性能。
用于跟踪未知动力学的无遗憾自适应性学习与模型预测控制
机构 * University of Michigan(密歇根大学)
AI总结 该研究针对未知切换动力学的目标跟踪问题,提出自适应性学习结合模型预测控制的方法,经仿真和硬件实验验证其在各类轨迹下的无遗憾跟踪性能优于多种在线学习基线方法。
Comments 20 pages, 14 figures
可自我配置的网格网络用于可扩展的分布式子模带提优化
机构 * Department of Aerospace Engineering, University of Michigan(航空航天工程系,密歇根大学)
AI总结 本文提出了一种可自我配置的网格网络方法,通过限制信息中继和消息大小,实现分布式子模带提优化的可扩展性和接近最优性。
用于定制产前护理的PATHFinder智能体
机构 * University of Michigan(密歇根大学)
AI总结 研究针对产前护理,提出PATHFinder智能体这一端到端对话系统,通过结构化对话收集信息并制定个性化计划,展示社区资源。经评估前沿大语言模型,GPT-5.2平均分最高,还发现检测建议差距,将开展人体研究和随机对照试验验证。
Comments Accepted as demo at ACM Interactive Health 2026. https://realize-lab.github.io/PATHFinder/
Kernel Forge:用于基于大语言模型的CUDA内核生成与优化的代理框架
机构 * University of Michigan(密歇根大学)
AI总结 研究针对机器学习模型中计算内核优化需专家手写代码的问题,提出开源端到端代理框架Kernel Forge,它支持多种工作负载,用蒙特卡洛树搜索优化路径,经实验评估,优化后的内核性能优于PyTorch即时模式。
Comments The code is available at: https://github.com/TheJoshBrod/KernelForge
对前沿视觉-语言模型进行审计以实现可信的医学视觉问答:定位失败、格式崩溃和领域适应
机构 * New York University, New York, USA(纽约大学) ; Tsinghua University, Beijing, China(清华大学) ; Columbia University, New York, USA(哥伦比亚大学) ; University of Michigan, Ann Arbor, USA(密歇根大学)
AI总结 本文审计了五种前沿视觉-语言模型在医学视觉问答中的表现,发现定位失败和格式崩溃是信任瓶颈,通过领域适应可提升性能。
PRIMA:通过大语言模型进行风险集成图像-元数据对齐的医学诊断预训练
机构 * Department of Biomedical Engineering, Duke University(杜克大学生物医学工程系) ; Department of Ophthalmology and Visual Sciences, University of Michigan(密歇根大学眼科与视觉科学系)
AI总结 提出PRIMA框架,通过检索增强生成策展风险-疾病关联专家语料库优化文本编码器,用双编码器预训练策略及四个互补损失函数弥合模态差距,融合特征用于疾病分类,性能优于其他方法。
COMPOL:用于可扩展多物理场模拟的统一神经算子框架
机构 * School of Information, University of Michigan–Ann Arbor(信息学院,密歇根大学安娜堡分校) ; Hildebrand Department of Petroleum and Geosystems Engineering, The University of Texas at Austin(石油与地质系统工程系,德克萨斯大学奥斯汀分校) ; Department of Computer Science, Florida State University(计算机科学系,佛罗里达州立大学)
AI总结 研究针对多物理场模拟中神经算子难以捕捉复杂相关性的问题,提出COMPOL框架,通过循环和注意力聚合机制扩展传统算子架构,实验表明该框架与现有方法相比能实现更高预测精度。
基于生成模型和自适应测试的离线到在线创意优化
机构 * University of Michigan(密歇根大学) ; Meta
AI总结 研究如何利用历史A/B测试数据,通过性能驱动的离线到在线工作流程,用预测模型指导生成测试广告位候选创意,经实验验证该方法能有效提升创意参与度,为创意优化提供设计原则。
PRISM:用于交互结构运动控制的多项式表示
机构 * University of Michigan(密歇根大学)
AI总结 研究针对机器人观察中物理变量交互作用问题,提出PRISM策略表示,通过因式分解多项式模块展现高阶交互特征,在强化和模仿学习中应用,提升了人形机器人运动等性能,还能产生无传感器柔顺行为,表明多项式表示应成运动控制标准选择。
用于动力膝盖-脚踝假肢控制器个性化的重放约束模拟框架
机构 * College of Engineering, University of Michigan(密歇根大学工程学院)
AI总结 研究动力假肢腿阻抗控制器个性化难题,提出重放约束模拟框架,通过再现动力学、重放数据绕过复杂人类机制,用深度强化学习策略个性化关节参数,经实验验证有强预测有效性,提升生物模仿奖励。
通过估计s-凹需求函数实现序列价格竞争中的收益最大化
机构 * Department of Statistics University of Michigan Ann Arbor, MI, USA(统计系密歇根大学安娜堡分校) ; Department of Management University of Miami Miami, USA(管理系迈阿密大学)
AI总结 本文研究了多个卖方在T期内的序列价格竞争,提出利用半参数最小二乘估计的动态定价策略,证明价格收敛至纳什均衡的速度为O(T^{-1/7}),并建立新的集中性结果。
Journal ref International Conference on Learning Representations (ICLR 2026)
在线性估值模型中使用形状约束进行动态定价
机构 * University of Michigan(密歇根大学) ; Welltower Inc.(Welltower公司)
AI总结 本文提出了一种基于形状约束的动态定价方法,在线性估值模型中无需调节参数,通过α-霍尔德连续性假设推导后悔上界,并在实验中展示更低的后悔表现。
Journal ref Transactions on Machine Learning Research (TMLR) 2025
基于核表示的高效域自适应策略学习及其在非平稳扰动下四旋翼控制中的应用
机构 * University of Michigan, Ann Arbor(密歇根大学安娜堡分校)
AI总结 提出一种基于核表示的高效域自适应策略学习算法,通过随机傅里叶特征建模未知扰动,离线训练仅需50秒,在线通过最小二乘估计实时更新参数,在四旋翼轨迹跟踪任务中有效应对非平稳扰动。
真实场景中的逼真幻影道路:从物理几何中解构3D幻觉
机构 * University of Michigan(密歇根大学)
AI总结 本文提出首个端到端框架,用于探测、量化和抑制单目深度模型中因几何平面输入而产生的3D幻觉现象,通过引入3D-幻影基准和基于拉普拉斯的评估框架,提升深度模型的结构和上下文鲁棒性。
Comments Accepted to ECCV 2026
当伦理与收益相悖时:道德两难情境下的大语言模型智能体
机构 * ETH Zürich(苏黎世联邦理工学院) ; University of Zurich(苏黎世大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; Max Planck Institute for Intelligent Systems, Tübingen(图宾根人工智能研究所) ; University of Toronto(多伦多大学) ; Vector Institute(向量研究所)
AI总结 研究道德要求与利润激励冲突时LLMs在道德两难博弈中的行为,引入\msim评估九个模型,通过ATEs估计因果效应、分析推理轨迹,发现模型道德行为有情境脆弱性,揭示了部署风险。
AXIS:用于可扩展机器人操作的可增长社区驱动数据引擎
机构 * Axis Robotics(轴机器人公司) ; University of California, Berkeley(加州大学伯克利分校) ; Georgia Institute of Technology(佐治亚理工学院) ; Texas A&M University(德州农工大学) ; Johns Hopkins University(约翰·霍普金斯大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Michigan(密歇根大学) ; National University of Singapore(新加坡国立大学) ; Nanyang Technological University(南洋理工大学)
AI总结 研究针对机器人操作策略学习中数据管道难扩展的问题,提出AXIS这一可增长社区驱动数据引擎,它能收集、处理数据并组织成任务快照,通过实验表明其能提升模型性能且随数据量增加有一致扩展性。
Comments Project Website: https://axisaiorg.github.io/AXIS-V1/
用于移动健康部署的扩散模型亚群数字孪生:以HeartSteps干预为例
机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; The Ohio State University(俄亥俄州立大学) ; Harvard University(哈佛大学) ; University of Michigan(密歇根大学)
AI总结 研究针对移动健康干预算法设计问题,提出基于条件时间序列扩散模型开发“JITAI-Twins”数字孪生的方法,经多步更新,在HeartSteps干预部署预阶段验证,能更好再现目标亚群结构,为算法设计决策提供模拟。
用于可扩展多机器人轨迹优化的基于分布式模型的扩散算法
机构 * Robotics Department, University of Michigan(密歇根大学机器人系)
AI总结 针对多机器人轨迹优化难题,提出分布式基于模型的扩散算法(DMBD),将反向扩散过程分解为局部条件反向扩散过程,使机器人能独立去噪,模拟显示其可扩展性强,能快速解决协调任务且优于现有基线。
Comments 9 pages, 4 figures
深度强化学习引导的模型预测控制在自主赛车中防止超车的应用
机构 * University of Michigan(密歇根大学) ; National University of Singapore(新加坡国立大学)
AI总结 研究自主赛车防御性阻挡问题,通过分层强化学习引导的模型预测控制框架,将防御转化为空间占用调节问题。在仿真中提升平均超车时间,减少对手前进距离,使车辆有效利用轮胎力,且求解时间短,支持实时高速对抗。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 7 figures