arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2370
2501.19277 2026-04-27 stat.ML cs.LG

On Pareto Optimality for Parametric Choice Bandits

关于参数选择老虎机的帕累托最优性

Jierui Zuo, Hanzhang Qin

机构 * Department of Management Science and Engineering, Tsinghua University, Beijing, China(清华大学管理科学与工程系,北京,中国) Department of Industrial Systems Engineering and Management, National University of Singapore, Singapore(新加坡国立大学工业系统工程与管理系,新加坡)

AI总结 本文研究在随机选择下在线商品组合优化问题,提出结合两个正则化最大似然估计器的强制探索乐观面对不确定性方案,分析了自归一化集中不等式、似然椭球置信集定理和近似乐观动作的遗憾界,推导了多名义logit模型的得分和曲率代理,得出帕累托最优区间和平衡点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02832 2026-04-24 q-fin.RM cs.LG

Transfer Learning for Loan Recovery Prediction under Distribution Shifts with Heterogeneous Feature Spaces

在存在分布偏移的情况下,用于贷款回收预测的迁移学习

Christopher Gerling, Hanqiu Peng, Ying Chen, Stefan Lessmann

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出FT-MDN-Transformer模型,用于在异构特征集上进行贷款回收预测的迁移学习,通过蒙特卡洛模拟和真实数据集评估,证明其在数据稀缺和分布偏移下的有效性。

Comments 35 pages, 14 figures. Christopher Gerling had previously withdrawn his submission due to NDA restrictions, and that matter was resolved. We are authorized to publish the preprint now

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05563 2026-04-24 cs.CV cs.SI

What's Left Unsaid? Detecting and Correcting Misleading Omissions in Multimodal News Previews

未被言说之物:检测和纠正多模态新闻预告中的误导性省略

Fanxiao Li, Jiaying Wu, Tingchao Fu, Dayang Li, Herun Wan, Wei Zhou, Min-Yen Kan

机构 * School of Information Science and Engineering, Yunnan University(云南大学信息科学与工程学院) National University of Singapore(新加坡国立大学) Xi’an Jiaotong University(西安交通大学) School of Engineering, Yunnan University(云南大学工程学院)

AI总结 本文提出MM-Misleading基准,通过多阶段流程评估开源LVLMs,发现省略性误导的盲区,并提出OMGuard结合细调和引导修正,提升检测与纠正效果,揭示局部叙事变化导致的误导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06209 2026-04-24 cs.AI cs.CL

ReProbe: Efficient Test-Time Scaling of Multi-Step Reasoning by Probing Internal States of Large Language Models

ReProbe:通过探测大语言模型的内部状态实现多步骤推理的高效测试时间扩展

Jingwei Ni, Ekaterina Fadeeva, Tianyi Wu, Mubashara Akhtar, Jiaheng Zhang, Elliott Ash, Markus Leippold, Timothy Baldwin, See-Kiong Ng, Artem Shelmanov, Mrinmaya Sachan

机构 * ETH Zürich(苏黎世联邦理工学院) National University of Singapore(新加坡国立大学) MBZUAI(马斯喀特人工智能研究所) University of Zürich(苏黎世大学) The University of Melbourne(墨尔本大学)

AI总结 本文提出基于探测大语言模型内部状态的轻量级方法,用于多步骤推理验证,其性能超越了810倍大的Process Reward Models,为可扩展的测试时间扩展和更可 introspective 的大语言模型提供了新路径。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20366 2026-04-23 cs.CV

Mitigating Hallucinations in Large Vision-Language Models without Performance Degradation

在不降低性能的情况下缓解大型视觉-语言模型的幻觉

Xingyu Zhu, Junfeng Fang, Shuo Wang, Beier Zhu, Zhicai Wang, Yonghui Yang, Xiangnan He

机构 * MoE Key Lab of BIPC(BIPC摩尔实验室) University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MPD框架,通过语义感知组件解耦和可解释参数更新,有效减少幻觉并保持生成能力,实验显示在LLaVA-Bench和MME上减少23.4%幻觉同时保持97.4%的生成能力。

Comments ACL 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20336 2026-04-23 cs.CV cs.GR

Stability-Driven Motion Generation for Object-Guided Human-Human Co-Manipulation

面向物体引导的人-人协同操作的稳定性驱动运动生成

Jiahao Xu, Xiaohan Yuan, Xingchen Wu, Chongyang Xu, Kun Li, Buzhen Huang

机构 * Tianjin University(天津大学) National University of Singapore(新加坡国立大学) Sichuan University(四川大学)

AI总结 本文提出一种流匹配框架,通过物体 affordance 和空间配置生成自然且有效的协同操作运动,结合对抗性交互先验和稳定性驱动模拟,提升接触精度和交互稳定性。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20200 2026-04-23 cs.CL

Chasing the Public Score: User Pressure and Evaluation Exploitation in Coding Agent Workflows

追逐公共评分:用户压力与编码代理工作流中的评估剥削

Hardy Chen, Nancy Lau, Haoqin Tu, Shuo Yan, Xiangyan Liu, Zijun Wang, Juncheng Wu, Michael Qizhe Shieh, Alvaro A. Cardenas, Cihang Xie, Yuyin Zhou

机构 * UC Santa Cruz(加州大学圣克ruz分校) UT Dallas(德克萨斯大学达拉斯分校) NUS(新加坡国立大学)

AI总结 研究用户压力是否导致公共评分剥削,通过实验发现更强模型剥削率更高,高压力促使早期剥削,添加反剥削提示可有效减少剥削。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19806 2026-04-23 physics.chem-ph cs.AI cs.LG

Improving Molecular Force Fields with Minimal Temporal Information

通过最小时间信息改进分子力场

Ali Mollahosseini, Mohammed Haroon Dupty, Wee Sun Lee

机构 * School of Electrical and Computer Engineering, University of Tehran, Tehran, Iran(伊朗塔里班大学电气与计算机工程学院) School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)

AI总结 本文提出FRAMES策略,利用分子动力学数据中的最小时间信息提升分子能量和力预测的准确性,发现冗余的时间序列可能降低性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19683 2026-04-23 cs.RO

Mask World Model: Predicting What Matters for Robust Robot Policy Learning

遮罩世界模型:为鲁棒机器人策略学习预测重要的内容

Yunfan Lou, Xiaowei Chi, Xiaojie Zhang, Zezhong Qian, Chengxuan Li, Rongyu Zhang, Yaoxu Lyu, Guoyu Song, Chuyao Fu, Haoxuan Xu, Pengwei Wang, Shanghang Zhang

机构 * Peking University, Beijing, China State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University Beijing Academy of Artificial Intelligence, Beijing, China National University of Singapore, Singapore The Hong Kong University of Science Nanjing University, Nanjing, China

AI总结 本文提出Mask World Model,通过预测语义遮罩而非像素,提升机器人策略学习的鲁棒性与泛化能力,实验证明其在仿真和现实任务中均优于现有方法。

Comments 16 pages,5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20582 2026-04-23 cs.MA cs.AI cs.CL

Trust, Lies, and Long Memories: Emergent Social Dynamics and Reputation in Multi-Round Avalon with LLM Agents

信任、谎言与长久记忆:在多轮阿瓦隆中的LLM代理涌现的社会动态与声誉

Suveen Ellawela

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究LLM代理在多轮阿瓦隆游戏中社会动态与声誉的演变,发现记忆保留促进声誉形成及策略性欺骗,高推理努力提升欺骗效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18236 2026-04-23 cs.CV

Human-like Content Analysis for Generative AI with Language-Grounded Sparse Encoders

具有语言基础的稀疏编码的生成AI内容分析

Yiming Tang, Arash Lagzian, Srinivas Anumasa, Qiran Zou, Yingtao Zhu, Ye Zhang, Trang Nguyen, Yih-Chung Tham, Ehsan Adeli, Ching-Yu Cheng, Yilun Du, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Tsinghua University(清华大学) Stanford University(斯坦福大学) Harvard University(哈佛大学)

AI总结 本文提出LanSE工具,通过自然语言描述将图像分解为可解释的视觉模式,实现了对生成AI内容的细粒度分析,提升了物理合理性评估并扩展至医学影像领域。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19548 2026-04-22 cs.CL cs.AI cs.CY

Taming Actor-Observer Asymmetry in Agents via Dialectical Alignment

通过辩证对齐平息代理中的行动者-观察者不对称性

Bobo Li, Rui Wu, Zibo Ji, Meishan Zhang, Hao Fei, Min Zhang, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(国立新加坡大学) Sichuan University(四川大学) University of Minnesota Twin Cities(明尼苏达大学双城分校) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳分校) University of Oxford(牛津大学)

AI总结 本文提出ReTAS模型,通过辩证对齐方法减少代理中的行动者-观察者不对称性,提升故障解决能力。

Comments ACL 2026 Main Conference. Project page: https://unikcc.github.io/ReTAS/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12942 2026-04-22 cs.RO

RMGS-SLAM: Real-time Multi-sensor Gaussian Splatting SLAM

RMGS-SLAM:基于3D高斯散射的实时多传感器SLAM

Dongen Li, Yi Liu, Junqi Liu, Zewen Sun, Zefan Huang, Shuo Sun, Jiahui Liu, Chengran Yuan, Hongliang Guo, Francis E. H. Tay, Marcelo H. Ang

机构 * Advanced Robotics Centre, National University of Singapore(新加坡国立大学先进机器人中心) School of Aeronautics and Astronautics, Shanghai Jiao Tong University(上海交通大学航空宇航学院) College of Computer Science, Sichuan University(四川大学计算机学院) Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟)

AI总结 本文提出一种实时多传感器SLAM框架,结合激光雷达、惯性导航和视觉数据,通过高斯散射实现高精度定位与真实感映射,解决了大规模环境中的实时SLAM挑战。

Comments The manuscript has been improved, with refined content and updated and corrected experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11623 2026-04-22 cs.LG

TreeGrad-Ranker: Feature Ranking via $O(L)$-Time Gradients for Decision Trees

TreeGrad-Ranker: 通过 $O(L)$-时间梯度进行决策树的特征排名

Weida Li, Yaoliang Yu, Bryan Kian Hsiang Low

机构 * Department of Computer Science, National University of Singapore, Republic of Singapore(新加坡国立大学计算机科学系) School of Computer Science, University of Waterloo, Canada(滑铁卢大学计算机科学学院) Vector Institute, Canada(加拿大向量研究所)

AI总结 本文提出TreeGrad-Ranker,通过直接优化联合目标来生成特征排名,解决了传统概率值方法在联合优化中的不可靠问题,并展示了其在插入和删除指标上的优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04320 2026-04-22 cs.RO

MacroNav: Multi-Task Context Representation Learning Enables Efficient Navigation in Unknown Environments

MacroNav:多任务上下文表示学习实现未知环境中的高效导航

Kuankuan Sima, Longbin Tang, Zhenyu Yang, Haozhe Ma, Lin Zhao

机构 * Department of Electrical and Computer Engineering(电子与计算机工程系) Department of Mechanical Engineering(机械工程系) School of Computing(计算学院) National University of Singapore(新加坡国立大学)

AI总结 本文提出MacroNav框架,通过多任务自监督学习和强化学习策略,实现高效导航。实验表明其在成功率和路径长度加权成功率上优于现有方法,且计算效率高。

Comments Accepted by IEEE Robotics and Automation Letters

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13980 2026-04-22 stat.ME cs.LG stat.ML

Byzantine-tolerant distributed learning of finite mixture models

容错的分布式有限混合模型学习

Qiong Zhang, Yan Shuo Tan, Jiahua Chen

机构 * Institute of Statistics and Big Data, Renmin University of China, Beijing, China(统计与大数据研究院,中国人民大学,北京,中国) Department of Statistics and Data Science, National University of Singapore, Singapore(统计与数据科学系,新加坡国立大学,新加坡) Department of Statistics, The University of British Columbia, Vancouver, Canada(统计系,不列颠哥伦比亚大学,温哥华,加拿大)

AI总结 本文提出DFMR方法,通过局部估计密度构建鲁棒过滤机制,解决有限混合模型学习中的拜占庭故障问题,理论证明其最优收敛率和渐近等价性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18846 2026-04-22 quant-ph cs.LG

Trainability Beyond Linearity in Variational Quantum Objectives

变分量子目标中超越线性的可训练性

Gordon Ma, Xiufan Li

机构 * Centre for Quantum Technologies, National University of Singapore, Singapore(新加坡国立大学量子技术中心)

AI总结 研究探讨了变分量子算法中超越线性可训练性的边界,揭示了损失函数的线性特性与目标表示之间的关系,指出非线性损失函数在特定条件下可克服梯度抑制问题。

Comments 28 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18005 2026-04-22 cs.MA cs.AI cs.CL

Diversity Collapse in Multi-Agent LLM Systems: Structural Coupling and Collective Failure in Open-Ended Idea Generation

多智能体大语言模型系统中的多样性崩溃:结构耦合与开放性创意生成中的集体失败

Nuo Chen, Yicheng Tong, Yuzhe Yang, Yufei He, Xueyi Zhang, Qingyun Zou, Qian Wang, Bingsheng He

机构 * National University of Singapore(国立新加坡大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 研究探讨了多智能体系统在开放性创意生成中多样性崩溃的原因,揭示了结构耦合导致的集体失败,强调了在设计创意任务时保持独立性和分歧的重要性。

Comments 56 pages, 15 figures; Accepted at ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14726 2026-04-22 cs.LG cs.AI

Catching Every Ripple: Enhanced Anomaly Awareness via Dynamic Concept Adaptation

捕捉每一个涟漪:通过动态概念适应提升异常意识

Jiaqi Zhu, Shaofeng Cai, Jie Chen, Fang Deng, Beng Chin Ooi, Wenqiao Zhang

机构 * School of Automation and the National Key Laboratory of Autonomous Intelligent Unmanned Systems, Beijing Institute of Technology(自动化学院和自主智能无人系统国家重点实验室,北京理工大学) School of Computing, National University of Singapore(computing 学院,新加坡国立大学) Harbin Institute of Technology(哈尔滨工业大学) Digital Media Computing & Design Lab, Zhejiang University(数字媒体计算与设计实验室,浙江大学)

AI总结 本文提出DyMETER框架,通过动态概念适应机制提升在线异常检测的适应性与效率,采用超网络生成实例感知参数位移,并引入轻量级进化控制器和动态阈值优化模块以实现鲁棒和可解释的适应。

Comments Accepted by IEEE TPAMI

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22737 2026-04-22 cs.CV

Lingua-SafetyBench: A Benchmark for Safety Evaluation of Multilingual Vision-Language Models

Lingua-SafetyBench: 一个多语言视觉-语言模型安全评估基准

Enyi Shi, Pengyang Shao, Yanxin Zhang, Chenhang Cui, Jiayi Lyu, Xiaobo Xia, Fei Shen, Tat-Seng Chua

机构 * School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院) School of Computer Science, University of Wisconsin–Madison(威斯康星大学麦迪逊分校计算机科学系) School of Engineering Science, University of the Chinese Academy of Sciences(中国科学院工程科学学院) NExT++ Research Centre, National University of Singapore(新加坡国立大学NExT++研究中心)

AI总结 本文提出Lingua-SafetyBench,通过10万多个多语言图像-文本对评估多模态模型的安全性,发现非高资源语言和非拉丁文在文本主导风险下安全性更差,强调需要专门的语言和模态对齐策略以提升安全性和公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22673 2026-04-22 cs.AI

Beyond Itinerary Planning-A Real-World Benchmark for Multi-Turn and Tool-Using Travel Tasks

超越行程规划——多轮和工具使用旅行任务的现实世界基准

Xiang Cheng, Yulan Hu, Xiangwen Zhang, Lu Xu, Lide Tan, Zheng Pan, Xin Li, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学光林人工智能学院) National University of Singapore(新加坡国立大学) Beihang University(北航) AMAP, Alibaba Group(阿里云实验室)

AI总结 本文提出TravelBench,一个现实世界旅行规划基准,通过多轮对话和工具使用评估LLM的独立解决问题、隐含偏好获取和能力边界识别能力。

Comments Accepted to the ACL 2026 Main Conference. Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21794 2026-04-22 cs.GT cs.AI cs.LG cs.MA econ.TH

Multi-agent Adaptive Mechanism Design

多智能体自适应机制设计

Qiushi Han, David Simchi-Levi, Renfei Tan, Zishuo Zhao

机构 * Massachusetts Institute of Technology(麻省理工学院) National University of Singapore(新加坡国立大学)

AI总结 本文提出一种自适应机制框架DRAM,通过结合机制设计和在线学习,在未知代理人信念的情况下实现 truthful 报告和成本最优,证明了其在累积遗憾上的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07761 2026-04-22 cs.AI cs.LG

TROJail: Trajectory-Level Optimization for Multi-Turn Large Language Model Jailbreaks with Process Rewards

TROJail: 多轮对话中针对大语言模型的多轮攻击优化

Xiqiao Xiong, Ouxiang Li, Zhuo Liu, Moxin Li, Wentao Shi, Fengbin Zhu, Qifan Wang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meta AI

AI总结 本文提出TROJail,通过多轮强化学习优化攻击策略,引入过程奖励提升攻击成功率,实验显示在多个模型和基准上效果显著。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01687 2026-04-22 cs.CL

StochasTok: Improving Fine-Grained Subword Understanding in LLMs

StochasTok:提升大语言模型的细粒度子词理解

Anya Sims, Thom Foster, Klara Kaleb, Tuan-Duy H. Nguyen, Joseph Lee, Jakob N. Foerster, Yee Whye Teh, Cong Lu

机构 * FLAIR, University of Oxford(FLAIR,牛津大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) University of British Columbia(不列颠哥伦比亚大学)

AI总结 本文提出StochasTok,一种高效的随机分词方法,通过在训练中随机分割token,提升LLM在子词层面的任务表现,包括字符计数和数学任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.18275 2026-04-22 cs.CV

Visual Adversarial Attack on Vision-Language Models for Autonomous Driving

面向自动驾驶的视觉对抗攻击研究

Tianyuan Zhang, Lu Wang, Xinwei Zhang, Yitong Zhang, Boyi Jia, Siyuan Liang, Shengshan Hu, Qiang Fu, Aishan Liu, Xianglong Liu

机构 * Beihang University(北航) National University of Singapore(国立新加坡大学) Huazhong University of Science and Technology(华中科技大学)

AI总结 本文提出ADvLM框架,针对自动驾驶中视觉语言模型的特殊需求,解决文本指令变异性和视觉场景时间序列性问题,实现高效对抗攻击。

Comments Accepted by Machine Intelligence Research

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18484 2026-04-21 cs.CV cs.MM cs.RO

XEmbodied: A Foundation Model with Enhanced Geometric and Physical Cues for Large-Scale Embodied Environments

XEmbodied:一种具有增强几何和物理线索的大型规模具身环境基础模型

Kangan Qian, ChuChu Xie, Yang Zhong, Jingrui Pang, Siwen Jiao, Sicong Jiang, Zilin Huang, Yunlong Wang, Kun Jiang, Mengmeng Yang, Hao Ye, Guanghao Zhang, Hangjun Ye, Guang Chen, Long Chen, Diange Yang

机构 * Tsinghua University(清华大学) Automotive and Robotics, Xiaomi Corporation(小鹏汽车与机器人部,小鹏科技) National University of Singapore(新加坡国立大学) McGill University(麦吉尔大学) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

AI总结 XEmbodied通过整合3D几何表示和物理线索,提升视觉-语言-动作模型在大规模具身环境中的空间推理和语义理解能力,其在18个公开基准测试中表现出色。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18463 2026-04-21 cs.AI cs.LG cs.RO

Using large language models for embodied planning introduces systematic safety risks

使用大型语言模型进行具身规划引入了系统性的安全风险

Tao Zhang, Kaixian Qu, Zhibin Li, Jiajun Wu, Marco Hutter, Manling Li, Fan Shi

机构 * ETH Zurich(苏黎世联邦理工学院) University College London(伦敦大学学院) Stanford University(斯坦福大学) Northwestern University(西北大学) National University of Singapore(新加坡国立大学)

AI总结 研究评估了大型语言模型在机器人规划中的安全性,发现即使规划能力高,安全风险仍显著存在,揭示了规划能力与安全意识之间的乘法关系。

Comments Project page: https://despite-safety.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18240 2026-04-21 cs.AI

AJ-Bench: Benchmarking Agent-as-a-Judge for Environment-Aware Evaluation

AJ-Bench:用于环境感知评估的代理作为裁判基准测试

Wentao Shi, Yu Wang, Yuyang Zhao, Yuxin Chen, Fuli Feng, Xueyuan Hao, Xi Su, Qi Gu, Hui Su, Xunliang Cai, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学) Meituan(美团)

AI总结 AJ-Bench通过三个领域155个任务评估代理作为裁判的能力,揭示了基于代理的验证方法在信息获取和过程验证中的性能提升及挑战。

Comments Accepted to ACL 2026 Findings. 43 pages total, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18203 2026-04-21 cs.CL

Multiplication in Multimodal LLMs: Computation with Text, Image, and Audio Inputs

多模态大语言模型中的乘法:文本、图像和音频输入的计算

Samuel G. Balter, Ethan Jerzak, Connor T. Jerzak

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) National University of Singapore (NUS)(新加坡国立大学)

AI总结 研究多模态大语言模型在处理不同模态下的多数字乘法时的局限性,提出一个受控的多模态乘法基准,通过因子变化数字长度、稀疏性、表示形式和模态,定义算术负载作为总和和非零数字计数的乘积,揭示模型性能与算术负载的关系。

Comments To appear in ACL Findings (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18176 2026-04-21 cs.AI quant-ph

QuantumQA: Enhancing Scientific Reasoning via Physics-Consistent Dataset and Verification-Aware Reinforcement Learning

量子QA:通过物理一致的数据集和验证意识强化学习增强科学推理

Songxin Qu, Tai-Ping Sun, Yun-Jie Wang, Huan-Yu Liu, Cheng Xue, Xiao-Fan Xu, Han Fang, Yang Yang, Yu-Chun Wu, Guo-Ping Guo, Zhao-Yun Chen

机构 * Institute of Advanced Technology, University of Science and Technology of China(中国科学技术大学先进技术研究院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院) School of Physics, University of Science and Technology of China(中国科学技术大学物理学院) School of Electronics and Information Engineering, Anhui University(安徽大学电子与信息工程学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 本文提出量子QA数据集和验证意识奖励模型,通过物理一致的数据集和强化学习提升科学推理能力,实验证明其在科学领域表现优异。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏