arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2360
2607.21067 2026-07-24 cs.CL 新提交

PrefReward: Learning User Preference Matrix for Personalized Text Generation

PrefReward:学习用于个性化文本生成的用户偏好矩阵

Yue Wu, Chengbing Wang, Yimeng Bai, Xiaoyan Zhao, Yang Zhang, Fuli Feng

机构 * University of Science and Technology of China(中国科学技术大学) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

AI总结 研究针对大语言模型个性化生成中存在的问题,提出PrefReward框架,通过提取用户特定偏好矩阵并将其作为奖励信号指导生成,实验证明该框架在生成质量和个性化可解释性上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20973 2026-07-24 cs.RO 新提交

Deep Reinforcement-Learning-Guided Model Predictive Control for Preventing Overtakes in Autonomous Racing

深度强化学习引导的模型预测控制在自主赛车中防止超车的应用

Yufei Xi, Yijie Liao, Tulga Ersal

机构 * University of Michigan(密歇根大学) National University of Singapore(新加坡国立大学)

AI总结 研究自主赛车防御性阻挡问题,通过分层强化学习引导的模型预测控制框架,将防御转化为空间占用调节问题。在仿真中提升平均超车时间,减少对手前进距离,使车辆有效利用轮胎力,且求解时间短,支持实时高速对抗。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20935 2026-07-24 cs.CE cs.CL 新提交

Chemical Chain-of-Thought Functions as a Hallucination-Prone Molecular Scratchpad

化学思维链函数作为易产生幻觉的分子草稿本

Jiatong Li, Yuxuan Ren, Weida Wang, Xiaoyong Wei, Yatao Bian

机构 * Blue Whale Lab, National University of Singapore(新加坡国立大学蓝鲸实验室) Hong Kong Polytechnic University(香港理工大学) Fudan University(复旦大学)

AI总结 研究化学推理语言模型中思维链的作用,发现其在多个模型和任务中易产生幻觉且与答案正确性无关,存在共享草稿本功能,如Chem-R依赖SMILES草稿,干扰其草图会影响生成,表明化学CoT是易产生幻觉的分子草稿本,提醒不能仅以CoT判断推理可靠性。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19876 2026-07-23 cs.RO cs.CV 新提交

KineBench: Benchmarking Embodied World Models via IDM-Free Kinematic Grounding

KineBench:通过无逆动力学模型的运动学基础对具身世界模型进行基准测试

Zeyu Liu, Zhangzhe Zhu, Yang Zhang, Chenyou Fan, Chenjia Bai, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(中国电信人工智能研究院) National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Tsinghua University(清华大学) Shenzhen Research Institute of Northwestern Polytechnical University(西北工业大学深圳研究院)

AI总结 研究旨在评估具身世界模型物理一致性,提出无逆动力学模型的KineBench基准测试。利用级联视觉基础模型提取姿态,在物理模拟器中闭环验证,纳入运动学指标,基于ManiSkill3的任务评估EWMs,揭示任务复杂度受限的非线性缩放,为数据缩放策略提供指导。

Comments Accept to ECCV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20205 2026-07-23 stat.ML cs.LG math.ST stat.TH 新提交

Statistical Inference for Rank Allocation in Low-Rank Adaptation

低秩适应中秩分配的统计推断

Yihang Gao, Vincent Y. F. Tan

机构 * Department of Mathematics, National University of Singapore(数学系,新加坡国立大学) Department of Mathematics and Department of Electrical and Computer Engineering, National University of Singapore(数学系和电气与计算机工程系,新加坡国立大学)

AI总结 研究低秩适应中在固定参数预算下分配秩资源的问题,提出StatLoRA方法,将其表述为统计假设检验问题,通过检验统计量和p值确定组件取舍,实验表明该方法在匹配秩预算下性能良好,支持了分配规则稳定性及渐近理论。

Comments 77 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19786 2026-07-23 math.NA cs.LG cs.NA 新提交

A Structure-Adaptive Random Feature Method for High-Dimensional Elliptic PDEs

一种用于高维椭圆型偏微分方程的结构自适应随机特征方法

Jiale Linghu, Hao Dong, Yangshuai Wang

机构 * School of Mathematics and Statistics, Xidian University(西安电子科技大学数学与统计学学院) National University of Singapore(新加坡国立大学)

AI总结 该研究针对高维椭圆型偏微分方程,提出分层方差分析随机特征方法(HA-RFM),通过选择坐标块、识别低秩特征等步骤,建立误差界并推导相关保证,在随机岭测试等方面有显著效果,扩展了半线性计算维度并描绘了坐标族。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16577 2026-07-22 cs.CV cs.GR 版本更新

CNS-Edit++: Category-Agnostic 3D Editing with Coupled Neural Shape Representation

CNS-Edit++:基于耦合神经形状表示的类别无关3D编辑

Jingyu Hu, Weilong Yan, Zhengzhe Liu, Haipeng Li, Ka-Hei Hui, Hao Zhang, Chi-Wing Fu

机构 * The Chinese University of Hong Kong(香港中文大学) Lingnan University(岭南大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology(香港科技大学) Autodesk AI Lab(欧特克人工智能实验室) Simon Fraser University(西蒙弗雷泽大学)

AI总结 研究提出基于耦合神经形状表示和神经特征体积优化的潜在空间3D形状编辑框架CNS-Edit++,能在特定类别和类别无关模型上实例化,有多种编辑操作符及区域控制机制,经评估其性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18228 2026-07-21 cs.AI cs.CL 新提交

Logical Judgments Under Pressure: Diagnosing Syllogistic Stability with Learned Soft Prefixes

压力下的逻辑判断:用学习到的软前缀诊断三段论稳定性

Brian K Chen

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究在三段论推理基准前加软前缀,探究学习到的上下文压力对模型逻辑判断的影响,发现软前缀能改变正确答案,在多模型测试中效果优于随机对照,主要影响是答案偏好,不同模型有显著差异。

Comments 41 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18072 2026-07-21 cs.LG cs.AI 新提交

SGN: A Similarity-based Generative Network for Data Generation under Distribution Shift

SGN:一种用于分布偏移下数据生成的基于相似度的生成网络

Jiaqi Zhu, Xincheng Chen, Yuncheng Wu, Zhaojing Luo, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) Beijing Institute of Technology(北京理工大学) Zhejiang University(浙江大学)

AI总结 研究分布偏移下数据生成问题,提出基于相似度的生成网络SGN,在源数据训练后无需参数更新用于新目标域,通过学习潜在空间和利用目标域小代表性集,实现目标引导数据增强,实验验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16873 2026-07-21 cs.CV 新提交

InfoDense: Density-Aware Regional Decisive Replay for Memory-Efficient Incremental Face Forgery Detection

InfoDense:用于内存高效增量式人脸伪造检测的密度感知区域决定性重放

Jikang Cheng, Hao Shen, Xueyi Zhang, Guangcheng Wang, Zhongyuan Wang, Renye Yan, Baojin Huang

机构 * Huazhong Agricultural University(华中农业大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Nantong University(南通大学) Wuhan University(武汉大学)

AI总结 针对人脸伪造技术发展带来的检测挑战及传统方法的问题,提出密度感知区域决定性重放策略InfoDense,通过定位决定性补丁、排序候选片段、自适应合并样本等步骤,有效减轻灾难性遗忘,提升跨域泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16806 2026-07-21 cs.RO 新提交

Token-Wise Latent Streaming from Slow Reasoners to Fast Planners for Dynamic Vision Language Navigation

用于动态视觉语言导航的从慢速推理器到快速规划器的逐令牌潜在流

Tianshuai Hu, Yangyi Zhong, Zeying Gong, Lingdong Kong, Xiaodong Mei, Guoyang Zhao, Xiaolu Liu, Song Wang, Rong Li, Junwei Liang

机构 * The Hong Kong University of Science and Technology(香港科技大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 针对动态视觉语言导航中语言推理慢与规划需即时的矛盾,提出SPARK-VLN双系统框架,通过三个模块将慢速VLM推理器知识流到快速规划器,引入新基准套件,提高了导航成功率、社会合规性及推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16303 2026-07-21 cs.CV cs.AI 新提交

Med-OPD: Improving Medical Vision-Language Models via Evidence-Aware On-Policy Distillation

Med-OPD:通过证据感知策略蒸馏改进医学视觉语言模型

Yunhang Qian, Jiaquan Yu, Jiawei Liu, Meng Wang, Hongwei Bran Li, Xiaobin Hu

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 研究针对医学视觉语言模型依赖语言先验而非视觉证据推理的问题,提出Med-OPD框架,引入医学证据优势信号,在令牌和轨迹级别重新分配蒸馏信号,实验证明该方法能加强模型对关键视觉证据的依赖,提升多模态医学推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16295 2026-07-21 cs.CV cs.AI 新提交

Emergent Hierarchical Monosemantic Neurons from the Group-Contrastive Forward-Forward Algorithm

基于群对比前向算法的涌现分层单语义神经元

Yiming Tang, Qinglin Qi, Zhaoqian Yao, Harshvardhan Saini, Dianbo Liu

机构 * National University of Singapore(新加坡国立大学) Lund University(隆德大学) Chinese University of Hong Kong(香港中文大学) Indian Institute of Technology, Dhanbad(印度理工学院(丹巴德分校))

AI总结 研究探讨神经网络表示的可解释性,针对稀疏字典学习范式的局限,提出群对比前向算法GCFF,通过架构约束实现单语义性,能捕捉非线性概念,在CLIP表示上表现良好,还能从头训练网络并在图像分类基准中达最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16251 2026-07-21 cs.LG 新提交

Learning Spatio-Temporal Foundation Models from Pure Synthetic Data

从纯合成数据中学习时空基础模型

Yutong Feng, Shiyuan Piao, Yutong Xia, Xu Liu, Wenqi Fan, Fugee Tsung, See-Kiong Ng, Yuxuan Liang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) National University of Singapore(新加坡国立大学) Hong Kong University of Science and Technology(香港科技大学) Hong Kong Polytechnic University(香港理工大学)

AI总结 研究旨在学习时空基础模型,提出NeoST,通过在程序生成的合成系统上预训练,引入可扩展语料库、潜在空间推理架构和目标,实验证明其在多样真实世界时空系统中性能优越,有长期稳定性和推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17469 2026-07-21 cs.CC cond-mat.stat-mech cs.LG math.CO math.PR 新提交

The Dimension of Nonterminating Resampling Computations

非终止重采样计算的维度

Yunbei Xu

机构 * National University of Singapore(新加坡国立大学)

AI总结 研究非终止重采样计算的维度,通过主定理界定相关量,探讨源幂信息,分析不同修复规则及\(k\)-SAT 等情况,得出有限磁带源下规则的非终止维度差异、\(k\)-SAT 终止条件及公式维度界等结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04438 2026-07-21 cs.CV cs.AI cs.HC cs.MA cs.MM 版本更新

ResearchStudio-Reel: Automate the Last Mile of Research from Paper to Poster, Video, and Blog

ResearchStudio-Reel:实现从论文到海报、视频和博客的研究最后一公里自动化

Lingao Xiao, Yalun Dai, Yangyu Huang, Qihao Zhao, Wenshan Wu, Hugo He, Ruishuo Chen, Jin Jiang, Qianli Ma, Jiahuan Zhang, Xin Zhang, Ying Xin, Yang Ou, Yan Xia, Scarlett Li, Longbo Huang, Zhipeng Zhang, Yang He, Yap Kim Hui, Yan Lu

机构 * Microsoft Research(微软研究院) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Westlake University(西湖大学) CFAR, A*STAR(计算科学与工程研究所,新加坡科技研究局)

AI总结 研究传播自动化困难,以往方法有局限。该研究提出将最后一公里构建为技能组合,实例化ResearchStudio-Reel,包括共享提取器、可编辑生成器和交互式收敛层,能产出多种可编辑工件,效果优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00573 2026-07-21 cs.CV 版本更新

BrainFIBRE: A Foundation Model via Information Decomposition for Brain Microstructure

BrainFIBRE:基于信息分解的脑微结构基础模型

Zijian Dong, Yi Lin, Fang Ji, Jianxiong Zhou, Kwun Kei Ng, Juan Helen Zhou

机构 * National University of Singapore(新加坡国立大学)

AI总结 提出BrainFIBRE,首个脑微结构基础模型,通过自监督部分信息分解(SPID)和反事实候选构建(CCC)从NODDI图谱中解缠独特、协同和冗余信息,在多种预测任务上达到最优性能。

Comments ECCV 2026. Author name corrected in V2

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25325 2026-07-21 cs.AI 版本更新

Omni-Perception Policy Optimization for Multimodal Emotion Reasoning

全模态感知策略优化用于多模态情感推理

Zhiyuan Han, Beier Zhu, Wenwen Tong, Pengyang Shao, Peipei Song, Xinyi Wang, Jiangnan Chen, Lewei Lu, Xun Yang

机构 * University of Science and Technology of China(中国科学技术大学) SenseTime Research(商汤科技研究院) National University of Singapore(新加坡国立大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合性国家科学中心人工智能研究院)

AI总结 提出OPPO强化学习框架,通过全模态感知奖励和损失优化多模态感知,提升情感推理中模态利用率和忠实度,在多个基准上达到最优。

Comments Accepted at ICML 2026. Project page: https://zjycutieee.github.io/OPPO-page/ Code: https://github.com/ZhiyuanHan-Aaron/OPPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12995 2026-07-21 cs.RO 版本更新

GenHOI: Contact-Aware Humanoid-Object Interaction by Imitating Generated Videos without Task-Specific Training

GenHOI: 通过模仿生成视频实现接触感知的人形机器人-物体交互,无需任务特定训练

Zhihai Bi, Qiang Zhang, Guoyang Zhao, Jiahang Cao, Xueyin Luo, Yushan Zhang, Jinglan Xu, Ruoyu Geng, Yulin Li, Andrew F. Luo, Jun Ma

机构 * The University of Tokyo(东京大学) National University of Singapore(新加坡国立大学) University of California, Los Angeles(加州大学洛杉矶分校) Tsinghua University(清华大学)

AI总结 提出GenHOI框架,通过模仿单个生成视频实现人形机器人零样本执行多种物体交互任务,无需任务特定训练或物理演示数据,利用接触事件和手-物接触区域编码为几何约束优化轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01167 2026-07-21 cs.AI

Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models

所有个体层都有帮助吗?视觉-语言模型中任务干扰层的实证研究

Zhiming Liu, Yujie Wei, Lei Feng, Xiu Su, Xiaobo Xia, Weili Guan, Zeke Xie, Shuo Yang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Harbin Institute of Technology(哈尔滨工业大学) Southeast University(东南大学) Central South University(中南大学) National University of Singapore(新加坡国立大学) The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州))

AI总结 研究通过层干预发现部分层阻碍下游任务,提出任务自适应层剔除方法提升性能,揭示预训练VLM的意外模块化特性。

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings, 2026, pp. 9597-9607

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17356 2026-07-21 cs.AI cs.LG 版本更新

Comprehend, Divide, and Conquer: Feature Subspace Exploration via Multi-Agent Hierarchical Reinforcement Learning

理解、划分与征服:通过多智能体分层强化学习进行特征子空间探索

Weiliang Zhang, Xiaohan Huang, Yi Du, Ziyue Qiao, Qingqing Long, Zhen Meng, Yuanchun Zhou, Meng Xiao

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Chinese Academy of Sciences(中国科学院大学) Great Bay University(Great Bay大学) Duke-NUS Medical School, National University of Singapore(新加坡国立大学杜克-奈素医学院)

AI总结 研究针对特征选择问题,提出HRLFS方法,先利用基于大语言模型的混合状态提取器捕捉特征特性并聚类,构建分层智能体,通过多智能体分层强化学习进行特征子空间探索,提升了下游机器学习性能并加速运行

Comments 25 pages, keywords: Automated Feature Engineering, Tabular Dataset, Multi-Agent Reinforcement Learning, Feature Selection, Accepted by ACM Transactions on Knowledge Discovery from Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.07691 2026-07-21 cs.CL cs.LG 版本更新

Breaking the Block: Preserving Data Continuity to Train Superior SAEs for Instruct Models

打破模块限制:保留数据连续性以训练用于指令模型的卓越稀疏自编码器

Jiaming Li, Haoran Ye, Yukun Chen, Xinyue Li, Lei Zhang, Hamid Alinejad-Rokny, Jimmy Chih-Hsien Peng, Min Yang

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, China(中国科学院深圳先进技术研究所) University of Chinese Academy of Sciences, China(中国科学院大学) National University of Singapore, Singapore(新加坡国立大学) The University of New South Wales, Australia(新南威尔士大学) Shenzhen University of Advanced Technology, China(深圳先进技术大学)

AI总结 研究针对现有SAEs训练方法在指令模型中因注意力泄漏引入梯度噪声问题,提出FAST顺序训练范式,通过与数据分布和激活模式对齐,提升重建保真度和特征可解释性,实验显示该方法效果显著优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15808 2026-07-20 cs.CV 新提交

Examining the Associations between Visual and Non-Visual Elements and Cyclists' Route Choices for Various Trip Purposes

研究视觉与非视觉元素与不同出行目的下骑行者路线选择之间的关联

Heyang Hua, Koichi Ito, Filip Biljecki

机构 * Department of Architecture, National University of Singapore(新加坡国立大学建筑系) Department of Real Estate, National University of Singapore(新加坡国立大学房地产系)

AI总结 研究不同出行目的下骑行者路线选择,通过数据驱动案例研究,分析视觉与非视觉因素对其影响,揭示影响积极骑行的时空特征,为街道网络规划和基础设施发展提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15661 2026-07-20 cs.CV 新提交

Model Merging for Medical LVLMs: A Benchmark and a Winner-Take-All Approach

用于医学视觉语言模型的模型合并:一个基准和一种赢家通吃的方法

Lichao Mou, Shilan Zhang, Chunlei Li, Bingcong Yan, Jingliang Hu, Yilei Shi, Shengwu Xiong, Xiao Xiang Zhu, Lei Li, Yaxiong Chen

机构 * Wuhan University of Technology(武汉理工大学) Technical University of Munich(慕尼黑工业大学) National University of Singapore(新加坡国立大学)

AI总结 研究医学LVLMs的模型合并,提出涵盖多种成像模态和临床任务类型的MergeMedBench基准,评估现有合并方法,提出赢家通吃方法,该方法简单且无超参数,优于现有方法,为LoRA合并提供新视角和实用基线。

Comments Project Page: https://github.com/MedAI-T/MergeMedBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13020 2026-07-20 cs.LG cs.AI 版本更新

PASs-MoE: Mitigating Misaligned Co-drift among Router and Experts via Pathway Activation Subspaces for Continual Learning

PASs-MoE:通过路径激活子空间减轻路由器与专家之间的错位协同漂移以进行持续学习

Zhiyan Hou, Haiyun Guo, Haokai Ma, Yandu Sun, Yonghui Yang, Jinqiao Wang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) National University of Singapore(新加坡国立大学) Southeast University, Nanjing, China(南京东南大学) Wuhan AI Research, Wuhan, China(武汉人工智能研究院)

AI总结 研究持续指令调整中多模态大语言模型的问题,提出基于路径激活子空间的固定容量PASs - MoE - LoRA方法,含PAS引导的重新加权和PAS感知的秩稳定,实验表明该方法在准确性和抗遗忘性上优于基线和变体且不增参数。

Comments Published in the Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026), Volume 1: Long Papers. 14 pages. Code is available at https://github.com/yueluoshuangtian/PASs-MoE

Journal ref Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), pages 31959--31972, San Diego, California, United States, July 2026. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15268 2026-07-17 cs.CV 新提交

Motion-Conditioned Multi-View Fusion for Myocardial Infarction Localization from Echocardiography

用于超声心动图心肌梗死定位的运动条件多视图融合

Guang Yang, Wentian Xu, Siyu Wang, Betty Raman, Lei Li, Vicente Grau

机构 * University of Oxford(牛津大学) National University of Singapore(新加坡国立大学)

AI总结 针对超声心动图心肌梗死定位问题,提出MCF-Net框架,融合心肌运动线索与基础模型表示,通过极稀疏监督建模心脏运动,利用运动衍生软掩码提供先验,跨视图整合运动和视觉优化预测,在节段级定位上性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15255 2026-07-17 cs.CV 新提交

HoloGeo: Mitigating Landmark Bias in Geo-localization via Evidence-Driven Reasoning

HoloGeo:通过证据驱动推理减轻地理定位中的地标偏差

Pengcheng Zhou, Xuanyu Liu, Yanchen Yin, Bobo Li, Shengqiong Wu, Mong-Li Lee, Wynne Hsu

机构 * National University of Singapore(新加坡国立大学) Shandong University of Science and Technology(山东科技大学) University of Oxford(牛津大学)

AI总结 研究针对视觉语言模型地理定位易受地标偏差影响的问题,提出证据驱动推理框架HoloGeo,借助高质量数据集,通过多维度奖励实现平衡关注与联合推理,经实验验证其在多个数据集上能有效减轻地标偏差,提升地理定位性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15207 2026-07-17 cs.LG cs.RO 新提交

BadWAM: When World-Action Models Dream Right but Act Wrong

BadWAM:当世界-动作模型想得对但做得错时

Qi Li, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

AI总结 研究针对世界-动作模型(WAMs)提出BadWAM框架,用于建模和评估世界-动作漂移攻击,包括仅动作攻击和保持想象攻击,通过不同标准刻画攻击面,评估结果显示能大幅降低任务成功率,揭示WAM漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15092 2026-07-17 cs.CL 新提交

Rubrics on Trial: Evolving Rubrics from a Single Query via Synthetic Pairwise Evidence

试验中的评分标准:通过合成成对证据从单个查询中演化评分标准

Haocheng Yang, Licheng Pan, Xiaoxi Li, Zhichao Chen, Zhiheng Zhang, Yuan Lu, Haoxuan Li, Hao Wang

机构 * School of Computing, National University of Singapore(新加坡国立大学计算学院) Xiaohongshu Inc.(小红书公司) School of Cyber Science and Technology, Zhejiang University(浙江大学网络空间安全学院) School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院) School of Statistics and Data Science, Shanghai University of Finance and Economics(上海财经大学统计与数据科学学院) Institute for Artificial Intelligence, Peking University(北京大学人工智能研究院)

AI总结 研究针对构建可靠特定查询评分标准难的问题,提出“试验中的评分标准”框架,仅从查询演化评分标准集,靠合成响应对获取监督并验证,实验证明该框架有效,平均准确率最佳且在多数评估集领先。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14673 2026-07-17 cs.AI cs.HC 新提交

Project Kaleidoscope: Contextual, Human-Aligned Evaluation for Real-World AI Applications

万花筒计划:面向现实世界人工智能应用的情境化、符合人类需求的评估

Leanne Tan, Rohan Jaggi, Shaun Khoo, Roy Ka-Wei Lee

机构 * GovTech(新加坡政府科技局) National University of Singapore(新加坡国立大学) University of British Columbia(英属哥伦比亚大学)

AI总结 该项目旨在解决现实世界AI应用评估瓶颈,提出万花筒计划,通过集成基于角色的测试生成、情境化评分标准和人工审查,实现可靠性门控自动评分,经试点和实验验证了其在端到端可靠自动评分方面的有用特征。

详情

展开后加载摘要…

URL PDF HTML 收藏