arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

National University of Singapore(新加坡国立大学)

共收录 2370
2604.18135 2026-04-21 cs.CV cs.AI cs.LG

Soft Label Pruning and Quantization for Large-Scale Dataset Distillation

大规模数据集蒸馏中的软标签剪枝与量化

Xiao Lingao, Yang He

机构 * CFAR, Agency for Science, Technology and Research, Singapore(新加坡科技研究局应用科学与技术研究院) IHPC, Agency for Science, Technology and Research, Singapore(新加坡科技研究局信息与通信技术研究院) National University of Singapore(新加坡国立大学)

AI总结 本文提出LPQLD方法,通过增强图像多样性与监督多样性,减少软标签存储量并提升准确率,适用于大规模数据集蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18031 2026-04-21 cs.CL cs.LG q-bio.BM

How Creative Are Large Language Models in Generating Molecules?

大语言模型在生成分子时的创造性如何?

Wen Tao, Yiwei Wang, Peng Zhou, Bryan Hooi, Wanlong Fang, Tianle Zhang, Xiao Luo, Yuansheng Liu, Alvin Chan

机构 * Nanyang Technological University(南洋理工大学) University of California, Merced(加州大学默塞德分校) Hunan University(湖南大学) National University of Singapore(新加坡国立大学)

AI总结 研究通过系统实证评估,分析大语言模型在分子生成中的创造性行为,揭示其在不同约束下的表现,首次将分子生成能力重新定义为创造性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17880 2026-04-21 cs.RO cs.CV

ST-$π$: Structured SpatioTemporal VLA for Robotic Manipulation

ST-$π$: 结构化时空VLA用于机器人操作

Chuanhao Ma, Hanyu Zhou, Shihan Peng, Yan Li, Tao Gu, Luxin Yan

机构 * School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(华中科技大学人工智能与自动化学院) School of Computing, National University of Singapore(新加坡国立大学计算机学院) School of Computing, Macquarie University(麦考瑞大学计算机学院)

AI总结 本文提出ST-$π$模型,通过结构化时空视觉语言模型和动作专家,解决机器人操作中精细时空推理问题,同时引入结构化时空标注数据集进行训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08364 2026-04-21 cs.CV

MegaStyle: Constructing Diverse and Scalable Style Dataset via Consistent Text-to-Image Style Mapping

MegaStyle: 通过一致的文本到图像风格映射构建多样化和可扩展的风格数据集

Junyao Gao, Sibo Liu, Jiaxing Li, Yanan Sun, Yuanpeng Tu, Fei Shen, Weidong Zhang, Cairong Zhao, Jun Zhang

机构 * Tencent(腾讯) Nanyang Technological University(南洋理工大学) Hong Kong University of Science and Technology(香港科技大学) Fuzhou University(福州大学) University of Hong Kong(香港大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出MegaStyle数据集,通过现有大生成模型的一致文本到图像风格映射能力,构建了包含170k风格提示和400k内容提示的多样化数据集,并提出风格监督对比学习方法和FLUX风格迁移模型。

Comments project website https://jeoyal.github.io/MegaStyle/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18731 2026-04-21 cs.CL cs.AI

One Adapts to Any: Meta Reward Modeling for Personalized LLM Alignment

一个适应任何:面向个性化大语言模型对齐的元奖励建模

Hongru Cai, Yongqi Li, Tiezheng Yu, Fengbin Zhu, Wenjie Wang, Fuli Feng, Wenjie Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Huawei Technologies Ltd.(华为技术有限公司) National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

AI总结 本文提出元奖励建模(MRM)方法,通过元学习框架优化奖励模型初始化,提升个性化对齐的效率与鲁棒性,实验表明其在少样本场景下表现优异。

Comments Accepted by SIGIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10531 2026-04-21 cs.LG

Projected Coupled Diffusion for Test-Time Constrained Joint Generation

投影耦合扩散用于测试时间受限的联合生成

Hao Luan, Yi Xian Goh, See-Kiong Ng, Chun Kai Ling

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) Faculty of Computer Science and Information Technology, Universiti Malaya(马来亚大学计算机科学与信息技术学院) Institute of Data Science, National University of Singapore(新加坡国立大学数据科学研究所)

AI总结 本文提出投影耦合扩散(PCD),一种用于受限联合生成的测试时间框架,通过耦合指导项促进扩散模型协调,并在每个扩散步骤中引入投影步骤以强制硬约束,实验证明其在图像对生成、物体操作和多机器人运动规划中的有效性。

Comments ICLR 2026. OpenReview: https://openreview.net/forum?id=1FEm5JLpvg. Code: https://github.com/EdmundLuan/pcd

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21248 2026-04-21 cs.CL cs.AI cs.CE

ResearchBench: Benchmarking LLMs in Scientific Discovery via Inspiration-Based Task Decomposition

ResearchBench: 通过基于灵感的任务分解对LLM在科学发现中的基准测试

Yujie Liu, Zonglin Yang, Tong Xie, Jinjie Ni, Ben Gao, Yuqiang Li, Shixiang Tang, Wanli Ouyang, Erik Cambria, Dongzhan Zhou

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文提出ResearchBench,首个评估LLM在科学发现子任务中的基准,包含灵感检索、假设生成和排序,通过自动化框架提取跨12学科论文的关键信息,验证其准确性,并展示LLM在非分布任务中表现优异。

Comments Accepted by ACL 2026 (findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17513 2026-04-21 cs.RO

FLASH: Fast Learning via GPU-Accelerated Simulation for High-Fidelity Deformable Manipulation in Minutes

FLASH:通过GPU加速模拟实现高效的高保真变形操纵

Siyuan Luo, Bingyang Zhou, Chong Zhang, Xin Liu, Zhenhao Huang, Gang Yang, Zhengtao Han, Xiaotian Hu, Eric Yang, Rymon Yu, Ziqiu Zeng, Fan Shi

机构 * NUS Human-Centered Robotic Lab(国立新加坡大学人本机器人实验室) ETH(苏黎世联邦理工学院) ShanghaiTech University(上海科技大学) Independent Researcher(独立研究者) Gradient

AI总结 FLASH通过GPU加速模拟实现高效变形操纵,利用NCP求解器在单个RTX 5090上支持30 FPS处理300万自由度,基于合成数据训练的策略实现零样本仿真到现实转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17503 2026-04-21 cs.AI cs.MA

SkillGraph: Self-Evolving Multi-Agent Collaboration with Multimodal Graph Topology

SkillGraph: 基于多模态图拓扑的自进化多智能体协作

Zheng Nie, Ruolin Shen, Xinlei Yu, Bo Yin, Jiangning Zhang, Xiaobin Hu

机构 * National University of Singapore, Singapore(新加坡国立大学) Technical University of Munich, Munich, Germany(慕尼黑技术大学) Zhejiang University, China(浙江大学)

AI总结 SkillGraph通过联合进化智能体能力与通信拓扑,解决视觉多智能体系统中固定拓扑和静态推理能力的问题,提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17312 2026-04-21 cs.LG cs.AI

A Survey of Reinforcement Learning for Large Language Models under Data Scarcity: Challenges and Solutions

面向大数据稀缺性的大型语言模型强化学习综述:挑战与解决方案

Zhiyin Yu, Yuchen Mou, Juncheng Yan, Junyu Luo, Chunchun Chen, Xing Wei, Yunhui Liu, Hongru Sun, Yuxing Zhang, Jun Xu, Yatao Bian, Ming Zhang, Wei Ye, Tieke He, Jie Yang, Guanjie Zheng, Zhonghai Wu, Bo Zhang, Lei Bai, Xiao Luo

机构 * Peking University(北京大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) Nankai University(南开大学) Tongji University(同济大学) Nanjing University(南京大学) University of Wollongong(沃林根大学) Shanghai Jiao Tong University(上海交通大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 本文综述了在数据稀缺条件下大型语言模型强化学习的挑战与解决方案,提出三级框架,梳理现有方法并分析其优劣,为高效强化学习提供理论基础。

Comments Accepted to ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10741 2026-04-21 cs.CL cs.AI cs.IR

Deep-Reporter: Deep Research for Grounded Multimodal Long-Form Generation

Deep-Reporter:基于多模态长形式生成的深度研究

Fangda Ye, Zhifei Xie, Yuxin Hu, Yihang Yin, Shurui Huang, Shikai Dong, Jianzhu Bao, Shuicheng Yan

机构 * National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学) University of Edinburgh(爱丁堡大学) Beijing Institute of Technology(北京理工大学)

AI总结 本文提出Deep-Reporter框架,通过多模态搜索、检查清单引导合成和上下文管理,解决多模态长形式生成中的整合与选择难题,通过8K高质量数据集和M2LongBench测试集验证其有效性。

Comments 41 pages, 6 figures, 8 tables. Code available at https://github.com/fangda-ye/Deep-Report. v2: corrected typos and updated experimental results

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11161 2026-04-21 cs.HC cs.CL

Althea: Human-AI Collaboration for Fact-Checking and Critical Reasoning

Althea:面向事实核查和批判性推理的人机协作

Svetlana Churina, Kokil Jaidka, Anab Maulana Barik, Harshit Aneja, Cai Yang, Wynne Hsu, Mong Li Lee

机构 * Centre for Trusted Internet & Community (CTIC)(可信互联网与社区中心) National University of Singapore (NUS)(新加坡国立大学)

AI总结 Althea通过整合问题生成、证据检索和结构化推理,提升在线主张的核查效率与准确性,其在AVeriteC基准测试中达到宏F1值0.44,且在用户研究中显示指导性交互对短期准确性和长期改进均有显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18231 2026-04-21 cs.LG cs.AI

Rethinking Cross-Modal Fine-Tuning: Optimizing the Interaction Between Feature Alignment and Target Fitting

重新思考跨模态微调:优化特征对齐与目标拟合之间的交互

Trong Khiem Tran, Manh Cuong Dao, Phi Le Nguyen, Thao Nguyen Truong, Trong Nghia Hoang

机构 * Washington State University(华盛顿州立大学) National University of Singapore(新加坡国立大学) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院) Hanoi University of Science and Technology(河内科学技术大学)

AI总结 本文提出一种原理性框架,通过特征-标签扭曲概念解释特征对齐与目标拟合的交互,建立目标误差的可证明泛化界,提升跨模态微调性能。

Comments Accepted AISTATS 20226

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04745 2026-04-21 cs.AI cs.IR

KnowMe-Bench: Benchmarking Person Understanding for Lifelong Digital Companions

KnowMe-Bench:为终身数字伴侣的人理解进行基准测试

Tingyu Wu, Zhisheng Chen, Ziyan Weng, Shuhe Wang, Chenglong Li, Shuo Zhang, Sen Hu, Silin Wu, Qizhen Lan, Huacan Wang, Ronghao Chen

机构 * UCAS(中国科学院大学) QuantaAlpha PKU(北京大学) CITYU-DG(城市大学-数据科学) HAINNU(海南师范大学) UTHealth(德克萨斯大学健康科学中心) NUS(新加坡国立大学) IAPM (Guangdong)(粤港澳大湾区人工智能研究院)

AI总结 KnowMe-Bench通过长篇自传式叙述构建,评估模型在事实记忆、主观状态归因和原则推理方面的能力,揭示检索增强系统在时间相关解释和高层推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13674 2026-04-21 cs.CL cs.AI

PrefixMemory-Tuning: Modernizing Prefix-Tuning by Decoupling the Prefix from Attention

PrefixMemory-Tuning: 通过解耦前缀与注意力来现代化前缀微调

Haonan Wang, Brian Chen, Siquan Li, Xinhe Liang, Hwee Kuan Lee, Kenji Kawaguchi, Tianyang Hu

机构 * National University of Singapore(新加坡国立大学) Bioinformatics Institute, A*STAR(A*STAR生物信息研究所) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

AI总结 本文提出PrefixMemory-Tuning,通过将前缀模块移出注意力头以提升表达能力,实验证明其在多个基准上优于传统前缀微调方法,并在通用任务中表现接近现代PEFT技术。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15315 2026-04-21 cs.LG

Tight Clusters Make Specialized Experts

紧密集群成为专门专家

Stefan K. Nielsen, Rachel S. Y. Teo, Laziz U. Abdullaev, Tan M. Nguyen

机构 * FPT Software AI Center(FPT软件人工智能中心) National University of Singapore(新加坡国立大学) Department of Mathematics(数学系)

AI总结 本文提出适应性聚类路由器,通过优化特征权重提升MoE模型的收敛速度、数据鲁棒性和整体性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16935 2026-04-21 cs.AI cs.CY cs.HC cs.LG cs.SI

LLMs can persuade only psychologically susceptible humans on societal issues, via trust in AI and emotional appeals, amid logical fallacies

LLMs只能通过信任AI和情感诉求说服心理上易受影响的人群在社会问题上的观点,尽管存在逻辑谬误

Alexis Carrillo, Salvatore Citraro, Ali Aghazhadeh Ardebili, Enrique Taietta, Giulio Rossetti, Emilio Ferrara, Giuseppe Alessandro Veltri, Massimo Stella

机构 * organization= CogNosco Lab, Department of Psychology Cognitive Science, University of Trento , city= Rovereto , country= Italy organization= Institute of Information Science Technologies ``Alessandro Faedo", National Research Council , country= Italy organization= Thomas Lord Department of Computer Science, University of Southern California , city= Los Angeles , state= California , country= USA organization= Department of Sociology Social Research, University of Trento , city= Trento , country= Italy organization= Centre for Behavioural Implementation Sciences in Medicine (BISI), National University of Singapore , city= Singapore , country= Singapore

AI总结 本文通过Talk2AI框架研究LLM在时间演变的心理框架下对社会议题的说服力,发现人类对AI的可信度和情感诉求影响其观点变化,同时揭示了逻辑谬误在说服过程中的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16584 2026-04-21 cs.SE cs.AI cs.PL

Certified Program Synthesis with a Multi-Modal Verifier

带有多模验证器的认证程序合成

Yueyang Feng, Dipesh Kafle, Vladimir Gladshtein, Vitaly Kurin, George Pîrlea, Qiyuan Zhao, Peter Müller, Ilya Sergey

机构 * National University of Singapore(新加坡国立大学) Neapolis University Pafos(纳皮奥斯大学帕福斯)

AI总结 本文提出LeetProof,通过多模验证器解决认证程序合成中的规范缺陷和验证模式碎片化问题,实现更高效的全认证解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16493 2026-04-21 cs.DB cs.AI cs.CL cs.LG

NL2SQLBench: A Modular Benchmarking Framework for LLM-Enabled NL2SQL Solutions

NL2SQLBench: 一个模块化评估和基准测试框架,用于LLM驱动的NL2SQL解决方案

Shizheng Hou, Wenqi Pei, Nuo Chen, Quang-Trung Ta, Peng Lu, Beng Chin Ooi

机构 * National University of Singapore(新加坡国立大学) Zhejiang University(浙江大学)

AI总结 本文提出NL2SQLBench框架,用于评估LLM驱动的NL2SQL方法,通过三个核心模块分析现有策略并提出新指标,评估十种开源方法,揭示现有方法的准确性和效率问题,为未来创新提供指导。

Comments The paper is accepted by VLDB 2026

Journal ref PVLDB, 19(5): 1001 - 1015, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16385 2026-04-21 cs.SE cs.AI

StressWeb: A Diagnostic Benchmark for Web Agent Robustness under Realistic Interaction Variability

StressWeb: 一个用于评估网络代理在现实交互变异下的鲁棒性的诊断基准

Haoyue Bai, Dong Wang, Long Chen, Bingguang Hao, Pengyang Shao, Yonghui Yang, Yicheng He, Chenyi Zhuang

机构 * Inclusion AI, Ant Group(Inclusion AI,蚂蚁集团) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 本文提出StressWeb基准,通过构建可控的网络环境和引入结构化扰动,评估网络代理在现实交互中的鲁棒性,揭示隐藏的失败模式和鲁棒性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20187 2026-04-21 cs.CV

MuSteerNet: Human Reaction Generation from Videos via Observation-Reaction Mutual Steering

MuSteerNet:通过观察-反应相互引导生成人类反应

Yuan Zhou, Yongzhi Li, Yanqi Dai, Xingyu Zhu, Yi Tan, Qingshan Xu, Beier Zhu, Richang Hong, Hanwang Zhang

机构 * Nanyang Technological University(南洋理工大学) National University of Singapore(新加坡国立大学) Renmin University of China(中国人民大学) University of Science and Technology of China(中国科学技术大学) Hefei University of Technology(合肥工业大学)

AI总结 本文提出MuSteerNet,通过观察-反应相互引导机制生成3D人类动作,解决视频输入对反应生成的引导不足问题,提升反应质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17932 2026-04-21 cs.SE cs.AI

From Charts to Code: A Hierarchical Benchmark for Multimodal Models

从图表到代码:一个多模态模型的分层基准

Jiahao Tang, Henry Hengyuan Zhao, Lijian Wu, Zijian Zhang, Yifei Tao, Dongxing Mao, Yang Wan, Jingru Tan, Min Zeng, Min Li, Alex Jinpeng Wang

机构 * CSU-JPG, Central South University(中南大学CSU-JPG) National University of Singapore(新加坡国立大学) Nanyang Technological University(南洋理工大学)

AI总结 本文提出Chart2Code基准,用于评估大多模态模型的图表理解和代码生成能力,包含三个层级任务,涵盖图表复现、编辑和长表转图表生成,测试了25种最先进的LMMs,结果显示GPT-5在编辑任务中表现不佳,凸显了该基准的挑战性。

Comments This work has been accepted by ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02547 2026-04-21 cs.AI cs.CL

The Landscape of Agentic Reinforcement Learning for LLMs: A Survey

代理强化学习用于大语言模型的景观:综述

Guibin Zhang, Hejia Geng, Xiaohang Yu, Zhenfei Yin, Zaibin Zhang, Zelin Tan, Heng Zhou, Zhongzhi Li, Xiangyuan Xue, Yijiang Li, Yifan Zhou, Yang Chen, Chen Zhang, Yutao Fan, Zihu Wang, Songtao Huang, Francisco Piedrahita-Velez, Yue Liao, Hongru Wang, Mengyue Yang, Heng Ji, Jun Wang, Shuicheng Yan, Philip Torr, Lei Bai

机构 * University of Oxford(牛津大学) Shanghai AI Laboratory(上海人工智能实验室) National University of Singapore(新加坡国立大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Brown University(布朗大学) University College London(伦敦大学学院) University of Science and Technology of China(中国科学技术大学) Imperial College London(伦敦帝国学院) Dalian University of Technology(大连理工大学) Chinese Academy of Sciences(中国科学院) The Chinese University of Hong Kong(香港中文大学) University of Georgia(佐治亚大学) University of California, San Diego(加州大学圣地亚哥分校) University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Bristol(布里斯托大学)

AI总结 本文综述了代理强化学习在大语言模型中的应用,提出双分类体系,探讨其核心能力与应用领域,并强调强化学习在使能力转化为适应性行为中的关键作用。

Comments Published on Transactions on Machine Learning Research: https://openreview.net/forum?id=RY19y2RI1O

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08478 2026-04-21 cs.CV

NullFace: Training-Free Localized Face Anonymization

NullFace: 不需要训练的局部化人脸匿名化

Han-Wei Kung, Tuomas Varanka, Terence Sim, Nicu Sebe

机构 * University of Trento(特伦托大学) University of Oulu(奥卢大学) National University of Singapore(新加坡国立大学)

AI总结 本文提出无需训练的局部化人脸匿名化方法,通过预训练文本到图像扩散模型,在不优化或训练的情况下,实现关键非身份属性的保护,提升图像实用性。

Comments Accepted to the 2026 International Conference on Automatic Face and Gesture Recognition (FG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06543 2026-04-21 cs.AR cs.LG cs.NE eess.SP

SparrowSNN: A Hardware/software Co-design for Energy Efficient ECG Classification

SparrowSNN:面向能源高效心电图分类的软硬件协同设计

Zhanglu Yan, Zhenyu Bai, Tulika Mitra, Weng-Fai Wong

机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院)

AI总结 本文提出SparrowSNN,一种针对边缘设备优化的软硬件协同设计,通过改进的脉冲激活函数、定制化混合ANN-SNN模型和低功耗可重构ASIC架构,在生物医学数据集上实现了20倍至100倍的能耗降低和状态-of-the-art准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.02953 2026-04-21 cs.CR cs.LG

Unraveling the Key of Machine Learning-based Android Malware Detection

解开基于机器学习的Android恶意软件检测的关键

Jiahao Liu, Jun Zeng, Fabio Pierazzi, Ziqi Yang, Lorenzo Cavallaro, Zhenkai Liang

机构 * National University of Singapore(新加坡国立大学) University College London(伦敦大学学院) The State Key Laboratory of Blockchain and Data Security, Zhejiang University(浙江大学区块链与数据安全国家重点实验室) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)

AI总结 本文系统分析了基于机器学习的Android恶意软件检测方法,提出统一分类框架并评估了12种代表性方法,揭示了现有检测器在恶意软件演变和对抗攻击方面的挑战。

Comments Accepted by ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14333 2026-04-20 cs.LG

When Missing Becomes Structure: Intent-Preserving Policy Completion from Financial KOL Discourse

当缺失成为结构:从金融KOL言论中保留意图的策略补全

Yuncong Liu, Yuan Wan, Zhou Jiang, Yao Lu

机构 * National University of Singapore(新加坡国立大学)

AI总结 本文提出一种保留KOL意图的策略补全框架,通过离线强化学习补全未指定的执行决策,实验证明其在YouTube和X平台上的高收益和夏普比率。

Comments Main paper with supplementary material included

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25300 2026-04-20 cs.LG cs.AI

Scaling Behaviors of LLM Reinforcement Learning Post-Training: An Empirical Study in Mathematical Reasoning

LLM强化学习后训练的扩展行为:数学推理中的实证研究

Zelin Tan, Hejia Geng, Xiaohang Yu, Mulei Zhang, Guancheng Wan, Yifan Zhou, Qiang He, Xiangyuan Xue, Heng Zhou, Yutao Fan, Zhongzhi Li, Zaibin Zhang, Guibin Zhang, Chen Zhang, Zhenfei Yin, Philip Torr, Lei Bai

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室) University of Oxford(牛津大学) Imperial College London(伦敦帝国学院) University of Georgia(佐治亚大学) The Chinese University of Hong Kong(香港中文大学) Chinese Academy of Sciences(中国科学院) Dalian University of Technology(大连理工大学) National University of Singapore(新加坡国立大学) Wuhan University(武汉大学)

AI总结 本文通过实证研究探讨了LLM后训练强化学习中的扩展行为,重点分析了模型规模、数据量和计算预算对数学推理性能的影响,揭示了学习效率的饱和趋势及高质量数据重复利用的有效性。

Comments V4 version:This Paper has been accepted by ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15729 2026-04-20 cs.CV cs.AI

MambaBack: Bridging Local Features and Global Contexts in Whole Slide Image Analysis

MambaBack:在全切片图像分析中弥合局部特征与全局上下文

Sicheng Chen, Chad Wong, Tianyi Zhang, Enhui Chai, Zeyu Liu, Fei Xia

机构 * Nhu Department of Electrical Engineering and Computer Science, University of California, Irvine(加州大学尔湾分校Nhu电子工程与计算机科学系) Department of Electrical & Computer Engineering, National University of Singapore(新加坡国立大学电子与计算机工程系) PuzzleLogic Pte Ltd, Singapore(新加坡PuzzleLogic公司)

AI总结 MambaBack通过融合Mamba和MambaOut的优势,解决全切片图像分析中局部特征提取与全局上下文建模的挑战,提升多尺度表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15709 2026-04-20 cs.AI

Bilevel Optimization of Agent Skills via Monte Carlo Tree Search

通过蒙特卡洛树搜索优化代理技能

Chenyi Huang, Haoting Zhang, Jingxu Xu, Zeyu Zheng, Yunduan Lin

机构 * Department of Mathematics(数学系) National University of Singapore(国立新加坡大学) Department of Industrial Engineering and Operations Research(工业工程与运营管理系) University of California at Berkeley(加州大学伯克利分校) Department of Decision, Operation and Technology(决策、运营与技术系) The Chinese University of Hong Kong(香港中文大学)

AI总结 本文提出通过蒙特卡洛树搜索优化代理技能的双层优化框架,提升任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏