arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2602.17689 2026-02-23 cs.LG cs.AI cs.CL cs.CV 67%

Robust Pre-Training of Medical Vision-and-Language Models with Domain-Invariant Multi-Modal Masked Reconstruction

具有领域不变多模态掩码重建的医学视觉-语言模型鲁棒预训练

Melika Filvantorkaman, Mohsen Piri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Robust-MMR框架,通过显式建模鲁棒性提升医学视觉-语言模型在跨领域和扰动下的表现,实现更可靠的医疗应用。

Comments 28 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16802 2026-02-20 cs.CL cs.AI cs.LG 67%

References Improve LLM Alignment in Non-Verifiable Domains

参考文献提高非可验证领域的LLM对齐

Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

机构 * Yale University(耶鲁大学) Meta Scale AI Salesforce Research(Salesforce 研究) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出参考引导的LLM评估器,通过增强LLM对齐的评估器和自我改进,显著提升了非可验证领域中LLM的性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16008 2026-02-19 cs.SD cs.AI cs.CL cs.LG 67%

MAEB: Massive Audio Embedding Benchmark

MAEB:大规模音频嵌入基准

Adnan El Assadi, Isaac Chung, Chenghao Xiao, Roman Solomatin, Animesh Jha, Rahul Chand, Silky Singh, Kaitlyn Wang, Ali Sartaz Khan, Marc Moussa Nasser, Sufen Fong, Pengfei He, Alan Xiao, Ayush Sunil Munot, Aditya Shrivastava, Artem Gazizov, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Carleton University(卡尔顿大学) Durham University(杜伦大学) Stanford University(斯坦福大学) Aarhus University(奥胡斯大学) Indian Institute of Technology, Kharagpur(印度理工学院,卡里格普) Harvard University(哈佛大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MAEB是一个涵盖多语言音频任务的基准,揭示了不同模型在音频与语言任务上的性能差异,展示了音频编码器在跨模态任务中的表现关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.12174 2026-02-18 cs.LG cs.AI cs.CL cs.CV 67%

Just KIDDIN: Knowledge Infusion and Distillation for Detection of INdecent Memes

Just KIDDIN: 基于知识注入与蒸馏的有害表情包检测

Rahul Garg, Trilok Padhi, Hemang Jain, Ugur Kursuncu, Ponnurangam Kumaraguru

机构 * IIIT Hyderabad Georgia State University(佐治亚州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种结合知识蒸馏与注入的框架,用于提升有害表情包检测的性能,通过整合大规模知识图谱和视觉语言模型,实现更准确的毒性识别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05316 2026-02-17 cs.LG cs.AI cs.CL 67%

Improving Data Efficiency for LLM Reinforcement Fine-tuning Through Difficulty-targeted Online Data Selection and Rollout Replay

通过难度目标在线数据选择和回放提升大语言模型强化微调的数据效率

Yifan Sun, Jingyan Shen, Yibin Wang, Tianyu Chen, Zhendong Wang, Mingyuan Zhou, Huan Zhang

机构 * UIUC(伊利诺伊大学香槟分校) New York University(纽约大学) University of Texas at Austin(得克萨斯大学奥斯汀分校) Microsoft(微软)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过难度目标在线数据选择和回放机制提升大语言模型强化微调的数据效率,实验表明可减少62%的微调时间并保持同等性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02158 2026-02-17 cs.CL cs.AI cs.LG physics.geo-ph 67%

FormationEval, an open multiple-choice benchmark for petroleum geoscience

FormationEval,一个用于石油地球科学的开源多选题基准测试

Almaz Ermilov

机构 * UiT The Arctic University of Norway(UiT北极大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FormationEval是一个开源多选题基准测试,用于评估语言模型在石油地球科学领域的表现,涵盖七个领域,包含505个问题,展示了不同模型的准确率及领域差异。

Comments v2: expanded related work, added validation details, difficulty-domain table, community feedback website (at https://www.formationeval.no). 28 pages, 8 figures, 11 tables. Benchmark and code at https://github.com/AlmazErmilov/FormationEval-an-Open-Benchmark-for-Oil-Gas-Geoscience-MCQ-Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05430 2026-02-17 cs.CL cs.AI cs.IR cs.LG 67%

ArtistMus: A Globally Diverse, Artist-Centric Benchmark for Retrieval-Augmented Music Question Answering

ArtistMus: 一个全球多样、以艺术家为中心的基准,用于检索增强的音乐问答

Daeyong Kwon, SeungHeon Doh, Juhan Nam

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ArtistMus提出一个全球多样、以艺术家为中心的基准,通过检索增强生成技术提升音乐问答的准确性和上下文推理能力。

Comments Accepted to LREC 2026. This work is an evolution of our earlier preprint arXiv:2507.23334

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18053 2026-02-17 cs.RO 67%

V2V-GoT: Vehicle-to-Vehicle Cooperative Autonomous Driving with Multimodal Large Language Models and Graph-of-Thoughts

V2V-GoT: 基于多模态大语言模型和思维图的车对车协同自动驾驶

Hsu-kuang Chiu, Ryo Hachiuma, Chien-Yi Wang, Yu-Chiang Frank Wang, Min-Hung Chen, Stephen F. Smith

机构 * NVIDIA Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 本文提出V2V-GoT框架,结合多模态大语言模型和图-思维方法,提升车对车协同自动驾驶的感知、预测和规划能力。

Comments Accepted by ICRA 2026 (IEEE International Conference on Robotics and Automation). Project: https://eddyhkchiu.github.io/v2vgot.github.io/ Code: https://github.com/eddyhkchiu/V2V-GoT Dataset: https://huggingface.co/datasets/eddyhkchiu/V2V-GoT-QA

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18776 2026-02-17 cs.CL cs.AI cs.LG 67%

AECBench: A Hierarchical Benchmark for Knowledge Evaluation of Large Language Models in the AEC Field

AECBench: 一个用于评估大型语言模型在AEC领域知识能力的分层基准

Chen Liang, Zhaoqi Huang, Haofen Wang, Fu Chai, Chunying Yu, Huanhuan Wei, Zhengjie Liu, Yanpeng Li, Hongjun Wang, Ruifeng Luo, Xianzhong Zhao

机构 * College of Civil Engineering, Tongji University(同济大学土木工程学院) Shanghai Qi Zhi Institute(上海启智研究院) Arcplus Group East China Architectural Design & Research Institute Co., Ltd.(Arcplus集团东部建筑设计与研究研究院有限公司) College of Design and Innovation, Tongji University(同济大学设计与创新学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AECBench提出一个分层基准,评估大型语言模型在AEC领域知识能力,揭示模型在复杂推理和文档生成方面的不足。

Comments Accepted by Advanced Engineering Informatics. Code and data available at: https://github.com/ArchiAI-LAB/AECBench

Journal ref Advanced Engineering Informatics, Vol. 71, Article 104314 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05794 2026-02-16 cs.AI cs.CE cs.CL cs.LG 67%

FiMI: A Domain-Specific Language Model for Indian Finance Ecosystem

FiMI:面向印度金融生态的领域专用语言模型

Aboli Kathar, Aman Kumar, Anusha Kamath, Araveeti Srujan, Ashish Sharma, Chandra Bhushan, Divya Sorate, Duddu Prasanth Kumar, Evan Acharya, Harsh Sharma, Hrithik Kadam, Kanishk Singla, Keyur Doshi, Kiran Praveen, Kolisetty Krishna SK, Krishanu Adhikary, Lokesh MPT, Mayurdeep Sonowal, Nadeem Shaikh, Navya Prakash, Nimit Kothari, Nitin Kukreja, Prashant Devadiga, Rakesh Paul, Ratanjeet Pratap Chauhan, Raunak Kalani, Raviraj Joshi, Shamanth MH, Shantanu Pandey, Shubham Soni, Siddharth Dixit, Smriti Jopat, Sunil Patel, Suraj Singh, Suvradip Paul, Tulasi Pilla, Utkarsh Vaidya, Vineeth Nambiar, Vishal Kanvaty, Yatharth Dedhia

机构 * National Payments Corporation of India (NPCI)(印度国家支付公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 FiMI是印度国家支付清算公司为数字支付系统开发的领域专用金融语言模型,通过多阶段训练在金融推理和工具调用任务中取得显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16390 2026-02-13 cs.CL cs.AI cs.LG 67%

A Large-Scale Benchmark for Evaluating Large Language Models on Medical Question Answering in Romanian

面向罗马尼亚语医疗问答的大型基准测试

Ana-Cristina Rogoz, Radu Tudor Ionescu, Alexandra-Valentina Anghel, Ionut-Lucian Antone-Iordache, Simona Coniac, Andreea Iuliana Ionescu

机构 * University of Bucharest(布加勒斯特大学) Colţea Clinical Hospital(科尔切亚临床医院) Hospice Hope Bucharest(希望临终关怀布加勒斯特医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出首个罗马尼亚语医疗问答基准测试MedQARo,评估了多种LLM在医疗问答任务中的表现,发现微调模型在泛化能力上优于零样本模型。

Comments Accepted in npj Digital Medicine

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13779 2026-02-13 cs.CL cs.AI cs.LG 67%

NewsInterview: a Dataset and a Playground to Evaluate LLMs' Ground Gap via Informational Interviews

NewsInterview: 一个用于通过信息性访谈评估LLM地面间隙的数据集和游乐场

Alexander Spangher, Michael Lu, Sriya Jeslyn Kalyan, Hyundong Justin Cho, Weiyan Shi, Jonathan May

机构 * University of California, Berkeley(加州大学伯克利分校) University of Southern California(南加州大学) Information Sciences Institute(信息科学研究所) Northeastern University(东北大学)

专题命中 推理评测 :planning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 NewsInterview通过信息性访谈数据集和模拟环境,揭示LLMs在战略对话和多轮规划方面的能力不足,强调需提升其对话策略与说服力。

Comments Accepted at ACL 2025: https://aclanthology.org/2025.acl-long.1580/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09973 2026-02-11 cs.RO 67%

RoboInter: A Holistic Intermediate Representation Suite Towards Robotic Manipulation

RoboInter: 一种面向机器人操控的综合中间表示套件

Hao Li, Ziqin Wang, Zi-han Ding, Shuai Yang, Yilun Chen, Yang Tian, Xiaolin Hu, Tai Wang, Dahua Lin, Feng Zhao, Si Liu, Jiangmiao Pang

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Beihang University(北航) Nanyang Technological University(南洋理工大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 RoboInter通过统一的中间表示套件,提升机器人操控中视觉-语言-动作系统的泛化能力和推理能力。

Comments Published to ICLR 2026, 69 pages, 40 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09214 2026-02-11 cs.CV 67%

VLM-UQBench: A Benchmark for Modality-Specific and Cross-Modality Uncertainties in Vision Language Models

VLM-UQBench:一种用于视觉语言模型中模态特定和跨模态不确定性的基准

Chenyu Wang, Tianle Chen, H. M. Sabbir Ahmad, Kayhan Batmanghelich, Wenchao Li

机构 * Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);chain-of-thought(abstract)

AI总结 VLM-UQBench通过评估不同UQ方法在模态特定和跨模态不确定性上的表现,揭示了现有方法在细粒度不确定性检测上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08369 2026-02-10 cs.AI cs.CL cs.LG 67%

MemAdapter: Fast Alignment across Agent Memory Paradigms via Generative Subgraph Retrieval

MemAdapter:通过生成子图检索实现跨代理记忆范式的快速对齐

Xin Zhang, Kailai Yang, Chenyue Li, Hao Li, Qiyu Wei, Jun'ichi Tsujii, Sophia Ananiadou

机构 * The University of Manchester(曼彻斯特大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国理工学院) National Institute of Advanced Industrial Science(国家先进工业科学与技术研究院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MemAdapter通过生成子图检索实现跨代理记忆范式的快速对齐,提升记忆检索灵活性并降低对齐成本,实验显示其性能优于现有系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08266 2026-02-10 cs.LG cs.AI cs.CL cs.CV cs.IR 67%

Benchmarking Large Language Models for Geolocating Colonial Virginia Land Grants

对殖民弗吉尼亚土地授予进行大规模语言模型评估

Ryan Mioduski

机构 * Independent Researcher(独立研究者)

专题命中 推理评测 :chain-of-thought(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究评估了大规模语言模型在将殖民弗吉尼亚土地授予描述转换为地理坐标方面的性能,发现模型在准确性与成本效益上表现优异。

Journal ref Journal of Spatial Information Science, No. 31 (2025), pp. 57-96

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06446 2026-02-09 cs.CL cs.AI cs.LG 67%

CORE: Comprehensive Ontological Relation Evaluation for Large Language Models

CORE:面向大语言模型的全面本体关系评估

Satyam Dwivedi, Sanjukta Ghosh, Shivam Dwivedi, Nishi Kumari, Anil Thakur, Anurag Purushottam, Deepak Alok, Praveen Gatla, Manjuprasad B, Bipasha Patgiri

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12014 2026-02-09 cs.CL cs.AI cs.LG cs.SE 67%

code_transformed: The Influence of Large Language Models on Code

code_transformed: 大型语言模型对代码的影响

Yuliang Xu, Siming Huang, Mingmeng Geng, Yao Wan, Xuanhua Shi, Dongping Chen

机构 * Huazhong University of Science and Technology(华中科技大学) École normale supérieure - Université PSL(巴黎高等师范学院-巴黎大学) Laboratoire LATTICE(LATTICE实验室) International School for Advanced Studies (SISSA)(国际先进研究学院(SISSA))

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了大型语言模型对代码风格的影响,通过分析GitHub仓库中的代码,发现命名规范、复杂性等指标的变化,揭示LLMs对现实编程实践的深远影响。

Comments EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05879 2026-02-06 cs.CL cs.AI cs.LG 67%

EuroLLM-22B: Technical Report

EuroLLM-22B:技术报告

Miguel Moura Ramos, Duarte M. Alves, Hippolyte Gisserot-Boukhlef, João Alves, Pedro Henrique Martins, Patrick Fernandes, José Pombal, Nuno M. Guerreiro, Ricardo Rei, Nicolas Boizard, Amin Farajian, Mateusz Klimaszewski, José G. C. de Souza, Barry Haddow, François Yvon, Pierre Colombo, Alexandra Birch, André F. T. Martins

机构 * Instituto Superior Técnico & Universidade de Lisboa (Lisbon ELLIS Unit)(里斯本ELLIS单位(理工学院与里斯本大学)) Instituto de Telecomunicações(电信研究院) MICS, CentraleSupélec, Université Paris-Saclay(MICS、中央圣艾尔布兰理工大学、巴黎萨克雷大学) Acolad Carnegie Mellon University(卡内基梅隆大学) University of Edinburgh(爱丁堡大学) Diabolocom Aveni OutSystems Sword Health Sorbonne Université, CNRS, ISIR(索邦大学、国家科学研究中心、ISIR) Artefact Research Center(Artefact研究机构) TransPerfect

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 EuroLLM-22B是一款覆盖24种欧盟语言及11种额外语言的大型语言模型,通过多语言基准测试展现强推理、指令遵循和翻译能力,提供基础模型、指令微调模型及预训练代码库以支持未来研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20645 2026-02-05 cs.CL cs.AI cs.LG 67%

Anticipatory Evaluation of Language Models

语言模型的前瞻性评估

Jungsoo Park, Ethan Mendes, Gabriel Stanovsky, Alan Ritter

机构 * Georgia Institute of Technology, Atlanta, Georgia(佐治亚理工学院) The Hebrew University of Jerusalem, Jerusalem, Israel(耶路撒冷希伯来大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出通过任务描述和实验配置预测语言模型性能,构建PRECOG语料库并展示推理模型在高置信度阈值下的预测能力。

Comments 30 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03181 2026-02-04 cs.SE 67%

Synthesizing File-Level Data for Unit Test Generation with Chain-of-Thoughts via Self-Debugging

通过自我调试合成文件级数据用于单元测试生成的链式思考

Ziyue Hua, Tianyu Chen, Yeyun Gong, Shuai Lu, Peng Cheng, Qinglin Zhu, Yibo He, Yingjie Fu, Wenpin Jiao, Wei Yang, Tao Xie

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 通过自我调试合成文件级数据用于单元测试生成,提升测试生成质量与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00508 2026-02-04 cs.CV 67%

DuoGen: Towards General Purpose Interleaved Multimodal Generation

DuoGen:迈向通用的交错多模态生成

Min Shi, Xiaohui Zeng, Jiannan Huang, Yin Cui, Francesco Ferroni, Jialuo Li, Shubham Pachori, Zhaoshuo Li, Yogesh Balaji, Haoxiang Wang, Tsung-Yi Lin, Xiao Fu, Yue Zhao, Chieh-Yun Chen, Ming-Yu Liu, Humphrey Shi

机构 * Georgia Tech(佐治亚理工学院) NVIDIA research.nvidia.com/labs/dir/duogen(NVIDIA 研究所)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 DuoGen通过系统性地解决数据整理、架构设计和评估问题,实现了通用的交错多模态生成,提升了文本质量、图像保真度和图像-上下文对齐性能。

Comments Technical Report. Project Page: https://research.nvidia.com/labs/dir/duogen/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21602 2026-02-04 cs.RO 67%

AIR-VLA: Vision-Language-Action Systems for Aerial Manipulation

AIR-VLA:面向空中操作的视觉-语言-动作系统

Jianli Sun, Bin Tian, Qiyao Zhang, Chengxiang Li, Zihan Song, Zhiyong Cui, Yisheng Lv, Yonglin Tian

机构 * The Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Automation, Beijing Institute of Technology(北京理工大学自动化学院) School of Information and Intelligent Engineering, University of Sanya(三亚大学信息与智能工程学院) School of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与车辆工程学院) State Key Lab of Intelligent Transportation Systems, School of Transportation Science and Engineering, Beihang University(北京航空航天大学交通科学与工程学院)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 AIR-VLA提出首个针对空中操作的视觉-语言-动作系统,通过构建仿真环境和多模态数据集,评估主流模型并揭示其在无人机移动、机械臂控制和高层规划中的能力和限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00029 2026-02-03 cs.CL cs.AI cs.LG 67%

Construct, Align, and Reason: Large Ontology Models for Enterprise Knowledge Management

构建、对齐与推理:面向企业知识管理的大型本体模型

Yao Zhang, Hongyin Zhu

机构 * Yonyou AI Lab(用友人工智能实验室) Yonyou Network Technology Co., Ltd.(用友网络技术有限公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出大型本体模型(LOM),通过构建、对齐和推理框架,实现企业知识管理中多源异构数据的整合与复杂语义推理,实验表明其在复杂图推理任务中表现优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22889 2026-02-02 cs.CL cs.AI cs.LG cs.SD 67%

DiffuSpeech: Silent Thought, Spoken Answer via Unified Speech-Text Diffusion

DiffuSpeech: 通过统一的语音-文本扩散实现无声思考, spoken 答案

Yuxuan Lou, Ziming Wu, Yaochen Wang, Yong Liu, Yingxuan Ren, Fuming Lai, Shaobing Lian, Jie Tang, Yang You

机构 * National University of Singapore(新加坡国立大学) Tencent(腾讯)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiffuSpeech通过统一的语音-文本扩散模型,实现语音生成的同时生成内部推理,提升语音问答的准确性和语音质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19514 2026-01-28 cs.CL cs.AI cs.LG 67%

SIPDO: Closed-Loop Prompt Optimization via Synthetic Data Feedback

SIPDO:通过合成数据反馈实现闭环提示优化

Yaoning Yu, Ye Yu, Peiyan Zhang, Kai Wei, Haojing Luo, Haohan Wang

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Hong Kong University of Science and Technology(香港科学与技术大学) University of South Florida(佛罗里达州立大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SIPDO通过合成数据反馈闭环优化提示,提升提示性能并优于传统提示微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18779 2026-01-27 cs.LG cs.AI cs.CL 67%

POPE: Learning to Reason on Hard Problems via Privileged On-Policy Exploration

POPE: 通过优先级在线探索学习解决难题

Yuxiao Qu, Amrith Setlur, Virginia Smith, Ruslan Salakhutdinov, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 POPE 通过利用优先级信息指导在线探索,解决难题推理中的探索问题,提升模型在复杂任务上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15624 2026-01-23 cs.CV 67%

Explainable Deepfake Detection with RL Enhanced Self-Blended Images

可解释的深度伪造检测与强化学习增强的自混合图像

Ning Jiang, Dingheng Zeng, Yanhong Liu, Haiyang Yi, Shijie Yu, Minghe Weng, Haifeng Shen, Ying Li

机构 * 1School of Software \& Microelectronics, Peking University, Beijing, China 2Mashang Consumer Finance Co., Ltd., Chongqing, China -0.15in

专题命中 推理评测 :chain-of-thought(abstract);CoT(abstract)

AI总结 本文提出了一种基于强化学习增强的自混合图像方法,用于可解释的深度伪造检测,通过自动化数据生成和定制奖励机制提升检测性能。

Comments Accepted at ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13770 2026-01-21 cs.AI cs.CL cs.LG q-fin.CP q-fin.GN 67%

Look-Ahead-Bench: a Standardized Benchmark of Look-ahead Bias in Point-in-Time LLMs for Finance

Look-Ahead-Bench: 一个用于评估点即时大型语言模型在金融领域中前瞻性偏差的标准基准

Mostapha Benhenda

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Look-Ahead-Bench通过评估点即时LLMs在金融领域中的前瞻性偏差,揭示了标准LLMs的显著偏差问题,并为标准化评估提供了实用框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19529 2026-01-21 cs.CV 67%

Vidi2.5: Large Multimodal Models for Video Understanding and Creation

Vidi2.5:大型多模态模型用于视频理解和创作

Vidi Team, Chia-Wen Kuo, Chuang Huang, Dawei Du, Fan Chen, Fanding Lei, Feng Gao, Guang Chen, Haoji Zhang, Haojun Zhao, Jin Liu, Jingjing Zhuge, Lili Fang, Lingxi Zhang, Longyin Wen, Lu Guo, Lu Xu, Lusha Li, Qihang Fan, Rachel Deng, Shaobo Fang, Shu Zhang, Sijie Zhu, Stuart Siew, Weiyan Tao, Wen Zhong, Xiaohui Shen, Xin Gu, Ye Yuan, Yicheng He, Yiming Cui, Zhenfang Chen, Zhihua Wu, Zuhua Lin

机构 * ByteDance Inc.(字节跳动公司)

专题命中 推理评测 :reasoning(abstract);planning(abstract)

AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏