arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 10451 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 10451 篇

2604.13552 2026-04-16 cs.CL cs.AI 62%

Training-Free Test-Time Contrastive Learning for Large Language Models

无需训练的测试时对比学习用于大语言模型

Kaiwen Zheng, Kai Zhou, Jinwu Hu, Te Gu, Mingkai Peng, Fei Liu

机构 * South China University of Technology(南方科技大学) Pazhou Laboratory(琶洲实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出无需训练的测试时对比学习(TF-TTCL),通过动态'探索-反思-引导'循环提升冻结大语言模型的在线推理能力,优于零样本基线和代表性测试时适应方法。

Comments Accepted by Findings ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13531 2026-04-16 cs.AI cs.LG 62%

RiskWebWorld: A Realistic Interactive Benchmark for GUI Agents in E-commerce Risk Management

RiskWebWorld: 电子商务风险管理中GUI代理的现实交互基准

Renqi Chen, Zeyin Tao, Jianming Guo, Jing Wang, Zezhou Xu, Jingzhe Zhu, Qingqing Sun, Tianyi Zhang, Shuai Chen

机构 * Ant Group(蚂蚁集团)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 RiskWebWorld是一个用于评估GUI代理在电子商务风险管理中能力的现实交互基准,揭示了通用模型与专用模型在长周期专业任务中的显著能力差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27064 2026-04-16 cs.CV cs.AI cs.CL 62%

ChartNet: A Million-Scale, High-Quality Multimodal Dataset for Robust Chart Understanding

ChartNet: 一个百万级、高质量的多模态数据集,用于稳健的图表理解

Jovana Kondic, Pengyuan Li, Dhiraj Joshi, Isaac Sanchez, Ben Wiesel, Shafiq Abedin, Amit Alfassy, Eli Schwartz, Daniel Caraballo, Yagmur Gizem Cinar, Florian Scheidegger, Steven I. Ross, Daniel Karl I. Weidele, Hang Hua, Ekaterina Arutyunova, Roei Herzig, Zexue He, Zihan Wang, Xinyue Yu, Yunfei Zhao, Sicong Jiang, Minghao Liu, Qunshu Lin, Peter Staar, Luis Lastras, Aude Oliva, Rogerio Feris

机构 * MIT(麻省理工学院) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室) IBM Research(IBM研究院) Abaka AI & 2077AI(Abaka AI及2077AI)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 ChartNet通过生成150万张不同图表样本,提升图表解释和推理能力,包含代码、图像、表格、自然语言和问答数据,支持多模态对齐,公开可用。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10696 2026-04-16 cs.AI cs.CL 62%

Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution

记住我,精进我:一种面向经验驱动代理进化的动态过程记忆框架

Zouying Cao, Jiaji Deng, Li Yu, Weikang Zhou, Zhaoyang Liu, Bolin Ding, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReMe框架,通过多维蒸馏、情境适应重用和基于效用的精炼机制,解决传统静态记忆存储的不足,实验证明其在BFCL-V3和AppWorld上达到新状态,展示了自进化记忆在终身学习中的高效性。

Comments 20 pages, 10 figures, 15 tables, ACL'26-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12659 2026-04-15 cs.LG cs.CL 62%

Do VLMs Truly "Read" Candlesticks? A Multi-Scale Benchmark for Visual Stock Price Forecasting

视觉语言模型真的能‘解读’K线图吗?一种多尺度的视觉股票价格预测基准

Kaiqi Hu, Linda Xiao, Shiyue Xu, Ziyi Tang, Mingwen Liu

机构 * University of Leeds(利兹大学) Sun Yat-sen University(中山大学) Likelihood Lab(Likelihood实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多尺度K线图基准,评估视觉语言模型对多尺度视觉市场动态的理解能力,发现大多数模型在持续上涨或下跌时表现良好,但在常见市场场景中预测能力较弱。

Comments We evaluate whether VLMs can comprehend multi-scale visual stock price data like human analysts with a proposed benchmark, identifying current VLMs' weak predictive power, significant biases, and limited sensitivity to forecast horizons and prompts

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12015 2026-04-15 cs.LG cs.CL 62%

UCS: Estimating Unseen Coverage for Improved In-Context Learning

UCS:用于改进上下文学习的未见覆盖估计

Jiayi Xin, Xiang Li, Evan Qiang, Weiqing He, Tianqi Shang, Weijie J. Su, Qi Long

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 UCS通过基于覆盖的免训练方法改进上下文学习,通过诱导离散潜在聚类和估计候选子集中的未揭示聚类数量,提升模型性能。

Comments ACL 2026 Findings; 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20635 2026-04-15 cs.CL cs.AI 62%

Why Did Apple Fall: Evaluating Curiosity in Large Language Models

苹果为何坠落:评估大语言模型中的好奇心

Haoyu Wang, Sihang Jiang, Yuyan Chen, Xiaojun Meng, Jiansheng Wei, Yitong Wang, Yanghua Xiao

机构 * Shanghai Key Laboratory of Data Science, School of Computer Science, Fudan University(上海数据科学 key laboratory,计算机科学学院,复旦大学) Huawei Large Model Data Technology Lab(华为大模型数据技术实验室) Cornell University(康奈尔大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文基于人类好奇心评估量表,设计评估框架,发现大语言模型对知识有更强的渴求,但在不确定环境中仍保守,好奇心可提升推理与学习能力。

Comments ACL 2026 findings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15552 2026-04-15 cs.CL cs.AI 62%

Think Parallax: Solving Multi-Hop Problems via Multi-View Knowledge-Graph-Based Retrieval-Augmented Generation

Think Parallax: 通过多视图知识图谱基于检索增强生成解决多跳问题

Jinliang Liu, Jiale Bai, Shaoning Zeng

机构 * Yangtze Delta Region Institute (Huzhou), University of Electronic Science and Technology of China(长江三角洲地区研究院(湖州),电子科学与技术大学) School of Information and Software Engineering, University of Electronic Science and Technology of China(信息与软件工程学院,电子科学与技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ParallaxRAG框架,通过多视图知识图谱检索增强生成解决多跳推理问题,改进多跳推理的结构,提升检索和问答性能,减少幻觉并增强生物医学领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11299 2026-04-14 cs.CL cs.AI 62%

Enhancing Multimodal Large Language Models for Ancient Chinese Character Evolution Analysis via Glyph-Driven Fine-Tuning

通过字形驱动微调增强多模态大语言模型用于古汉字演变分析

Rui Song, Lida Shi, Ruihua Qi, Yingji Li, Hao Xu

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Ancient Chinese Script, Culture Relics and Artificial Intelligence, Jilin University, China(吉林大学古文字、文物与人工智能重点实验室) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) School of Archaeology, Jilin University, China(吉林大学考古学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GEVO框架,通过字形驱动微调提升多模态大语言模型在古汉字演变分析中的能力,实验显示模型在多个任务上均取得显著提升。

Comments Accepted by ACL 2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05005 2026-04-14 cs.CY cs.AI cs.CL 62%

EduIllustrate: Towards Scalable Automated Generation Of Multimodal Educational Content

EduIllustrate:迈向可扩展的自动多模态教育内容生成

Shuzhen Bi, Mingzi Zhang, Zhuoxuan Li, Xiaolong Wang, Keqian Li, Aimin Zhou

机构 * Shanghai Innovation Institute(上海创新研究院) University of Science and Technology of China(中国科学技术大学) East China Normal University(华东师范大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出EduIllustrate基准,用于评估LLM在K-12 STEM问题中生成图文结合解释的能力,通过230道题和8维度评估标准,揭示LLM在视觉一致性与成本效率上的表现差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08970 2026-04-13 cs.CL cs.AI cs.HC cs.MA 62%

Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models

Litmus (Re)Agent:一种用于多语言模型预测评估的基准和代理系统

Avni Mittal, Shanu Kumar, Sandipan Dandapat, Monojit Choudhury

机构 * Microsoft Corporation, India(微软公司(印度)) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Litmus (Re)Agent代理系统,通过结构化代理推理方法,在缺乏直接证据的情况下评估多语言模型性能,尤其在转移密集场景中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08801 2026-04-13 cs.LG cs.CL 62%

$p1$: Better Prompt Optimization with Fewer Prompts

用更少提示实现更好的提示优化

Zhaolin Gao, Yu, Wang, Bo Liu, Thorsten Joachims, Kianté Brantley, Wen Sun

机构 * Cornell University(康奈尔大学) Microsoft(微软) Harvard University(哈佛大学) Databricks AI Research(Databricks AI研究)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 研究揭示提示优化有效性取决于系统提示与响应方差,提出$p1$过滤方法提升优化效果,实验显示其在推理基准上优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04072 2026-04-13 cs.CL cs.AI 62%

SkillFactory: Self-Distillation For Learning Cognitive Behaviors

SkillFactory:用于学习认知行为的自我蒸馏

Zayne Sprague, Jack Lu, Manya Wadhwa, Sedrick Keh, Mengye Ren, Greg Durrett

机构 * New York University(纽约大学) Toyota Research Institute(丰田研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 SkillFactory通过监督微调阶段学习认知技能,为强化学习奠定基础,提升模型在复杂任务中的泛化能力与鲁棒性。

Comments Published at ICLR 2026; code at https://github.com/Zayne-sprague/SkillFactory

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06499 2026-04-13 cs.CL cs.AI 62%

Webscale-RL: Automated Data Pipeline for Scaling RL Data to Pretraining Levels

Webscale-RL: 用于将强化学习数据扩展到预训练水平的自动化数据管道

Zhepeng Cen, Haolin Chen, Shiyu Wang, Zuxin Liu, Zhiwei Liu, Jielin Qiu, Ding Zhao, Silvio Savarese, Caiming Xiong, Huan Wang, Weiran Yao

机构 * Salesforce AI Research(赛富时人工智能研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出Webscale-RL数据管道,通过系统性地将大规模预训练文档转换为数百万个多样化的可验证问题-答案对,解决RL数据瓶颈问题,并展示基于该数据集的模型在多个基准测试中表现优于传统预训练方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05215 2026-04-13 cs.CL cs.LG 62%

BEDTime: A Unified Benchmark for Automatically Describing Time Series

BEDTime:一个统一的基准测试用于自动描述时间序列

Medhasweta Sen, Zachary Gottesman, Jiaxing Qiu, C. Bayan Bruss, Nam Nguyen, Tom Hartvigsen

机构 * University of Virginia(弗吉尼亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出BEDTime基准测试,评估模型对时间序列结构属性的描述能力,发现专为时间序列语言设计的模型表现欠佳,而视觉语言模型表现优异,且所有方法在现实鲁棒性测试中均表现脆弱。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08540 2026-04-10 cs.CV cs.AI cs.CL 62%

AVGen-Bench: A Task-Driven Benchmark for Multi-Granular Evaluation of Text-to-Audio-Video Generation

AVGen-Bench: 一项面向多粒度评估的文本到音频视频生成任务驱动基准

Ziwei Zhou, Zeyuan Lai, Rui Wang, Yifan Yang, Zhen Xing, Yuqing Yang, Qi Dai, Lili Qiu, Chong Luo

机构 * Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学) University of Science and Technology of China(中国科学技术大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AVGen-Bench通过11个真实场景的高质量提示,结合轻量专家模型与多模态大语言模型,实现对文本到音频视频生成的多粒度评估,揭示了音频视觉美学与语义可靠性之间的显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08294 2026-04-10 cs.CV cs.AI cs.CL 62%

Can Vision Language Models Judge Action Quality? An Empirical Evaluation

视觉语言模型能否评判动作质量?一项实证评估

Miguel Monte e Freitas, Rui Henriques, Ricardo Rei, Pedro Henrique Martins

机构 * Sword Health Instituto Superior Técnico, Universidade de Lisboa(里斯本大学高等技术学院) INESC-ID(INESC-ID研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文评估了视觉语言模型在动作质量评估中的表现,发现现有模型在多个领域仅略高于随机水平,且存在预测偏差,提示细粒度动作质量评估存在根本性困难。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07426 2026-04-10 cs.LG cs.AI 62%

GIRL: Generative Imagination Reinforcement Learning via Information-Theoretic Hallucination Control

GIRL:通过信息论幻觉控制实现生成性想象强化学习

Prakul Sunil Hiremath

机构 * Department of Computer Science and Engineering, Visvesvaraya Technological University (VTU), Belagavi, India(维斯瓦拉亚科技大学计算机科学与工程系,贝拉加维,印度) Aliens on Earth (AoE) Autonomous Research Group, Belagavi, India(地球外星人自主研究组,贝拉加维,印度)

专题命中 推理评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 GIRL通过引入跨模态锚定信号和不确定性适应信任区域瓶颈,解决模型误差累积导致的轨迹漂移问题,提升长周期任务的样本效率和回报性能。

Comments 20 pages, 2 figures, 7 tables; reinforcement learning, world models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06505 2026-04-09 cs.CL cs.AI 62%

MedConclusion: A Benchmark for Biomedical Conclusion Generation from Structured Abstracts

MedConclusion:一个用于从结构化摘要中生成生物医学结论的基准数据集

Weiyue Li, Ruizhi Qian, Yi Li, Yongce Li, Yunfan Long, Jiahui Cai, Yan Luo, Mengyu Wang

机构 * Harvard AI and Robotics Lab, Harvard Medical School(哈佛大学医学院哈佛人工智能与机器人实验室) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学肯普纳自然与人工智能研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MedConclusion数据集,包含570万篇PubMed结构化摘要,用于生物医学结论生成。通过配对摘要非结论部分与原始结论,提供证据到结论推理的自然监督。数据集还包含期刊级元数据,支持跨生物医学领域的子组分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06204 2026-04-09 cs.CL cs.AI cs.HC 62%

SensorPersona: An LLM-Empowered System for Continual Persona Extraction from Longitudinal Mobile Sensor Streams

SensorPersona: 一种基于大语言模型的持续性人设提取系统,用于从长期移动传感器流中无感获取

Bufang Yang, Lilin Xu, Yixuan Li, Kaiwei Liu, Xiaofan Jiang, Zhenyu Yan

机构 * The Chinese University of Hong Kong(香港中文大学) Columbia University(哥伦比亚大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SensorPersona系统,通过多模态长期传感器流持续提取稳定用户人设,提升LLM代理的个性化响应质量。系统通过上下文编码、分层人设推理和自适应更新,实现对物理行为、心理特质和生活经验的全面分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05930 2026-04-08 cs.CL cs.AI 62%

"I See What You Did There": Can Large Vision-Language Models Understand Multimodal Puns?

我看出你在那儿:大型视觉-语言模型能否理解多模态双关语?

Naen Xu, Jiayi Sheng, Changjiang Li, Chunyi Zhou, Yuyuan Li, Tianyu Du, Jun Wang, Zhihui Fu, Jinbao Li, Shouling Ji

机构 * Zhejiang University(浙江大学) Beihang University(北京航空航天大学) Palo Alto Networks Hangzhou Dianzi University(杭州电子科技大学) Ningbo Global Innovation Center, Zhejiang University(浙江大学宁波全球创新中心) OPPO Research Institute(OPPO研究院) Qilu University of Technology(齐鲁工业大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了大型视觉-语言模型理解多模态双关语的能力,提出多模态双关语生成流程和MultiPun数据集,通过评估发现模型在区分真实双关语与干扰项上表现不足,并提出提示级和模型级策略提升理解性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04192 2026-04-08 cs.CV cs.AI cs.LG 62%

Graphic-Design-Bench: A Comprehensive Benchmark for Evaluating AI on Graphic Design Tasks

Graphic-Design-Bench:一个全面的评估AI在图形设计任务中的基准测试

Adrienne Deganutti, Elad Hirsch, Haonan Zhu, Jaejung Seol, Purvanshi Mehta

专题命中 推理评测 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出GraphicDesignBench,首个针对专业图形设计任务的全面基准测试集,评估AI模型在布局、排版、信息图、模板设计和动画等任务中的表现,揭示当前模型在空间推理、矢量代码生成和动画分解等方面存在的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05467 2026-04-08 cs.IR cs.CL cs.LG 62%

CUE-R: Beyond the Final Answer in Retrieval-Augmented Generation

CUE-R:超越检索增强生成的最终答案

Siddharth Jain, Venkat Narayan Vedam

机构 * Intuit

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 CUE-R通过干预基于证据项的检索使用痕迹,评估单次检索增强生成中每个证据项的操作效用,揭示证据项对正确性、基础忠实度和置信度误差的影响。

Comments 6 figures, 14 tables; appendix includes bootstrap CIs, metric definitions, duplicate position sensitivity, prompt template, and reproducibility details

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05445 2026-04-08 cs.CL cs.AI cs.CV 62%

Learning What Matters: Dynamic Dimension Selection and Aggregation for Interpretable Vision-Language Reward Modeling

学习什么重要:可解释视觉语言奖励建模的动态维度选择与聚合

Qiyuan Chen, Hongsen Huang, Jiahe Chen, Qian Shao, Jintai Chen, Hongxia Xu, Renjie Hua, Chuan Ren, Jian Wu

机构 * Zhejiang University(浙江大学) Soochow Securities Co.,Ltd.(东吴证券股份有限公司) HKUST(GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VL-MDR框架,通过动态分解评价为细粒度可解释维度,提升视觉语言奖励建模的可解释性与效率,实验显示其在基准测试中优于现有模型,并有效缓解视觉幻觉。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05117 2026-04-08 cs.CV cs.AI cs.CL 62%

Watch Before You Answer: Learning from Visually Grounded Post-Training

在回答前观看:从视觉引导的后训练中学习

Yuxuan Zhang, EunJeong Hwang, Huaisong Zhang, Penghui Du, Yiming Jia, Dongfu Jiang, Xuan He, Shenhui Zhang, Ping Nie, Peter West, Kelsey R. Allen

机构 * University of British Columbia(不列颠哥伦比亚大学) Vector Institute(向量研究所) Etude AI Kolors Team, Kuaishou Technology(快手科技Kolors团队) University of Toronto(多伦多大学) University of Waterloo(滑铁卢大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文发现现有视频理解基准中40-60%的问题可通过文本线索回答,提出VidGround方法通过仅使用视觉引导问题提升VLM性能,实验显示其在后训练中效果优于复杂方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12705 2026-04-08 cs.CL cs.AI cs.CV eess.IV 62%

MedXIAOHE: A Comprehensive Recipe for Building Medical MLLMs

MedXIAOHE:构建医疗多模态大语言模型的全面指南

Baorong Shi, Bo Cui, Boyuan Jiang, Deli Yu, Fang Qian, Haihua Yang, Huichao Wang, Jiale Chen, Jianfei Pan, Jieqiong Cao, Jinghao Lin, Kai Wu, Lin Yang, Shengsheng Yao, Tao Chen, Xiaojun Xiao, Xiaozhong Ji, Xu Wang, Yijun He, Zhixiong Yang

机构 * ByteDance XiaoHe Medical AI(字节跳动小荷医疗AI)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 MedXIAOHE通过实体感知持续预训练框架和强化学习提升医疗理解与推理,实现医疗多模态大模型的突破性进展。

Comments XIAOHE Medical AI team. See paper for full author list. Currently, the model is exclusively available on XIAOHE AI Doctor, accessible via both the App Store and the Douyin Mini Program. Updated to improve the layout

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06800 2026-04-07 cs.CL cs.AI cs.HC cs.MA 62%

FURINA: A Fully Customizable Role-Playing Benchmark via Scalable Multi-Agent Collaboration Pipeline

FURINA:通过可扩展的多智能体协作流水线实现完全可定制的角色扮演基准

Haotian Wu, Shufan Jiang, Chios Chen, Yiyang Feng, Hehai Lin, Heqing Zou, Yao Shu, Chengwei Qin

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) The University of Hong Kong(香港大学) Stony Brook University(石溪大学) Nanyang Technological University(南洋理工大学) Datawhale Org.(Datawhale 组织) Independent Researcher(独立研究者)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出FURINA-Builder,一种可扩展的多智能体协作流水线,用于构建完全可定制的角色扮演基准。该基准支持多样化的场景和提示格式,通过智能体协作评估任意角色,并发现推理能力提升的同时 hallucinations 增加的新型权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04020 2026-04-07 cs.CL cs.LG 62%

Unmasking Hallucinations: A Causal Graph-Attention Perspective on Factual Reliability in Large Language Models

揭示幻觉:从因果图注意力视角探讨大语言模型中的事实可靠性

Sailesh kiran kurra, Shiek Ruksana, Vishal Borusu

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 本文提出因果图注意力网络框架,通过构建token级图来减少大语言模型中的幻觉问题,提升事实可靠性。

Comments Paper accepted for publication at IEEE International Conference on Emerging Computing and Intelligent Technologies 2026 (ICoECIT),5 Pages,5 figures,1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03754 2026-04-07 cs.CL cs.AI 62%

Testing the Limits of Truth Directions in LLMs

检验大型语言模型中真理方向的极限

Angelos Poulis, Mark Crovella, Evimaria Terzi

机构 * Boston University(波士顿大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示了大型语言模型中真理方向的普遍性存在局限,指出其依赖于层数、任务类型和复杂性,并受指令影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03376 2026-04-07 cs.AI cs.CL 62%

VERT: Reliable LLM Judges for Radiology Report Evaluation

VERT:用于放射学报告评估的可靠LLM评判者

Federica Bologna, Jean-Philippe Corbeil, Matthew Wilkens, Asma Ben Abacha

机构 * Cornell University(康奈尔大学) Microsoft Healthcare & Life Sciences(微软医疗健康与生命科学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出VERT作为LLM评判者,通过对比现有指标和实验验证,展示了其在多模态和解剖结构上的鲁棒性及轻量级微调的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏