arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-06 至 2026-04-06 共收录 211 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 36 篇

2505.09339 2026-04-06 cs.NI 75%

RAG-Enabled Intent Reasoning for Application-Network Interaction

支持应用-网络交互的意图推理(RAG)

Salwa Mostafa, Mohamed K. Abdel-Aziz, Mohammed S. Elbamby, Mehdi Bennis

专题命中 推理与问题求解 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文提出基于RAG的意图推理框架,用于自动网络操作与管理。通过结合机器推理、检索增强生成和生成式AI技术,实现不同应用的意图翻译,提升网络交互的智能化和领域适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03004 2026-04-06 cs.CL cs.AI 73%

R2-Write: Reflection and Revision for Open-Ended Writing with Deep Reasoning

R2-Write:基于深度推理的开放性写作反思与修订

Wanlong Liu, Bo Zhang, Chenliang Li, Shaopeng Lai, Yuning Wu, Xuanyu Lei, Ming Yan

机构 * Tongyi Lab, Alibaba Group(阿里巴巴集团通义实验室) Tsinghua University, Beijing, China(清华大学(中国北京))

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出R2-Write框架,通过迭代作家-评判者交互生成高质量思考轨迹,增强开放性写作的深度推理能力,实验表明显式引入反思与修订模式显著提升了写作任务性能。

Comments 31 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02954 2026-04-06 cs.CL cs.AI 73%

LogicPoison: Logical Attacks on Graph Retrieval-Augmented Generation

逻辑毒药:图检索增强生成中的逻辑攻击

Yilin Xiao, Jin Chen, Qinggang Zhang, Yujing Zhang, Chuang Zhou, Longhao Yang, Lingfei Ren, Xin Yang, Xiao Huang

机构 * Southwestern University of Finance and Economics(西南财经大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogicPoison攻击框架,通过逻辑推理而非注入虚假内容,破坏图检索增强生成系统中的拓扑结构,从而降低其性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28204 2026-04-06 cs.LG cs.AI 73%

ERPO: Token-Level Entropy-Regulated Policy Optimization for Large Reasoning Models

ERPO:基于熵调节的策略优化用于大推理模型

Song Yu, Li Li, Wenwen Zhao, Zhisheng Yang

机构 * School of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 ERPO通过引入熵感知门控、桶式隐式归一化和结果锚定优势合成,解决大语言模型中因统一优势信号导致的探索不足问题,提升推理准确性和路径简洁性。

Comments 17 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23048 2026-04-06 cs.AI 70%

From Abstract to Contextual: What LLMs Still Cannot Do in Mathematics

从抽象到语境:大语言模型在数学中仍无法做到的事情

Bowen Cao, Dongdong Zhang, Yixia Li, Junpeng Liu, Shijue Huang, Chufan Shi, Hongyuan Lu, Yaokang Wu, Guanhua Chen, Wai Lam, Furu Wei

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究揭示LLM在现实应用中数学推理能力不足,提出ContextMATH基准测试,发现正确问题建模是成功的关键,但建模与推理仍是限制因素。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02870 2026-04-06 cs.CV 67%

Token Warping Helps MLLMs Look from Nearby Viewpoints

令牌扭曲帮助多模态大语言模型从近处视角观察

Phillip Y. Lee, Chanho Park, Mingue Park, Seungwoo Yoo, Juil Koo, Minhyuk Sung

机构 * KAIST(韩国科学技术院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文研究令牌扭曲如何帮助多模态大语言模型从近处视角理解场景,发现反向令牌扭曲在视角变化中更稳定且能更好保持语义一致性。

Comments CVPR 2026, Project Page: https://token-warping-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01297 2026-04-06 cs.MA 67%

SimCity: Multi-Agent Urban Development Simulation with Rich Interactions

SimCity: 基于丰富交互的多智能体城市开发模拟

Yeqi Feng, Yucheng Lu, Hongyu Su, Yixin Tao, Tianxing He

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SimCity利用大语言模型构建可解释的宏观经济系统,通过自然语言推理实现灵活适应行为,模拟摩擦性劳动力市场、异质商品市场和金融市场,并通过视觉语言模型生成虚拟城市地图,复现宏观经济规律和城市扩张动态。

Comments 34 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03088 2026-04-06 cs.IR 67%

ADSeeker: A Knowledge-Grounded Reasoning Framework for Industry Anomaly Detection and Reasoning

ADSeeker: 一种基于知识的推理框架用于工业异常检测与推理

Kai Zhang, Zekai Zhang, Xihe Sun, Anpeng Wang, Jingmeng Nie, Qinghui Chen, Han Hao, Jianyuan Guo, Jinglin Zhang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 ADSeeker通过整合视觉文档知识库和查询图像-知识检索增强生成框架,提升工业异常检测性能,提出层次稀疏提示机制和类型级特征以提取异常模式,构建大规模AD数据集MulA,实现零样本状态下的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02733 2026-04-06 cs.AI 65%

DeltaLogic: Minimal Premise Edits Reveal Belief-Revision Failures in Logical Reasoning Models

DeltaLogic: 最小前提编辑揭示逻辑推理模型中的信念修正失败

Amit Dhanda

机构 * Amazon(亚马逊)

专题命中 推理与问题求解 :language model(abstract,comments);分类 cs.AI;large language model(comments)

AI总结 DeltaLogic通过最小证据变化评估逻辑推理模型的信念修正能力,发现初始推理能力强并不等于修正行为强,Qwen3-4B在修正任务中仍存在惯性失败,Phi-4-mini-instruct表现更优但仍有非 trivial 抽象问题。

Comments ICLR 2026 Workshop on Logical Reasoning of Large Language Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03074 2026-04-06 eess.AS cs.CL cs.SD 57%

Speaker-Reasoner: Scaling Interaction Turns and Reasoning Patterns for Timestamped Speaker-Attributed ASR

Speaker-Reasoner: 通过扩展交互轮次和推理模式实现时间戳化的说话者归属ASR

Zhennan Lin, Shuai Wang, Zhaokai Sun, Pengyuan Xie, Chuan Xie, Jie Liu, Qiang Zhang, Lei Xie

机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) Shanghai Lingguang Zhaxian Technology(上海灵光乍现科技)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出Speaker-Reasoner,一种端到端的语音大语言模型,通过迭代分析音频结构和自主预测时间边界,提升了多说话人对话的转录和理解能力,尤其在处理重叠语音和复杂轮次转换方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02972 2026-04-06 cs.CL 57%

NeuReasoner: Towards Explainable, Controllable, and Unified Reasoning via Mixture-of-Neurons

NeuReasoner:通过混合神经元实现可解释、可控和统一的推理

Haonan Dong, Kehan Jiang, Haoran Ye, Wenhao Zhu, Zhaolu Kang, Guojie Song

机构 * State Key Laboratory of General Artificial Intelligence, School of Intelligence Science and Technology, Peking University(北京大学智能科学与技术学院通用人工智能国家重点实验室) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院)

专题命中 推理与问题求解 :SFT(abstract);分类 cs.CL

AI总结 本文提出NeuReasoner框架,通过混合神经元解决推理中的内在错误、跨步震荡和实例适配问题,提升可解释性和可控性,实验显示在六个基准测试中性能提升达27.0%,token消耗降低19.6%-63.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02965 2026-04-06 cs.RO cs.CL 57%

Open-Loop Planning, Closed-Loop Verification: Speculative Verification for VLA

开环规划,闭环验证:VLA的推测验证

Zihua Wang, Zhitao Lin, Ruibo Li, Yu Zhang, Xu Yang, Siya Mi, Xiu-Shen Wei

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Nanyang Technological University(南洋理工大学) School of Cyber Science and Engineering, Southeast University(东南大学网络空间安全学院) Purple Mountain Laboratories(紫金山实验室)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.CL

AI总结 本文提出SV-VLA框架,结合高效开环长周期规划与轻量闭环在线验证,提升VLA在动态环境中的效率与可靠性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02409 2026-04-06 cs.CV cs.AI 57%

LumiVideo: An Intelligent Agentic System for Video Color Grading

LumiVideo:一种用于视频色彩分级的智能代理系统

Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

机构 * Northwestern University(西北大学) Northeastern University(东北大学) South China University of Technology(华南理工大学) Hong Kong Baptist University(香港浸会大学) Beijing Normal - Hong Kong Baptist University(北京师范大学-香港浸会大学)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.AI

AI总结 LumiVideo通过感知、推理、执行和反思四个阶段模仿专业调色师的工作流程,利用LLM和RAG框架实现非线性色彩参数空间导航,生成符合行业标准的色彩配置文件,并支持通过自然语言反馈进行迭代优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19798 2026-04-06 cs.SD cs.CL eess.AS 57%

Borderless Long Speech Synthesis

无边界的长语音合成

Xingchen Song, Di Wu, Dinghao Zhou, Pengyu Cheng, Hongwu Ding, Yunchao He, Jie Wang, Shengfan Shen, Sixiang Lv, Lichun Fan, Hang Su, Yifeng Wang, Shuai Wang, Meng Meng, Jian Luan

机构 * MiLM Plus, Xiaomi Inc., China(小米公司MiLM Plus,中国) Nanjing University, China(南京大学,中国) WeNet Open Source Community(WeNet开源社区)

专题命中 推理与问题求解 :LLM(abstract);分类 cs.CL

AI总结 本文提出无边界的长语音合成框架,通过统一能力集实现多说话人合成和长文本生成,采用全局-句子-token注释策略和连续分词器提升指令遵循能力,构建分层控制协议栈实现多模态输入到结构化生成命令的转换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03139 2026-04-06 cs.RO 50%

FSUNav: A Cerebrum-Cerebellum Architecture for Fast, Safe, and Universal Zero-Shot Goal-Oriented Navigation

FSUNav: 一种用于快速、安全和通用零样本目标导向导航的脑皮层-小脑架构

Mingao Tan, Yiyang Li, Shanze Wang, Xinming Zhang, Wei Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) College of Information Science and Technology, Eastern Institute of Technology(东方理工学院信息科学与技术学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出FSUNav架构,通过整合视觉语言模型与小脑-脑皮层模块,实现跨异构平台的零样本目标导航,提升效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03066 2026-04-06 eess.SY cs.SY 50%

Redefining End-of-Life: Intelligent Automation for Electronics Remanufacturing Systems

重新定义生命周期终点:面向电子再制造系统的智能自动化

Sibo Tian, Xiao Liang, Sara Behdad, Minghui Zheng

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 本文探讨电子再制造中智能自动化的核心挑战与机遇,分析机器人、控制与AI在构建可扩展、安全的再制造系统中的作用,提出多模态感知、不确定性决策等方法,为未来再制造系统发展提供指导。

Comments Accepted at the American Control Conference (ACC) 2026; to appear in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 62 篇

2604.03174 2026-04-06 cs.CL cs.AI 91%

Beyond the Parameters: A Technical Survey of Contextual Enrichment in Large Language Models: From In-Context Prompting to Causal Retrieval-Augmented Generation

超越参数:大型语言模型中上下文丰富技术的综述:从上下文提示到因果检索增强生成

Prakhar Bansal, Shivangi Agarwal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI

AI总结 本文综述了大型语言模型中通过增加结构化上下文来提升性能的技术,涵盖上下文学习、提示工程、检索增强生成等方法,并提出透明的文献筛选协议和可信检索增强NLP的研究优先级。

Comments 7 pages, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02754 2026-04-06 cs.SE 90%

An Empirical Study of Sustainability in Prompt-driven Test Script Generation Using Small Language Models

基于小型语言模型的提示驱动测试脚本生成的实证研究

Pragati Kumari, Novarun Deb

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);large language model(abstract);SLM(abstract)

AI总结 本文通过HumanEval基准和适应性提示变体,实证分析小型语言模型在测试脚本生成中的环境与性能权衡,揭示提示结构与模型选择对环境和性能的影响。

Comments 6 pages. arXiv admin note: substantial text overlap with arXiv:2602.18012

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01589 2026-04-06 cs.LG cs.AI 90%

SafeSci: Safety Evaluation of Large Language Models in Science Domains and Beyond

SafeSci: 科学领域及更广泛场景下大型语言模型的安全性评估

Xiangyang Zhu, Yuan Tian, Qi Jia, Kaiwei Zhang, Zicheng Zhang, Chunyi Li, Kaiyuan Ji, Dongrui Liu, Zijian Chen, Lu Sun, Renrui Zhang, Yan Teng, Jing Shao, Wei Sun, Xia Hu, Yu Qiao, Guangtao Zhai

机构 * Shanghai AI Lab(上海人工智能实验室) ECNU(华东师范大学) ByteDance(字节跳动)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SafeSci框架,通过SafeSciBench和SafeSciTrain评估和提升科学领域LLM的安全性,发现现有模型存在关键漏洞,并展示微调提升安全对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03216 2026-04-06 cs.CL 89%

BAS: A Decision-Theoretic Approach to Evaluating Large Language Model Confidence

BAS:一种基于决策理论的评估大语言模型置信度的方法

Sean Wu, Fredrik K. Gustafsson, Edward Phillips, Boyan Gao, Anshul Thakur, David A. Clifton

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Oxford Suzhou Centre for Advanced Research(牛津大学苏州高等研究院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

AI总结 本文提出BAS,一种基于决策理论的评估方法,用于评估大语言模型置信度在不同风险偏好下的决策支持能力,揭示置信度与决策可靠性之间的关系,并展示如何通过干预提升置信度可靠性。

Comments 24 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01444 2026-04-06 cs.CR 89%

Cooking Up Risks: Benchmarking and Reducing Food Safety Risks in Large Language Models

制造风险:在大型语言模型中基准测试和降低食品安全风险

Weidi Luo, Xiaofei Wen, Tenghao Huang, Hongyi Wang, Zhen Xiang, Chaowei Xiao, Kristina Gligorić, Muhao Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出FoodGuardBench基准,用于评估大型语言模型在食品安全领域的安全性和鲁棒性,发现现有模型存在对食品相关领域安全对齐不足、生成有害指令及防护措施失效等问题,并提出FoodGuard-4B作为改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.10656 2026-04-06 cs.SE 89%

Precision or Peril: A PoC of Python Code Quality from Quantized Large Language Models

精度与危险:从量化大语言模型中Python代码质量的证明概念

Eric L. Melin, Adam J. Torek, Nasir U. Eisty, Casey Kennington

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究探讨了小型LLM的代码生成性能及量化影响,发现生成代码存在质量和可维护性问题,强调在软件项目中需谨慎验证LLM生成的代码。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02710 2026-04-06 cs.RO cs.AI cs.CV 88%

V2X-QA: A Comprehensive Reasoning Dataset and Benchmark for Multimodal Large Language Models in Autonomous Driving Across Ego, Infrastructure, and Cooperative Views

V2X-QA:面向自动驾驶多视角的多模态大语言模型综合数据集与基准测试

Junwei You, Pei Li, Zhuoyu Jiang, Weizhe Tang, Zilin Huang, Rui Gan, Jiaxi Liu, Yan Zhao, Sikai Chen, Bin Ran

机构 * Department of Civil and Environmental Engineering, University of Wisconsin–Madison(威斯康星大学麦迪逊分校土木与环境工程系) Department of Civil and Architectural Engineering and Construction Management, University of Wyoming(怀俄明大学土木与建筑工程及施工管理系) School of Transportation, Southeast University(东南大学交通学院)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出V2X-QA数据集和基准测试,用于评估多模态大语言模型在自动驾驶中的多视角推理能力,揭示视角对性能的影响,并提出V2X-MoE模型以提升多视角推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02617 2026-04-06 cs.AI cs.CR cs.IR cs.LG cs.SI 87%

AutoVerifier: An Agentic Automated Verification Framework Using Large Language Models

AutoVerifier:基于大语言模型的代理自动化验证框架

Yuntao Du, Minh Dinh, Kaiyuan Zhang, Ninghui Li

机构 * Purdue University(普渡大学)

专题命中 评测与基准 :large language model(title);language model(title);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AutoVerifier框架,利用大语言模型自动化验证技术性声明,通过构建知识图谱实现六层递进验证,展示其在量子计算领域的应用效果。

Comments Winner of 2025-2026 Radiance Technologies Innovation Bowl

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02527 2026-04-06 cs.LG cs.AI 86%

Jump Start or False Start? A Theoretical and Empirical Evaluation of LLM-initialized Bandits

先发优势还是虚假开端?基于LLM初始化的多臂老虎机的理论与实证评估

Adam Bayley, Xiaodan Zhu, Raquel Aoki, Yanshuai Cao, Kevin H. Wilson

机构 * Queen’s University(女王大学) RBC Borealis

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究LLM生成的偏好在存在噪声和系统性偏差时对多臂老虎机性能的影响,发现30%以内噪声下初始化有效,40%后效果下降,50%后性能劣化。系统性偏差下,LLM初始化可能比冷启动更差,通过理论分析得出LLM初始化优于冷启动的充分条件。

Comments 25 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02359 2026-04-06 cs.CL cs.AI 86%

Using LLM-as-a-Judge/Jury to Advance Scalable, Clinically-Validated Safety Evaluations of Model Responses to Users Demonstrating Psychosis

利用LLM作为法官/陪审团推进模型响应用户表现精神病的可扩展、临床验证的安全性评估

May Lynn Reese, Markela Zeneli, Mindy Ng, Jacob Haimes, Andreea Damien, Elizabeth Stade

机构 * Apart Research Odyssean Institute London School of Economics and Political Science(伦敦政治经济学院) Stanford Institute for Human-Centered AI(斯坦福大学以人为本人工智能研究所)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用LLM作为法官或陪审团评估模型响应用户精神病表现的方法,开发了七项临床验证的安全标准,并展示了LLM作为法官在临床验证中的有效性。

Comments published at IASEAI 2026, preliminary work presented at GenAI4Health workshop at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02666 2026-04-06 cs.AI math.OC 85%

Let's Have a Conversation: Designing and Evaluating LLM Agents for Interactive Optimization

让我们交谈:设计和评估用于交互优化的LLM代理

Joshua Drossman, Alexandre Jacquillat, Sébastien Martin

机构 * Operations Research Center and Sloan School of Management, Massachusetts Institute of Technology(麻省理工学院运筹学研究中心和斯隆管理学院) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种可扩展的评估方法,通过对话评估优化代理,展示交互优化代理在解决学校调度问题时能获得更高质量的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.19108 2026-04-06 cs.SE 85%

A Multi-Language Perspective on the Robustness of LLM Code Generation

多语言视角下的大型语言模型代码生成鲁棒性研究

Fazle Rabbi, Zishuo Ding, Jinqiu Yang

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文从多语言角度评估了代码生成模型的鲁棒性,通过扰动文档字符串、函数名、语法和格式等关键提示部分,发现不同语言和扰动类型对模型性能影响不同,且增大模型规模并不能显著提升鲁棒性。

Comments 50 pages, 10 figures, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00799 2026-04-06 cs.CV cs.CL cs.LG 84%

Multimodal Language Models Cannot Spot Spatial Inconsistencies

多模态语言模型无法发现空间不一致性

Om Khangaonkar, Hadi J. Rad, Hamed Pirsiavash

机构 * University of California, Davis(加州大学戴维斯分校) Shell(壳牌) TU Delft(代尔夫特理工大学)

专题命中 评测与基准 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

AI总结 研究探讨多模态大语言模型在识别3D几何空间不一致性方面的不足,提出生成空间不一致图像对的方法,发现先进模型在该任务上表现欠佳,揭示其对物理世界理解的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03141 2026-04-06 cs.CL 83%

Beyond Precision: Importance-Aware Recall for Factuality Evaluation in Long-Form LLM Generation

超越精确度:面向长文本LLM生成的事实性评估中的重要性感知召回

Nazanin Jafari, James Allan, Mohit Iyyer

机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) University of Maryland(马里兰大学)

专题命中 评测与基准 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种综合衡量精确度与召回的框架,通过外部知识源构建参考事实,并引入基于相关性和显著性的权重方案,揭示当前LLM在长文本生成中事实性不完整的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏