arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-07-02 至 2026-07-02 共收录 294 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 39 篇

2607.00361 2026-07-02 cs.CR 新提交 78%

ReShift: Aha-Moment-Driven Reasoning-Level Backdoor Attacks on Vision-Language Models

ReShift: 视觉-语言模型上基于“啊哈时刻”驱动的推理级后门攻击

Zhihao Dou, Qinjian Zhao, Zhiqiang Gao, Sumon Biswas

专题命中 推理与问题求解 :language model(title,abstract)

AI总结 提出ReShift框架,通过“啊哈时刻”驱动推理轨迹重定向,结合PRDC管道和SRJO策略实现隐蔽的后门攻击,理论保证熵反弹与轨迹发散的联系。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18372 2026-07-02 cs.HC cs.AI cs.CY cs.ET 77%

The Hidden Cost of Contextual Sycophancy: an AI Literacy Intervention in Human-AI Collaboration

上下文谄媚的隐性成本:人类-人工智能协作中的AI素养干预

Cansu Koyuturk, Sabrina Guidotti, Dimitri Ognibene

机构 * Università degli Studi di Milano-Bicocca(米兰-比科卡大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本研究探讨了在人类-人工智能协作中上下文谄媚现象的成因,并通过干预提升AI素养和提示能力以减轻其影响,发现AI反馈质量受用户错误传播影响显著,提示需系统层面改进以促进批判性参与。

Comments SPRINGER AIED 2026: Accepted for LBR, poster presentation at the 27th International Conference on Artificial Intelligence in Education, 27 Jun - 3 Jul 2026, Seoul, Republic of Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17731 2026-07-02 cs.CV cs.LG 版本更新 77%

VisReason: A Large-Scale Dataset for Visual Chain-of-Thought Reasoning

VisReason: 面向视觉思维链推理的大规模数据集

Lingxiao Li, Yifan Wang, Xinyan Gao, Chen Tang, Xiangyu Yue, Chenyu You

机构 * Stony Brook University(石溪大学) Boston University(波士顿大学) MMLab, The Chinese University of Hong Kong(香港中文大学多媒体实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.LG

AI总结 为解决多模态大模型缺乏大规模视觉思维链数据的问题,构建包含48.9万样本的VisReason数据集及专家级子集VisReason-Pro,通过微调Qwen2.5-VL模型显著提升逐步视觉推理准确性与泛化能力。

Comments ECCV Camera Ready, project page: https://y-research-sbu.github.io/VisReason/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00562 2026-07-02 cs.SE 新提交 75%

Towards Better Linux Kernel Fault Localization: Leveraging Contrastive Reasoning and Hierarchical Context Analysis

迈向更好的Linux内核故障定位:利用对比推理和层次上下文分析

Haichi Wang, Ruiguo Yu, Yesong Pang, Yingquan Zhao, Junjie Chen, Jiajun Jiang, Zan Wang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);prompting(abstract)

AI总结 提出CoHiKer方法,通过对比推理分析测试用例行为差异,结合层次上下文分析从文件到方法逐级缩小定位范围,在Linux内核故障定位中Top-1准确率提升高达26.07%(文件级)和56.85%(方法级)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00491 2026-07-02 cs.CV cs.AI cs.CL 新提交 73%

MindEdit-Bench: Benchmarking Object-Level Counterfactual Spatial Reasoning in VLMs from In-the-Wild Photos

MindEdit-Bench:基于野外照片的VLM中对象级反事实空间推理基准

Leyuan Yu, Xiao Tang, Minghao Liu, Xinyuan Li, Xiaokai Bai, Sheng Zhou, Qunshu Lin, Weihao Xuan, Naoto Yokoya

机构 * ZODA Zhejiang University(浙江大学) Tongji University(同济大学) The University of Tokyo(东京大学)

专题命中 推理与问题求解 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出MindEdit-Bench基准,包含六项空间推理任务,其中两项新任务(L4和L5)测试对象级反事实推理,VLM平均准确率仅8%-31%,远低于人类的81%-97%。

Comments 18 pages, 7 figures. Dataset available at https://huggingface.co/datasets/ZODAOfficial/MindEdit-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27669 2026-07-02 cs.CL 新提交 70%

When Search Agents Should Ask: DiscoBench for Clarification-Aware Deep Search

搜索代理何时应提问:面向澄清感知的深度搜索的DiscoBench基准

Yiling Tao, Shihan Deng, Meiling Tao, Pengzhi Wei, Zhichao Hu, Zhihao Zhu

机构 * Hunyuan, Tencent(腾讯混元) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DiscoBench基准,评估大语言模型搜索代理在深度搜索中主动识别歧义、提出有效澄清问题并恢复正确推理路径的能力,实验表明歧义检测与有效澄清是不同能力,且盲目搜索不如直接猜测。

Comments 26 pages, 7 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00881 2026-07-02 cs.CV 新提交 67%

OmniView-Space: Reinforcing Spatial Reasoning via Multi-Perspective Spatial Mapping

OmniView-Space: 通过多视角空间映射增强空间推理

Xudong Li, Mengdan Zhang, Peixian Chen, Jiaxi Tan, Zihao Huang, Jingyuan Zheng, Yan Zhang, Xiawu Zheng, Xing Sun, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) Tencent Youtu Lab(腾讯优图实验室) Beijing Institute of Technology(北京理工大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出OmniView-Space框架,通过多视角空间映射、工具引导的自我中心推理和认知图蒸馏,解决多模态大模型在多步空间推理中的参考框架动态重锚问题,在单/多图像基准上达到最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00672 2026-07-02 cs.CV 新提交 67%

DART: Difficulty-Adaptive Routing for Zero-Shot Video Temporal Grounding

DART: 难度自适应路由用于零样本视频时间定位

Zhengbo Zhang, Mark He Huang, Zhigang Tu, Ming-Hsuan Yang

机构 * Singapore University of Technology and Design(新加坡科技设计大学) Wuhan University(武汉大学) University of California, Merced(加州大学默塞德分校)

专题命中 推理与问题求解 :language model(abstract);prompting(abstract)

AI总结 提出DART方法,通过难度感知路由和结构化推理,利用DPP选择关键帧并评估难度,对简单查询快速预测,复杂查询使用时间标记提示分解定位,在零样本视频时间定位中取得SOTA性能。

Comments Accepted to the European Conference on Computer Vision (ECCV) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00654 2026-07-02 cs.CV 新提交 67%

Linguistic Relative Policy Optimization for Video Anomaly Reasoning

语言相对策略优化用于视频异常推理

Jiaxu Leng, Jiankang Zheng, Mengjingcheng Mo, Zhanjie Wu, Haosheng Chen, Ji Gan, Xinbo Gao

机构 * Chongqing College of Artificial Intelligence(重庆人工智能学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出语言相对策略优化(LRPO),通过从多个推理轨迹中提取群体相对语义优势,构建语言表达的异常经验先验,无需参数更新即可引导模型输出,在无调参设置下显著超越现有方法。

Comments Accepted at ICML 2026; 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00461 2026-07-02 cs.CV 新提交 67%

Multimodal Continuous Reasoning via Asymmetric Mutual Variational Learning

非对称互变分学习实现多模态连续推理

Shijie Li, Yilin Gao, Siyuan Yang, Tieyuan Chen, Chaofan Gan, Zhihao He, Zicheng Zhao, Yuyu Guo, Weiyao Lin, Hang Yu

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对多模态大语言模型离散推理丢失感知细节及训练-推理不匹配问题,提出非对称互变分学习框架,通过双向KL散度校准先验与后验,缓解答案泄露,提升连续潜在推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00422 2026-07-02 cs.CR 新提交 67%

KidnapRAG: A Black-Box Attack for Hijacking Reasoning in Agentic Retrieval-Augmented Generation Systems

KidnapRAG:针对代理式检索增强生成系统中推理劫持的黑盒攻击

Chanwoo Choi, Euntae Kim, Kyuho Lee, Youngsam Chun, Jinhee Jeong, Eunmi Kim, Myunggyo Oh, Junseo Jang, Buru Chang

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 提出KidnapRAG,一种针对代理式RAG系统的黑盒顺序投毒攻击,通过三种角色文档(诱饵、链环、恶意指令)劫持多步推理链,实验表明在多种框架和基准上优于现有方法。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00302 2026-07-02 cs.CV cs.MM cs.RO 新提交 67%

Wake up for Touch! Mask-isolated Tactile Alignment Learning in MLLMs

醒来触摸!多模态大语言模型中的掩码隔离触觉对齐学习

Yoonhyung Park, Minji Kim, Sungwon Moon, Jiyoung Lee

机构 * Division of Artificial Intelligence & Software(人工智能与软件系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 提出Splash框架,通过参数空间划分(休眠/关键子空间)实现非破坏性触觉模态扩展,在不增加推理开销下保持视觉语言能力,在触觉基准上达到SOTA。

Comments ECCV 2026, Project page: http://mmai.ewha.ac.kr/splash/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30524 2026-07-02 cs.SE 版本更新 67%

The Illusion of Agentic Complexity in README.md Generation: Evaluating Single-Agent vs. Multi-Agent RAG Systems

README.md生成中的代理复杂性幻觉:评估单代理与多代理RAG系统

Abu Saleh, Tesfay Welegebreal Tesfay, Phuong T. Nguyen, Juri Di Rocco, Muhammad Umar Zeshan, Davide Di Ruscio

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 通过对比单代理、多代理和开发者引导规划三种RAG架构生成GitHub仓库README文件,发现单代理管道在词汇质量相当的情况下,令牌消耗降低86%、速度提升一倍,而多代理系统结构一致性达98%但存在规划瓶颈,开发者引导规划获得最佳文档质量。

Comments The paper has been peer-reviewed and accepted to the 42nd International Conference on Software Maintenance and Evolution (ICSME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06254 2026-07-02 cs.CV cs.RO eess.IV 版本更新 67%

NOVA: Next-step Open-Vocabulary Autoregression for 3D Multi-Object Tracking in Autonomous Driving

NOVA:自动驾驶中3D多目标跟踪的下一步开放词汇自回归

Kai Luo, Xu Wang, Rui Fan, Kailun Yang

机构 * College of Mechanical and Vehicle Engineering, Hunan University(湖南大学机械与运载工程学院) State Key Laboratory of Intelligent Autonomous Systems, Tongji University(同济大学智能自主系统国家重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 提出NOVA方法,通过自回归关联将3D多目标跟踪转化为轨迹条件时空语义序列完成,利用大语言模型实现开放词汇泛化,在nuScenes等数据集上显著提升新类别跟踪性能。

Comments Accepted to IROS 2026. Code will be available at https://github.com/xifen523/NOVA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18011 2026-07-02 cs.CV 版本更新 67%

RoadBench: Benchmarking MLLMs on Fine-Grained Spatial Understanding and Reasoning under Urban Road Scenarios

RoadBench: 在城市道路场景下对多模态大语言模型进行细粒度空间理解与推理的基准测试

Jun Zhang, Xin Zhang, Jie Feng, Long Chen, Junhui Wang, Zhicheng Liu, Depeng Jin, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(清华大学电子工程系、北京信息科学与技术国家研究中心) Zhongguancun Academy(中关村学院) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 针对城市复杂场景中多模态大语言模型在细粒度空间理解与推理能力上的不足,提出RoadBench基准,包含8个任务、3040个测试用例,通过鸟瞰图和第一人称视角图像评估模型性能,揭示现有模型在此类任务上的显著缺陷。

Comments Accepted by ECCV 2026, the code and data are publicly available at: https://github.com/tsinghua-fib-lab/RoadBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00862 2026-07-02 cs.CL cs.AI 新提交 62%

CAT: Confidence-Adaptive Thinking for Efficient Reasoning of Large Reasoning Models

CAT:面向大型推理模型高效推理的置信度自适应思考

Qizhi Jiang, Shuo Wang, Pei Ke, Yuhang Song, Ke Qin

机构 * Laboratory of Intelligent Collaborative Computing, University of Electronic Science and Technology of China(电子科技大学智能协同计算实验室) Ubiquitous Intelligence and Trusted Services Key Laboratory of Sichuan Province(四川省泛在智能与可信服务重点实验室)

专题命中 推理与问题求解 :preference optimization(abstract);分类 cs.CL、cs.AI

AI总结 提出置信度自适应思考(CAT)框架,利用模型内在自确信信号作为置信度,通过偏好优化自主调节推理长度,在保持准确率的同时压缩简单问题的推理开销。

Comments Accepted at ACL 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13059 2026-07-02 cs.LG cs.AI 版本更新 62%

Competition-Aware CPC Forecasting with Near-Market Coverage

竞争感知的CPC预测与近市场覆盖

Sebastian Frey, Edoardo Beccari, Maximilian Kranz, Nicolò Alberto Pellizzari, Ali Mete Karaman, Qiwei Han, Maximilian Kaiser

机构 * Nova School of Business and Economics(新里斯本大学商业与经济学院) University of Hamburg(汉堡大学)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 针对付费搜索中部分可观测的竞争环境,提出结合语义邻域、行为邻域和地理意向协变量的竞争感知CPC预测方法,在短期(1周)图模型降低sMAPE 15.1%,长期(6-12周)协变量增强基础模型降低sMAPE 22.5%-27.6%。

Comments 17 pages, 2 figures, 6 tables, European Conference on Machine Learning and Principles and Practice of Knowledge Discovery in Databases (ECML/PKDD), the code is availale at https://github.com/Sebastian-Frey/Competition-Aware-GNNs-for-TimeSeriesForecasting

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00820 2026-07-02 cs.SE 新提交 50%

Knowledge-Enhanced Agentic Vulnerability Repair

知识增强的智能体漏洞修复

Sicong Cao, Hao Ma, Le Yu, Kangyi Ding, Xiaolei Liu, Terry Yue Zhuo, Bo Wang, Xingwei Lin, Xiaobing Sun, Linzhang Wang, David Lo

专题命中 推理与问题求解 :foundation model(abstract)

AI总结 提出KeaRepair,一种基于智能体的自动化漏洞修复方法,通过提取历史漏洞知识并利用工具增强的智能体进行诊断,生成并迭代优化补丁,在55个C/C++漏洞上修复率达83.64%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20907 2026-07-02 cs.CV 版本更新 50%

PanoGrounder: Bridging 2D and 3D with Panoramic Scene Representations for VLM-based 3D Visual Grounding

PanoGrounder: 利用全景场景表示桥接2D和3D,实现基于VLM的3D视觉定位

Seongmin Jung, Seongho Choi, Gunwoo Jeon, Minsu Cho, Jongwoo Lim

机构 * Seoul National University(首尔大学) Robotics Lab, Hyundai Motor Company(现代汽车公司机器人实验室) Pohang University of Science and Technology (POSTECH)(浦项科技大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出PanoGrounder框架,通过多模态全景表示与预训练2D VLM结合,实现强泛化能力的3D视觉定位,在ScanRefer和Nr3D上取得最优结果。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 72 篇

2606.16511 2026-07-02 cs.LG 新提交 92%

Tail-Shape Estimation in LLM Evaluation Is Fragile: A Protocol for Diagnosing False Positives

LLM评估中的尾部形状估计是脆弱的:诊断假阳性的协议

Luca Zhou

机构 * Sapienza University of Rome(罗马大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一个协议,用于检验LLM评估中尾部形状估计的假阳性,通过极值理论指标区分尾部重量和尾部质量,并在毒性评估中识别出三种假阳性模式。

Comments 9 pages of main paper, 4 figures and 4 tables in the main paper, more in the appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17314 2026-07-02 cs.SE cs.LG 版本更新 92%

Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs

Clotho:用于LLM输入的任务特定预生成测试充分性度量

Juyeon Yoon, Somin Kim, Robert Feldt, Shin Yoo

机构 * Korea Advanced Institute of Science and Technology(韩国科学技术院) Chalmers University of Technology Gothenburg Sweden(楚德大学哥德堡瑞典) Chalmers University of Technology(楚德大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Clotho通过分析LLM隐藏状态直接估计输入难度,无需生成输出即可评估测试输入的有效性,提升测试效率并降低LLM执行成本。

Comments FSE 2026 Camera Ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00403 2026-07-02 cs.HC cs.CR cs.CY 新提交 91%

A Penny for Your Prompts: Experiments Detecting and Mitigating LLM Usage by Survey Respondents

为提示付费:检测和减轻调查受访者使用LLM的实验

Zane Xu, Nathan Malkin

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 本研究通过系列实验量化调查中LLM辅助响应的普遍性,发现其频率因平台而异(Prolific低于10%,MTurk超过80%),并测试了禁用复制粘贴等缓解措施,但未能显著提升数据质量。

Comments Published at SOUPS 2026 (Symposium on Usable Privacy and Security)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00276 2026-07-02 cs.LG cs.AI cs.CL 新提交 91%

Testing Frontier Large Language Models' Physics Literacy in Parallel Physical Worlds

测试前沿大语言模型在平行物理世界中的物理素养

Dong Zhang

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.CL、cs.AI、cs.LG

AI总结 提出四阶段诊断方法评估LLM在陌生物理框架中的推理能力,在三个平行世界测试发现定性-定量不对称及自我审查薄弱。

Comments 37 pages, 2 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.03301 2026-07-02 cs.CL cs.AI 版本更新 91%

SHIELD: A Diverse Clinical Note Dataset and Distilled Small Language Models for Enterprise-Scale De-identification

SHIELD: 一个多样化的临床笔记数据集和蒸馏小语言模型,用于企业级去标识化

Jose D. Posada, David Love, Somalee Datta, Priya Desai

机构 * Stanford Medicine(斯坦福医学院)

专题命中 评测与基准 :language model(title,abstract);small language model(title,abstract);LLM(abstract_cn);large language model(abstract)

AI总结 针对现有临床去标识化基准数据集的不足,构建了包含1381份笔记、10229个PHI标注的多样化数据集SHIELD,并通过教师-学生蒸馏框架将大语言模型能力迁移至可本地部署的小模型,在标准工作站上达到0.89精确率和0.88召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00700 2026-07-02 cs.SE cs.AI cs.PL 新提交 90%

LLVM-Bench: Benchmarking and Advancing Large Language Models for LLVM Compiler Issue Resolution

LLVM-Bench:面向LLVM编译器问题解决的大语言模型基准测试与推进

Zhao Tian, Yingquan Zhao, Chenyao Suo, Meng Wang, Junjie Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出LLVM-Bench基准和LLVM-Gym平台,评估大语言模型在LLVM编译器问题解决上的表现,并设计集成方法LLVM-Ens提升解决率至21.99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00297 2026-07-02 cs.LG cs.CL 新提交 90%

EPC: A Standardized Protocol for Measuring Evaluator Preference Dynamics in LLM Agent Systems

EPC:一种用于测量LLM智能体系统中评估者偏好动态的标准协议

Zewen Liu

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.LG

AI总结 提出EPC协议,通过四阶段隔离范式标准化测量LLM智能体系统中评估者偏好耦合现象,并提供参考快照和版本约定以支持复现、比较和衰减检测。

Comments 10 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01233 2026-07-02 cs.CL cs.AI 新提交 90%

Measuring the Gap Between Human and LLM Research Ideas

衡量人类与LLM研究想法之间的差距

Ziyu Chen, Yilun Zhao, Arman Cohan

机构 * Yale University(耶鲁大学) University of Chicago(芝加哥大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 本文构建大规模评估框架,通过逆向工程提取论文核心想法,引入双轴研究品味分类法,发现LLM想法集中在桥梁式机会和综合方法,而人类想法分布更广,揭示两者系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00604 2026-07-02 math.OC 新提交 90%

Vehicle Routing Problem Meets Large Language Models: An Overview and Perspectives

车辆路径问题遇上大语言模型:综述与展望

Xianchao Xiu, Chong Shen, Yanjiao Zhu, Wanquan Liu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 综述大语言模型在车辆路径问题中的应用,涵盖模型构建、算法设计、协调工具等角色,并讨论基准测试与实验。

Comments working in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17041 2026-07-02 cs.CL cs.IR 新提交 90%

MetaSyn: A Benchmark for LLM Agents on Meta-Analysis Articles from Nature Portfolio

对Nature Portfolio元分析文章进行LLM代理基准测试

Anzhe Xie, Weihang Su, Yujia Zhou, Yiqun Liu, Min Zhang, Qingyao Ai

机构 * Tsinghua University(清华大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出MetaSyn数据集,包含442篇专家策划的元分析,用于评估LLM代理在检索-筛选-综合全流程中的表现,发现当前系统在筛选阶段存在严重瓶颈。

Comments 17 pages, 8 figures, 11 tables. Code and evaluation: https://github.com/THUIR/MetaSyn Dataset: https://huggingface.co/datasets/THUIR/MetaSyn Model: https://huggingface.co/BFTree/MA-Retriever

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01040 2026-07-02 cs.IR 新提交 89%

As It Was: Aligning LLM Search Evaluation with Historical User Preferences

如其所是:将LLM搜索评估与历史用户偏好对齐

Ali Vardasbi, Gustavo Penha, Enrico Palumbo, Claudia Hauff, Hugues Bouchard, Mounia Lalmas

专题命中 评测与基准 :LLM(title,title_cn)

AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。

详情

展开后加载摘要…

URL PDF HTML 收藏