arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-15 至 2026-06-15 共收录 242 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 39 篇

2406.09250 2026-06-15 cs.CV cs.AI cs.LG 版本更新 81%

MirrorCheck: Efficient Adversarial Defense for Vision-Language Models

MirrorCheck: 视觉-语言模型的高效对抗防御

Samar Fares, Klea Ziu, Toluwani Aremu, Nikita Durasov, Martin Takáč, Pascal Fua, Ivan Laptev, Karthik Nandakumar

机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) NVIDIA École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) Michigan State University(密歇根州立大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG

AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11718 2026-06-15 cs.AR 新提交 80%

Making Locality-aware GEMM Compatible with Page-Granularity Placement on Chiplet GPUs

使局部感知的GEMM与Chiplet GPU上的页粒度放置兼容

Euijun Chung, Jae Hyung Ju, Hyesoon Kim

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对多芯片GPU非均匀内存系统中局部感知数据放置与固定页粒度交错不兼容的问题,提出Chiplet-Contiguous Layout,通过全局内存布局存储芯片局部连续数据,无需修改操作系统或硬件即可兼容页粒度放置,显著降低远程HBM流量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.15496 2026-06-15 cs.HC cs.RO 80%

Fast Multi-Party Open-Ended Conversation with a Social Robot

快速多方开放性对话与社交机器人

Giulio Antonio Abbo, Maria Jose Pinto-Bernal, Martijn Catrycke, Tony Belpaeme

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出一种结合多模态感知与大语言模型的多方对话系统,评估结果显示其在平行对话和小组讨论中表现出高参与度和准确率,但存在语音识别误差和响应延迟等技术限制。

Comments 15 pages, 5 figures, 4 tables; 2 appendices

Journal ref Front. Robot. AI 13:1766383 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14243 2026-06-15 cs.CL 新提交 77%

Decoupled Mixture-of-Experts for Parametric Knowledge Injection

解耦混合专家用于参数化知识注入

Baoqing Yue, Weihang Su, Qingyao Ai, Yichen Tang, Changyue Wang, Jiacheng Kang, Jingtao Zhan, Yiqun Liu

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 提出解耦混合专家(DMoE)架构,将外部知识转化为独立可更新的专家模块,通过轻量级不确定性感知路由器在基础模型知识不足时激活相关专家,实现参数级知识增强,在知识密集型基准上优于检索和适配器基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01476 2026-06-15 cs.LG cs.CL 版本更新 73%

OmniOPD: Logit-Free On-Policy Distillation via Speculative Verification

OmniOPD:通过推测性验证实现无Logit的在线策略蒸馏

Yuhang Zhou, Lizhu Zhang, Yifan Wu, Mingyi Wang, Bo Peng, Jiayi Liu, Xiangjun Fan, Zhuokai Zhao

机构 * Meta AI

专题命中 效率与部署 :SFT(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出OmniOPD框架,通过基于蒙特卡洛展开的块级语义相似度替代token级logit匹配,结合峰值熵调度器和贝叶斯先验,解决在线策略蒸馏中logit不可获取和信号脆弱问题,在数学任务上超越标准OPD达28.64%。

Comments 26 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02230 2026-06-15 cs.LG cs.AI 版本更新 73%

Generalized Discrete Diffusion with Self-Correction

广义离散扩散与自校正

Linxuan Wang, Ziyi Wang, Yikun Bai, Wei Deng, Guang Lin, Qifan Song

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 提出自校正离散扩散模型(SCDD),通过显式状态转移和离散时间学习,简化训练噪声调度,消除冗余重掩码步骤,在GPT-2规模上实现高效并行解码并保持生成质量。

Comments 40 pages, 3 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14327 2026-06-15 cs.SE cs.AI cs.ET 新提交 70%

I'm Sorry Driver, I'm Afraid I Can't Do That: Appraising the Safety of LLMs within Automotive Contexts

抱歉,司机,恐怕我不能这么做:评估LLMs在汽车环境中的安全性

Shaun Feakins, Ibrahim Habli, Kim Littler, Robert Palin

机构 * UKRI AI Centre for Doctoral Training in Safe Artificial Intelligence Systems (SAINTS)(英国研究理事会安全人工智能系统博士培训中心(SAINTS)) University of York(约克大学) Jaguar Land Rover(捷克·陆罗恩)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 本文从安全保证角度评估了将LLMs集成到汽车控制任务中的现有框架,指出其面临概念和具体挑战,并通过案例研究提出未来保障机制。

Comments Accepted at the Dependable AI in Embedded Systems (DAIES) Workshop at SAFECOMP 2026; 15 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05983 2026-06-15 cs.LG 版本更新 70%

Towards Steering without Sacrifice: Principled Training of Steering Vectors for Prompt-only Interventions

无牺牲的引导:面向仅提示干预的引导向量的原则性训练

Yuntai Bao, Qinfeng Li, Xinyan Yu, Ge Su, Wenqi Zhang, Liu Yan, Haiqin Weng, Jianwei Yin, Xuhong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 提出联合训练引导因子和方向的方法,消除后验因子选择;引入仅提示引导向量(PrOSV),仅干预少量提示词,在AxBench上优于传统全序列引导向量,并实现更好的通用模型效用与对抗鲁棒性权衡。

Comments 63 pages, 50 figures; accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03716 2026-06-15 cs.LG cs.CY 版本更新 70%

A Water Efficiency Dataset for African Data Centers

非洲数据中心用水效率数据集

Noah Shumba, Opelo Tshekiso, Pengfei Li, Giulia Fanti, Shaolei Ren

机构 * Carnegie Mellon University(卡内基梅隆大学) Carnegie Mellon University Africa Kigali Rwanda(卡内基梅隆大学非洲分校,基亚利,卢旺达) Rochester Institute of Technology(罗切斯特理工学院) Rochester New York USA(罗切斯特,纽约州,美国) Carnegie Mellon University Pittsburgh Pennsylvania USA(卡内基梅隆大学匹兹堡,宾夕法尼亚州,美国) University of California, Riverside(加州大学河滨分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 构建首个结合天气与发电数据的非洲41国数据中心用水效率数据集,评估Llama-3-70B和GPT-4推理用水量,发现多数非洲国家用水低于全球平均。

Comments Accepted by NeurIPS 2024 Workshop on Tackling Climate Change with Machine Learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14602 2026-06-15 cs.RO 新提交 67%

What Robots Do Matters More Than What They Look Like: Task Context Shapes Trust in Educational HRI

机器人做什么比它们长什么样更重要:任务背景塑造教育人机交互中的信任

Anna-Maria Velentza, Konstantina Nikou, Anne-Gwenn Bosser, Nikolaos Fachantidis

机构 * LIRES Robotics Lab, University of Macedonia(马其顿大学LIRES机器人实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract)

AI总结 通过视频实验(N=81)发现,任务类型(教学、指导、索要个人信息)对信任有显著主效应,而机器人外观无显著影响,表明任务背景比物理外观更关键。

Comments Accepted in the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026), Kitakyushu, Fukuoka, Japan

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14703 2026-06-15 cs.CV cs.CL cs.LG 新提交 62%

Gaze Heads: How VLMs Look at What They Describe

注视头:视觉语言模型如何观察它们所描述的内容

Rohit Gandikota, David Bau

机构 * Northeastern University(东北大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 发现视觉语言模型的语言骨干中存在一组“注视头”,其注意力跟踪当前描述的图像区域,通过干预这些头可精确控制模型描述内容,准确率达83.1%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14060 2026-06-15 cs.LG cs.CL 新提交 62%

Non-Parametric Machine Text Detection via Multi-View Gaussian Processes

非参数化机器文本检测:基于多视角高斯过程

Aleem Khan, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出多视角非参数检测框架,通过高斯过程集成互补特征视图,提高对对抗攻击的鲁棒性,并提供校准概率和分布外输入的原则性弃权。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14598 2026-06-15 cs.LG 新提交 57%

Realizing Native INT8 Compute for Diffusion Transformers on Consumer GPUs: A Fused INT8 GEMM Kernel for Ideogram 4.0

在消费级GPU上实现扩散Transformer的原生INT8计算:用于Ideogram 4.0的融合INT8 GEMM内核

Ali Asaria, Tony Salomone, Deep Gandhi

机构 * Transformer Lab

专题命中 效率与部署 :post-training(abstract);分类 cs.LG

AI总结 针对消费级Ampere GPU上INT8量化比FP8/NF4更慢的问题,提出融合Triton INT8 GEMM内核,直接利用INT8张量核心,在Ideogram 4.0中实现2.8-4.2倍加速,端到端速度提升约10%,使1024px单卡可行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14353 2026-06-15 cs.LG 新提交 57%

Can Deep Neural Networks Improve Compression of Very Large Scientific Data?

深度神经网络能否改善超大规模科学数据的压缩?

Muhannad Alhumaidi, Guozhong Li, Spiros Skiadopoulos, Panos Kalnis

机构 * King Abdullah University of Science and Technology(阿卜杜拉国王科技大学) University of the Peloponnese(伯罗奔尼撒大学)

专题命中 效率与部署 :foundation model(abstract);分类 cs.LG

AI总结 本文提出将深度学习预测器集成到传统误差有界压缩框架中,通过气候数据实验发现,尽管ML预测器能提高预测精度和重建质量,但由于残差空间结构影响熵编码效率,未能提升整体压缩比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14277 2026-06-15 cs.CV 新提交 50%

One Layer's Trash is Another Layer's Treasure: Adaptive Layer-wise Visual Token Selection in LVLMs

一层的垃圾是另一层的宝藏:LVLMs中自适应逐层视觉标记选择

Yongru Chen, Kai Zhang, Zeliang Zong, Yuchen Lu, Wenming Tan, Ye Ren, Jilin Hu

机构 * Hikvision Research Institute(海康威视研究院) Peking University(北京大学) East China Normal University(华东师范大学)

专题命中 效率与部署 :language model(abstract)

AI总结 提出自适应逐层视觉标记选择(ALVTS),通过轻量级选择器为不同层路由重要标记,实现高效压缩,在89%压缩率下保留96.7%精度。

Comments Accepted by CVPR 2026 (highlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14032 2026-06-15 cs.RO 新提交 50%

From Attacks to Curricula: Learnability-Guided Adversarial Training for Safe Autonomous Driving

从攻击到课程:面向安全自动驾驶的可学习性引导对抗训练

Yuewen Mei, Tong Nie, Jie Sun, Haotian Shi, Wei Ma, Jian Sun

机构 * College of Transportation & Key Laboratory of Road and Traffic Engineering of Ministry of Education, Tongji University(同济大学交通运输工程学院 & 道路与交通工程教育部重点实验室) Department of Civil and Environmental Engineering, The Hong Kong Polytechnic University(香港理工大学土木与环境工程学系)

专题命中 效率与部署 :preference optimization(abstract)

AI总结 提出AlignADV框架,通过偏好对齐生成可解决场景,并利用行为指纹预测策略能力,动态采样课程以提升自动驾驶对抗训练的收敛效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21632 2026-06-15 cs.ET 版本更新 50%

Position: Sustainable Open-Source AI Requires Tracking the Cumulative Footprint of Derivatives

立场:可持续的开源AI需要追踪衍生物的累积足迹

Shaina Raza, Iuliia Zarubiieva, Ahmed Y. Radwan, Nathaniel Lesperance, Deval Pandya, Sedef Akinli Kocak, Graham W. Taylor

专题命中 效率与部署 :foundation model(abstract)

AI总结 本文主张开源AI的可持续性不能仅依赖计算效率,而需通过数据与影响核算(DIA)框架追踪模型衍生物链的累积环境足迹,实现生态级问责。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13289 2026-06-15 eess.SP 版本更新 50%

Semantic Communication for the Internet of Underwater Things: Architectures, Applications, Challenges, and Future Directions

水下物联网的语义通信:架构、应用、挑战与未来方向

Ruhul Amin Khalil, Asiya Jehangir, Hanane Lamaazi, Saddaf Rubab, Nasir Saeed

专题命中 效率与部署 :language model(abstract)

AI总结 本文综述了语义通信在水下物联网中的应用,探讨了其架构、学习驱动方法及代表性应用,并指出了关键研究方向,旨在提升资源受限水下网络的通信效率。

Comments 33 pages, 10 figures, and 9 tables. The paper is submitted to IEEE for Possible Publication

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 领域大模型 18 篇

2606.14117 2026-06-15 stat.ME cs.AI 新提交 91%

A Two-Stage Statistical Framework for Evaluating Associative Interference in Large Language Models

评估大语言模型中联想干扰的两阶段统计框架

Achraf Cohen, Andrew Kincaid

机构 * Department of Mathematics and Statistics, University of West Florida(数学与统计学系,西弗吉尼亚大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出两阶段统计框架,分离响应遵从性与任务一致性,评估三个LLM在性别-职业等领域的联想干扰,发现效应因模型而异。

Comments 11 pages; 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.07609 2026-06-15 cs.IR cs.CL cs.CY 版本更新 90%

Is ChatGPT Fair for Recommendation? Evaluating Fairness in Large Language Model Recommendation

ChatGPT 在推荐中是否公平?评估大语言模型推荐的公平性

Jizhi Zhang, Keqin Bao, Yang Zhang, Wenjie Wang, Fuli Feng, Xiangnan He

机构 * University of Science and Technology of China(中国科学技术大学) National University of Singapore(新加坡国立大学)

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 针对大语言模型推荐(RecLLM)可能存在的偏见,提出公平性基准 FaiRLLM,包含精心设计的指标和涵盖8个敏感属性的数据集,评估发现 ChatGPT 在推荐中仍存在不公平现象。

Comments Accepted by Recsys 2023 (Short). Typo corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14266 2026-06-15 physics.comp-ph 新提交 90%

Large Language Model Based Agent for Automated Discovery in Computational Physics

基于大语言模型的自动化计算物理发现智能体

Hang Lin, Chongwen Liu, Gang Yan

专题命中 领域大模型 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn)

AI总结 提出PhyNex智能体,结合大语言模型引导搜索与领域工具,通过渐进局部搜索和知识积累,在三个物理问题上实现与人类专家相当或更优的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14892 2026-06-15 cs.LG cs.AI 版本更新 90%

Can LLMs Accurately Score Medical Diagnoses and Clinical Reasoning?

LLM能否准确评分医学诊断和临床推理?

Amy Rouillard, Sitwala Mundia, Linda Camara, Ziyaad Dangor, Michael Cameron Gramanie, Ismail Kalla, Shabir A. Madhi, Kajal Morar, Marlvin T. Ncube, Haroon Saloojee, Bruce A. Bassett

机构 * Wits MIND Institute, University of the Witwatersrand, Johannesburg, South Africa(维特士心理研究所,沃斯兰德大学,约翰内斯堡,南非) Grai Labs, Cape Town, South Africa(格雷实验室,开普敦,南非) South African Medical Research Council Vaccines and Infectious Diseases Analytics Research Unit, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(南非医学研究理事会疫苗和传染病分析研究组,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Internal Medicine, Charlotte Maxeke Johannesburg Academic Hospital, and Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(内科学系,查理·马克斯凯约翰内斯堡学术医院,以及健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Department of Paediatrics and Child Health, Faculty of Health Sciences, University of the Witwatersrand, Johannesburg, South Africa(儿科学与儿童健康系,健康科学学院,沃斯兰德大学,约翰内斯堡,南非) Wits MIND Institute, University of the Witwatersrand, Johannesbu(维特士心理研究所,沃斯兰德大学,约翰内斯堡)

专题命中 领域大模型 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究使用LLM陪审团对300例低收入和中等收入国家医院病例的3334个诊断进行评分,发现校准后的LLM评分与专家评分高度一致,且严重错误风险更低,可作为可靠的评估代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05413 2026-06-15 cs.IR cs.CL 版本更新 89%

SciDef: Datasets and Tools for Automated Definition Extraction from Scientific Literature with LLMs

SciDef:基于LLM的科学文献自动定义提取数据集与工具

Filip Kučera, Christoph Mandl, Isao Echizen, Radu Timofte, Timo Spinde

机构 * National Institute of Informatics (NII)(国立信息研究所) University of Würzburg(乌尔姆大学) University of Passau(帕萨乌大学) University of Würzburg (JMU)(乌尔姆大学)

专题命中 领域大模型 :LLM(title_cn,summary_cn);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 提出SciDef资源套件,包含人工验证的定义基准DefExtra、相似度判断DefSim及基于LLM的提取流程,通过16个语言模型评估,发现NLI匹配指标与人类判断高度一致,但相关性过滤仍是自动提取的关键瓶颈。

Comments Under Review - Submitted to CIKM 2026 Resources Track;

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07530 2026-06-15 cs.DL cs.AI cs.CY cs.SI 版本更新 88%

The Shrinking Lifespan of LLMs in Science

科学领域中LLM的生命周期缩短

Ana Trišović

机构 * Computer Science & Artificial Intelligence Laboratory(计算机科学与人工智能实验室) Massachusetts Institute of Technology(麻省理工学院)

专题命中 领域大模型 :LLM(title_cn,summary_cn);language model(abstract);分类 cs.AI

AI总结 本研究通过分析62个LLM在超过10万篇引用论文中的科学采纳轨迹,发现模型的生命周期主要由发布年份决定,且每个后续发布年份的峰值时间和寿命分别缩短27%和23%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08819 2026-06-15 cond-mat.mtrl-sci 86%

TEM Agent: enhancing transmission electron microscopy (TEM) with modern AI tools

TEM Agent:利用现代AI工具增强透射电子显微镜(TEM)

Morgan K. Wall, Alexander J. Pattison, Edward S. Barnard, Stephanie M. Ribet, Peter Ercius

专题命中 领域大模型 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出TEM Agent框架,通过模型上下文协议(MCP)方法结合商业LLM,实现对TEM多个子系统的访问与控制,简化复杂显微镜生态系统,提升用户完成各类难度实验的能力。

Comments 22 pages, 4 figures

Journal ref Npj Computational Materials (2026) 1-10

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14654 2026-06-15 cs.AI cs.CL cs.LG 新提交 83%

Abstracting Cross-Domain Action Sequences into Interpretable Workflows

将跨领域动作序列抽象为可解释的工作流

Gaurav Verma, Scott Counts

机构 * Microsoft Corporation(微软公司)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出WorkflowView框架,利用大语言模型将低层动作序列抽象为高层活动,在三个不同任务中验证了有效性和泛化能力,实现高语义相似度和预测性能。

Comments preprint; 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14149 2026-06-15 cs.LG 新提交 81%

Trust but Verify: Mitigating Medical Hallucinations via Post-Hoc Adversarial Auditing and Multi-Agent Feedback Loops

信任但验证:通过事后对抗审计和多智能体反馈循环减轻医学幻觉

Muhammad Osama, Maheera Amjad, Zartasha Mustansar, Arslan Shaukat, Muhammad U. S. Khan

机构 * Data Science and Machine Learning Lab, SINES, NUST(NUST SINES数据科学与机器学习实验室) SINES, NUST(NUST SINES) CEME, NUST(NUST CEME)

专题命中 领域大模型 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出一种五智能体“信任但验证”系统,通过事后对抗审计和多智能体反馈循环,将大型语言模型在临床问题中推荐禁用药品的幻觉错误率降低约53%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13662 2026-06-15 cs.AI cs.CL 新提交 73%

EurekAgent: Agent Environment Engineering is All You Need For Autonomous Scientific Discovery

EurekAgent:自主科学发现中,智能体环境工程即一切

Amy Xin, Jiening Siow, Junjie Wang, Zijun Yao, Fanjin Zhang, Jian Song, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Zhipu AI(智谱AI)

专题命中 领域大模型 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 提出环境工程框架EurekAgent,通过权限、工件、预算和人机交互四维工程设计,在数学、内核工程和机器学习任务上取得新最优结果,总API成本低于11美元。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13931 2026-06-15 cs.CL 新提交 70%

DLawBench: Evaluating LLMs Through Multi-Turn Legal Consultation

DLawBench: 通过多轮法律咨询评估大语言模型

Li Zhang, Yuzhen Shi, Yiran Hu, Jingwen Zhang, Wenbo Lv, Yubo Ma, Wei Wang, Rongyao Shi, Yuanyang Qiu, Xinran Xu, Yuemeng Qi, Linlin Miao, Jaromir Savelka, Yun Liu, Kevin Ashley, Bing Zhao, Hu Wei, Lin Qu

机构 * University of Pittsburgh(匹兹堡大学) Alibaba Group(阿里巴巴集团) University of Waterloo(滑铁卢大学) Shandong University(山东大学) Skylenage China University of Political Science and Law(中国政法大学) Qwen Team, Alibaba Group(阿里巴巴集团Qwen团队) Fordham University(福特汉姆大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学) Tsinghua University(清华大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出DLawBench基准,通过模拟四种客户类型(合作、依赖、退缩、对抗)的多轮对话,评估大语言模型在真实法律咨询中的交互能力。

Comments 37 pages, 8 figures, 26 tables. Code and data: https://github.com/SKYLENAGE-AI/DLawBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16073 2026-06-15 cs.CL 版本更新 70%

ClaimFlow: Tracing the Evolution of Scientific Claims in NLP

ClaimFlow: 追踪自然语言处理中科学主张的演变

Aniket Pramanick, Yufang Hou, Saif M. Mohammad, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab)(通用知识处理实验室) Department of Computer Science and Hessian Center for AI (hessian.AI)(计算机科学系和海斯曼人工智能中心) Technische Universität Darmstadt(德累斯顿技术大学) IT:U Interdisciplinary Transformation University Austria(奥地利跨学科转型大学) National Research Council Canada(加拿大国家研究委员会)

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出ClaimFlow框架,通过标注1617篇论文中的5689个主张和4871个跨论文关系,定义主张关系分类任务,并分析NLP领域主张的演变模式。

详情

展开后加载摘要…

URL PDF HTML 收藏