arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 840 信号源:cs.CL, cs.AI, cs.LG

1. 领域大模型 840 篇

2608.11259 2026-08-13 cs.CY cs.AI 新提交 77%

Methodologies for Improving the Quality of AI Tutoring in K-12 Education

提升K-12教育中AI辅导质量的方法

Tushar Udeshi, Anna Khazenzon, Kabir Khan, Nick Breen, RJ Corwin, Chris DiGiano, Kodi Weatherholtz, Marek Zaluski

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.AI

AI总结 本文针对K-12教育中AI辅导质量提升问题,以Khanmigo为研究对象,介绍了相关衡量指标与实验,阐述了模型、提示工程等方面对指标产生积极影响的改动。

Comments 15 pages. Accepted at AIED 2026 (27th International Conference on Artificial Intelligence in Education). Published version: Artificial Intelligence in Education, LNCS vol. 16582, Springer, Cham, first online 25 June 2026 (cite as 2027)

Journal ref In: Blanchard, E.G., Chen, G., Chi, M., Isotani, S. (eds) Artificial Intelligence in Education. AIED 2026. Lecture Notes in Computer Science, vol 16582. Springer, Cham (2027)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07040 2026-08-10 cs.AI 新提交 77%

Not All Problems Are Best Modeled as MILP: A DSL-Centric Framework for Flexible and Accurate Optimization Modeling

并非所有问题都最适合建模为MILP:以DSL为核心的灵活且精准的优化建模框架

Shaofeng Zhang, Hongyuan Su, Qingwen Peng, Zefang Zong, Shengcai Liu, Ke Tang, Yong Li

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对现有优化建模框架过度依赖MILP的缺陷,提出以DSL为核心的OptiDSL框架,通过LLM实现自然语言到标准化DSL的映射,在44种COP类型基准测试中显著优于MILP框架,建模准确率和效率大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04366 2026-08-06 cs.CR cs.AI 新提交 77%

Combating Knowledge Corruption in Agent Systems: A Byzantine-Tolerant Secure Collaborative RAG Framework

对抗智能体系统中的知识篡改:一种拜占庭容错的安全协同RAG框架

Zhaoqi Wang, Daqing He, Zijian Zhang, Ye Liu, Jiamou Liu, Zhirui Zeng, Zhan Qin, Zhen Li, Xin Li, Hongwei Yao, Jincheng An, Yong Liu, Yi Li, Qi Sun, Xiulei Liu, Liehuang Zhu

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对RAG系统面临的知识篡改攻击问题,提出拜占庭容错的安全协同RAG框架SecureCollaRAG,通过多源知识验证机制与动态GNN可信度评分实现攻击防护,在非IID数据下保持鲁棒性。

Journal ref Proceedings of the ACM Web Conference 2026, pages 2661-2672, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01711 2026-08-04 cs.AI 新提交 77%

Constructing Executable Analytical Knowledge Representations for Meta-Analysis Synthesis Using an Agentic Harness

使用智能体管控系统构建用于元分析综合的可执行分析知识表示

Lingbo Li, Anuradha Mathrani, Teo Susnjak

机构 * School of Mathematical and Computational Sciences(数学与计算科学学院) Massey University(梅西大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出EAKR,在智能体管控系统MetaSynDec中实施后,可高效构建元分析所需的可执行分析知识表示,其性能优于直接大型语言模型生成,验证了相关方法的可行性与优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21887 2026-07-27 cs.HC cs.CL 新提交 77%

Towards Reducing Foreign Language Anxiety Using Level-Appropriate Embodied Conversational Agents

使用水平适配的具身对话代理降低外语焦虑

Krishan Rajaratnam, Wenbin Gan, Yuan Sun

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究针对外语焦虑影响二语习得问题,提出基于欧洲共同语言参考标准的多智能体具身对话系统,通过“生成-评估-再生”循环适配用户水平。小样本试点研究表明该系统生成的对话句子更适配学习者,虽未显著降低焦虑,但提供了相关见解。

Comments 8 pages, 6 figures, published in the proceedings of EDULEARN26

Journal ref K. Rajaratnam, W. Gan, Y. Sun (2026) TOWARDS REDUCING FOREIGN LANGUAGE ANXIETY USING LEVEL-APPROPRIATE EMBODIED CONVERSATIONAL AGENTS, EDULEARN26 Proceedings, Article 1459

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17902 2026-07-21 cs.DL cs.CL 新提交 77%

Benchmarking Resource-Efficient LLMs for Research Topic Ontology Generation in the Biomedical Field

用于生物医学领域研究主题本体生成的资源高效语言模型基准测试

Tanay Aggarwal, Angelo Salatino, Francesco Osborne, Enrico Motta

机构 * Knowledge Media Institute, The Open University, Milton Keynes, UK(开放大学知识媒体研究所) Department of Business and Law, University of Milano-Bicocca, Milan, IT(米兰-比科卡大学商业与法律系)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文评估五个小型开源LLMs识别生物医学概念语义关系的性能,引入MeSH-Rel-4K数据集并分析三种策略,发现针对性微调使平均F1分数显著提高,突破推理瓶颈,为构建生物医学本体提供准确自动化方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11074 2026-07-14 cs.CL 新提交 77%

ResearchQA: Benchmarking Citation-Grounded Question-Answering on Scientific Papers

ResearchQA:科学论文中基于引用的问答基准测试

Saba Imran, Debanjum Singh Solanky

机构 * Khoj Inc.(Khoj公司)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究引入ResearchQA基准测试,含多领域多类型问答对,用于科学论文基于引用的问答评估。通过特定方法评估八个模型,发现基于引用指标区分度更高,开放权重模型接近最佳封闭模型准确率且延迟更低,还发布了相关资源。

Comments 19 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07915 2026-07-10 cs.CY cs.CL 新提交 77%

Validating LLMs in social science: Epistemic threats and emerging norms

在社会科学中验证大语言模型:认知威胁与新兴规范

Meera Desai, Dallas Card, Abigail Z. Jacobs

机构 * School of Information, University of Michigan(信息学院,密歇根大学) Center for the Study of Complex Systems, University of Michigan(复杂系统研究中心,密歇根大学)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究探讨大语言模型对社会科学方法论的重塑,通过分析八本旗舰期刊论文语料库,发现其生成测量在实证分析中核心作用凸显,但验证实践存问题,进而概述补充策略以完善大语言模型在社会科学应用的规范标准。

Comments 28 pages, 2 figures. Main text: 11 pages, Appendix: 11 pages, References: 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04907 2026-07-07 cs.AI 新提交 77%

Medi-Gemma: A Hybrid Clinical Decision Support System Integrating Deterministic EMR Analytics and Retrieval-Augmented Generation

Medi-Gemma:一种集成确定性电子病历分析与检索增强生成的混合临床决策支持系统

Mohammed Saim Ahmed Quadri, Yunzhe Xue, Justin W. Ady, Usman Roshan

机构 * New Jersey Institute of Technology(新泽西理工学院) Robert Wood Johnson Hospital(罗伯特·伍德·约翰逊医院)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 介绍用于伤口病理分类和工作流程自动化的临床决策支持系统Medi-Gemma,其采用解耦框架,经多阶段管道处理数据请求,关键贡献是地面真值注入模块,验证表明该架构有诸多优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01960 2026-07-03 cs.CL 新提交 77%

NAVER LABS Europe Submission to the Instruction-following 2026 Short Track

NAVER LABS Europe 对指令遵循 2026 短轨道的提交

Marcely Zanon Boito, Hemant Yadav, Jean-Luc Meunier, Ioan Calapodescu

机构 * NAVER LABS Europe IIIT Delhi(印度德里国际信息技术学院)

专题命中 领域大模型 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.CL

AI总结 提出SpeechMapper语音投影器和合成SQA数据集fakACL,在更紧凑模型上实现ASR、ST和SQA联合处理,获得IWSLT 2026短轨道并列第一。

Comments IWSLT 2026 system paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01440 2026-07-03 cs.CL 新提交 77%

FaithMed: Training LLMs For Faithful Evidence-Based Medical Reasoning

FaithMed: 训练大语言模型进行忠实于证据的医学推理

Zhiyun Zhang, Liwen Sun, Xiang Qian, Chenyan Xiong

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University School of Medicine(斯坦福大学医学院) Xlue

专题命中 领域大模型 :LLM(summary_cn,abstract_cn);分类 cs.CL

AI总结 提出FaithMed框架,通过过程级奖励和优势分组强化学习,监督LLM在医学推理中忠实评估和应用检索证据,在7个基准上平均提升9%。

Comments 15 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25651 2026-06-29 cs.CL 新提交 77%

MedGuards: Multi-Agent System for Reliable Medical Error Detection and Correction

MedGuards: 用于可靠医疗错误检测与纠正的多智能体系统

Congbo Ma, Hu Wang, Yichun Zhang, Farah E. Shamout

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) Khalifa University(哈利法大学) New York University(纽约大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出MedGuards框架,通过多智能体上下文学习与置信度引导仲裁机制,无需额外训练即可检测、定位和纠正医疗文本错误,并引入关键词优先纠正评分(KPCS)评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23165 2026-06-23 cs.IR cs.CL 新提交 77%

The Language Blind Spot: How Query Language and Brand Recognition Tier Shape AI-Constructed Brand Reputation Across Twelve European Languages

语言盲点:查询语言与品牌识别层级如何塑造跨十二种欧洲语言的AI构建品牌声誉

Dmitrij Żatuchin

机构 * Estonian Entrepreneurship University of Applied Sciences (EUAS)(爱沙尼亚应用科学创业大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 通过查询三种大语言模型对66个品牌在12种语言中的表现,发现AI构建的品牌声誉存在语言依赖性,且查询语言对本地品牌的推荐影响远大于对全球品牌的影响,表明仅用英语监测存在语言盲点。

Comments 17 pages, 3 figures. Data and analysis code on Zenodo, https://doi.org/10.5281/zenodo.20794390

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19950 2026-06-19 cs.CV cs.AI 新提交 77%

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

多模态大语言模型的置信度校准:基于医学视觉问答的实证研究

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18897 2026-06-18 cs.IR cs.AI 新提交 77%

SAERec: Constructing Fine-grained Interpretable Intents Priors via Sparse Autoencoders for Recommendation

SAERec:通过稀疏自编码器为推荐构建细粒度可解释意图先验

Jiangnan Xia, Xuansheng Wu, Yu Yang, Xin Wang, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Shanghai AI Laboratory(上海人工智能实验室) The Education University of Hong Kong(香港教育大学) Jilin University(吉林大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出SAERec模型,利用稀疏自编码器从大型语言模型文本嵌入中解耦出细粒度可解释意图,作为先验指导推荐,并通过多分支注意力机制融合个人与公共意图,提升推荐性能与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16710 2026-06-16 cs.MA cs.CL 新提交 77%

Misinformation Propagation in Benign Multi-Agent Systems

良性多智能体系统中的错误信息传播

Jonas Becker, Jan Philip Wahle, Terry Ruas, Bela Gipp

机构 * University of Göttingen, Germany(德国哥廷根大学) LKA NRW, Germany(德国北莱茵-威斯特法伦州警署) Shared last authorship(共同通讯作者)

专题命中 领域大模型 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 研究在良性多智能体系统中,基于意图的错误信息如何通过智能体交互传播,并发现多智能体辩论相比单智能体提示能减少性能下降,鲁棒性取决于群体组成和决策协议。

Comments 20 pages, 8 figures, 1 table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10125 2026-06-10 stat.ML cs.DB cs.LG 新提交 77%

Robust Active Learning for Few-Shot Example Selection in Text-to-SQL

鲁棒主动学习用于文本到SQL中的少样本示例选择

Arash Pourhabib

机构 * NVIDIA

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对文本到SQL中少样本示例选择,提出一种鲁棒主动学习方法,通过分层贪婪算法最大化异方差互信息目标,在嵌入流形上实现常数因子近似保证,显著减少标注成本。

Comments 31 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20557 2026-07-24 cs.LG cs.AI 新提交 76%

Monkey King Bang: A Unified Scientific Multimodal Foundation Model

孙悟空爆炸:一个统一的科学多模态基础模型

Hesen Chen, Xinyu Su, Xiaomeng Yang, Yuetan Lin, Zixiong Yang, Junyi An, Fenglei Cao, Yifeng Jiao, Yunqi Zhang, Yuan Cheng, Zhiyu Tan, Hao Li, Libo Wu, Yuan Qi

机构 * Shanghai Academy of AI for Science(上海人工智能研究院)

专题命中 领域大模型 :foundation model(title);分类 cs.AI、cs.LG

AI总结 研究针对科学多领域推理需求,引入统一科学多模态模型MKB,围绕共享Transformer主干及定制组件构建,涵盖多科学分支。通过两阶段训练,在多方面实验表现出色,证明该范式可行,为跨领域科学多模态探索提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03882 2026-07-13 cs.CL cs.AI 新提交 76%

Consistent but Miscalibrated: Evaluating LLM Limitations for Risk Communication in Natural Language

一致但校准错误:评估大语言模型在自然语言风险沟通中的局限性

Diego Cerda-Mardini, Sarath Chandar, Sreenath Madathil

机构 * Faculty of Dental Medicine and Oral Health Sciences, McGill University(麦吉尔大学牙医学与口腔健康科学学院) Chandar Research Lab, Polytechnique Montréal(蒙特利尔理工大学钱达尔研究实验室) Mila – Québec Artificial Intelligence Institute(魁北克人工智能研究所米拉) Département de Génie Informatique et Génie Logiciel (GIGL), Polytechnique Montréal(蒙特利尔理工大学计算机科学与软件工程系)

专题命中 领域大模型 :LLM(title);分类 cs.CL、cs.AI

AI总结 研究大语言模型在自然语言中传达概率信息的可靠性,在两阶段预测管道中评估九个模型,发现其一致但校准错误,提供预计算统计量未解决问题,表明当前模型非可靠零样本风险沟通工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14128 2026-08-17 cs.SE 新提交 75%

DepWareTrans: Dependency-Aware Incremental Repository Migration across Co-executable Languages

DepWareTrans:跨可共执行语言的依赖感知增量仓库迁移

Sivajeet Chand, Alexander Pretschner, Steve Haupt, Derui Zhu, Sushant Kumar Pandey

专题命中 领域大模型 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出依赖感知增量迁移框架,构建依赖图分组文件进行批量翻译,在 STAR 仓库等上实现 100% 编译和测试成功率,提升仓库级代码翻译的可扩展性与可靠性。

Comments Accepted for publication in the Industry Showcase Track of the 41st IEEE/ACM International Conference on Automated Software Engineering, which will take place in Munich, Germany during October 12-16, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12036 2026-08-13 cs.AI cs.CL cs.HC cs.LG cs.MA 新提交 75%

Mechanist: AI as a Scientific Instrument for Discovering the Mechanisms of Intelligence

Mechanist:作为科学仪器的AI,用于发现智能的机制

Mengru Wang, Junfeng Fang, Shuofei Qiao, Zhenqian Xu, Haoming Xu, Haoxiong Wang, Shumin Deng, Linyi Yang, Zhixiang Cui, Xin Xu, Yunzhi Yao, Buqiang Xu, Fei Shen, Haozhe Luo, Yunxiang Wei, Ningyu Zhang, Julian McAuley, Tat Seng Chua, Huajun Chen

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学) Heriot-Watt University(赫瑞瓦特大学) Southern University of Science and Technology(南方科技大学) University of California, San Diego(加利福尼亚大学圣迭戈分校) Northeastern University(东北大学)

专题命中 领域大模型 :foundation model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究推出智能体系统Mechanist,以AI为科学仪器自主发现AI智能机制,其生成假设更有价值、实验更可靠,还能发现安全风险、构建信念机制理论并转化为提升模型性能的干预措施。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09080 2026-08-11 cs.CL cs.AI cs.HC cs.LG 新提交 75%

When Confidence Fails: Overconfidence in LLMs under Uncertainty and Missing Clinical Information

当置信度失效:不确定性与临床信息缺失下大语言模型的过度自信

Maryam Tahermazandarani, Adnan Mahmood, Fahmida Islam, Quan Z. Sheng

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对临床信息不确定性下的LLMs开展行为分析,提出基于MedMCQA的评估框架,发现模型置信度与准确率不匹配、弃权能力差异大等关键局限,凸显需采用不确定性感知评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25489 2026-07-29 cs.CV 新提交 75%

Agentic AI in medicine: architectures, applications, evaluation, and challenges for clinical translation

医学中的智能体人工智能:临床转化的架构、应用、评估及挑战

Zheng Tong, Yang Liu, Wanshu Fan, Jing Qin, Zhongbin Han, Haifan Gong, Congyu Liao, Xiaofeng Liu, Cong Wang

机构 * School of Software Engineering, Dalian University(大连大学软件工程学院) Affiliated Zhongshan Hospital of Dalian University(大连大学附属中山医院) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) University of California, San Francisco(加州大学旧金山分校) Yale University(耶鲁大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 领域大模型 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 研究探讨医学中智能体人工智能的架构、应用等,通过范围审查筛选相关研究,指出其范围未定论且评估与临床需求不符,证据基础有限,临床转化需更清晰定义、可重复评估等。

Comments Review article, 6 figures, 2 tables. 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23313 2026-07-28 econ.GN q-fin.EC 新提交 75%

Agentic AI Orchestration of Heterogeneous Economic Models for Rapid, Multi-scenario Analysis of Energy Crises

用于能源危机快速多场景分析的异构经济模型的智能人工智能编排

Dana Golden, Brett Indelicato, Lav R. Varshney, Carlos D. Messina, Suzanne Thornsbury

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对能源危机下政策制定者需快速决策但经济模型整合困难的问题,利用大语言模型开发框架,协调多个异构经济模型,通过构建场景、转化输入、执行模型和合成输出,快速评估霍尔木兹海峡关闭等情况,避免单一模型假设主导结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20453 2026-07-24 cs.CL cs.AI cs.LG 新提交 75%

A Knowledge-Injection Framework for Zero-Shot Adaptation of LLMs to Delirium Prediction

一种用于将大语言模型零样本适应谵妄预测的知识注入框架

Jessica Sena, Shesadree Priyadarshani, Miguel Contreras, Bharat Gandhi, Scott Siegel, Subhash Nerella, Parisa Rashidi

专题命中 领域大模型 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型零样本适应谵妄预测中领域知识不足问题,提出轻量级知识注入框架。在推理时用外部临床知识报告增强数据摘要,无需微调或检索。实验表明该方法能提升模型性能,缩小与前沿模型差距,且收益依赖临床意义内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19822 2026-07-23 eess.SP 新提交 75%

WARA: A Closed-Loop Multi-Agent Framework for Wireless Optimization Autoresearch

WARA:用于无线优化自动研究的闭环多智能体框架

Yuan Guo, Yilong Chen, Chao Hu, Xianghao Yu, Liang Hong, Jie Xu

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 本文针对无线领域提出端到端自动研究框架WARA,通过闭环多智能体系统将研究工作流程分三个阶段,经工件介导过程和控制器管理验证工件,设计评分智能体评估有效性,其性能优于一次性大语言模型生成,接近同行评审论文质量。

Comments 2026 IEEE/CIC International Conference on Communications in China (ICCC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17839 2026-07-21 cs.RO 新提交 75%

Receiver-Centered Robot-to-Human Handover with Grasp-Aware Object Orientation

基于抓握感知物体方向的以接收者为中心的机器人到人类工具交接

Federico Biagi, Dario Onfiani, Simone Silenzi, Luigi Biagiotti

机构 * University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学)

专题命中 领域大模型 :LLM(summary_cn,abstract)

AI总结 研究针对协作机器人与人类操作员工具交接问题,提出以接收者为中心、语音驱动的自适应交接系统,基于Franka cobot,用LLM识别意图、MediaPipe跟踪手部,动态调整末端执行器方向,经实验验证该系统能减少抓握延迟,提升交互流畅性与信任感知。

Comments Accepted for presentation at the 19th International Workshop on Human-Friendly Robotics (HFR 2026), Trento, Italy. The paper will appear in Springer's Proceedings in Advanced Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16569 2026-07-21 cs.SE 新提交 75%

From Discussion to Execution: Replicating Buggy and Correct Data Science Code

从讨论到执行:复制有缺陷和正确的数据科学代码

Ragib Shahariar Ayon, Mohammad Wardat, Shibbir Ahmed

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究旨在解决从问答论坛复制数据科学代码的难题,提出基于大语言模型的Reprodgen框架,能根据问题与答案生成可执行代码对,经多库评估及构建基准验证,实现可靠复制且模型性能有差异。

Comments accepted at the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15608 2026-07-20 cs.HC 新提交 75%

Visualization Autocomplete: Visualization Authoring via Stepwise Design Recommendations

可视化自动完成:通过逐步设计建议进行可视化创作

Hyeon Jeon, Sungbok Shin, Niklas Elmqvist

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对领域专家创建图表时确定设计下一步的难题,提出VISAUTOCOMPLETE系统,受文本自动完成启发,按顺序过程推荐步骤,用户可干预。提炼大语言模型逻辑,经评估在复杂图表创作清晰度上超基线,可接近性与大语言模型相当。

Comments IEEE VIS 2026 & IEEE Transactions on Visualization and Computer Graphics (TVCG)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15246 2026-07-17 cs.CV 新提交 75%

ARMOR++: Agentic Orchestration of a Multi-Domain Primitive Set for Transferable Attacks on Deepfake Detectors

ARMOR++:用于对深度伪造检测器进行可转移攻击的多域原语集的智能编排

Christos Korgialas, Gabriel Lee Jun Rong, Dion Jia Xu Ho, Pai Chet Ng, Xiaoxiao Miao, Konstantinos N. Plataniotis

机构 * Department of Informatics, Aristotle University of Thessaloniki(塞萨洛尼基亚里士多德大学信息学系) Infocomm Technology Cluster, Singapore Institute of Technology(新加坡科技学院信息通信技术集群) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Division of Natural and Applied Sciences, Duke Kunshan University(昆山杜克大学自然科学与应用科学部) Department of Electrical and Computer Engineering, University of Toronto(多伦多大学电气与计算机工程系)

专题命中 领域大模型 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对深度伪造检测器在黑盒对抗转移下可靠性下降问题,提出ARMOR++多智能体框架,利用视觉与语言模型提供语义先验并编排原语选择等,整合多种原语有效针对异构偏差,实验表明其性能优于现有基线,凸显当前检测器可靠性差距及智能编排的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏