arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-11 至 2026-08-11 共收录 178 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 178 篇

2608.09717 2026-08-11 cs.CL cs.AI cs.CY 新提交 93%

How Do Large Language Models Judge Social Attraction? Evidence from Theory-Grounded Persona Ratings Across Multiple LLMs and Humans

大型语言模型如何评判社交吸引力?来自跨多个LLM与人类的基于理论的人格特质评分的证据

Hasan Mahmud, Khawaja Abaid Ullah, Mohammad Javad Khojasteh, Jamison Heard, Prabu David

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探究LLMs能否评估社交吸引力,经三项研究发现,34个LLM评分稳定且与人类排序一致,但LLMs对吸引力与无吸引力档案的评分偏差更大,且两者均无性别呈现的显著整体效应。

Comments 9 pages, 2 figures, 2 tables. Includes technical supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08085 2026-08-11 cs.DC cs.AI 新提交 93%

Effect of Abstractions and Prompting Strategies on LLM-Guided High-Performance Optimizations

抽象与提示策略对大语言模型(LLM)指导的高性能优化的影响

Jiří Klepl, Maty'aš Brabec, Martin Kruliš

专题命中 评测与基准 :LLM(title,title_cn);prompting(title);large language model(abstract);language model(abstract)

AI总结 本文探究传统抽象对LLM指导并行HPC应用优化的影响,以PolyBench为基准评估发现,获特定优化目标的LLM生成C代码的性能与有效性优于成熟框架,建议探索可验证的替代优化方法。

Comments This preprint has not undergone peer review or any post-submission improvements or corrections

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07494 2026-08-11 cs.HC cs.AI 新提交 93%

How to Ask the AI: A User Perspective Survey for Large Language Model Prompting

如何向AI提问:大型语言模型提示工程的用户视角调查

Yiqun Zhang, Yunfan Zhang, Mingjie Zhao, Sen Feng, Yiu-ming Cheung

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract);LLM(abstract,abstract_cn)

AI总结 该研究从用户视角开展大型语言模型提示工程调查,提出提示有效性评估策略、应用工作流并维护开源项目,为用户制定适配场景的有效提示提供可操作指南。

Comments Accepted to TAI

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07529 2026-08-11 cs.CL cs.AI 新提交 93%

WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management

WuYuEval:面向固体废物管理的大语言模型多级基准测试

Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);foundation model(abstract)

AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10015 2026-08-11 cs.AI cs.CE cs.CL cs.MM 版本更新 92%

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估

Yupeng Cao, Haohang Li, Weijin Liu, Wenbo Cao, Anke Xu, Lingfei Qian, Xueqing Peng, Minxue Tang, Zhiyuan Yao, Jimin Huang, K. P. Subbalakshmi, Zining Zhu, Jordan W. Suchow, Yangyang Yu

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Independent Researcher(独立研究者) The FinAI(FinAI) Duke University(杜克大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);preference optimization(abstract)

AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09925 2026-08-11 cs.CL cs.AI 新提交 92%

From Values to Benchmarks: Evaluating Large Language Models for Governmental Use in Dutch

从价值到基准:评估用于荷兰政府场景的大型语言模型

Laurens Samson, Iva Gornishka, Gossa Lô, Yuki M. Asano, Sennay Ghebreab

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究推出面向荷兰政府场景的“Grip on LLMs”评估框架,确定六大评估维度,发现模型在质量、成本、能耗等维度存在权衡,发布模型概览供政府LLM选择使用。

Comments Accepted at AIES 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08061 2026-08-11 cs.AI 新提交 92%

CORDA: A Benchmark for Hierarchical Harm-Centric Moral Reasoning in Large Language Models

CORDA:面向大语言模型的以伤害为核心的分层道德推理基准

Siddarth Singh, Victoria Williams, Simon Rosen, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Benjamin Rosman, Geraud Nangue Tasse, Steven James

机构 * University of the Witwatersrand(威特沃特斯兰德大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 研究提出CORDA基准,评估大语言模型的以伤害为核心的分层道德推理,发现多数模型优先避免直接个人伤害,部分模型无法遵循指定优先级,该基准填补了LLM道德评估的核心空白。

Comments 8 pages, 6 figures. Accepted at the Fourth International Workshop on Value Engineering in AI (VALE 2026), affiliated with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07978 2026-08-11 cs.SE cs.AI 新提交 92%

Verication-driven closed-loop multi-agent large language modelframework for code-compliant structural design

验证驱动的闭环多智能体大语言模型框架:面向符合代码规范的结构设计

Jianbin Luo, Weibin Lin, Yiran Lin, Qing Wei, Wei Guo

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究提出验证驱动的闭环多智能体LLM框架,通过耦合有限元验证系统与双节点结构提升结构设计的代码合规性,开源基准与脚本,性能提升显著且具可复现性。

Comments 20 pages, 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07651 2026-08-11 cs.AI cs.CV 新提交 92%

An Agentic AI Framework Overcomes Fundamental Limitations of Large Language Models for Glaucoma Detection from Fundus Photography

一种智能体AI框架克服了大型语言模型在眼底照相青光眼检测中的基本局限

Jalil Jalili, Hossein Taghizad, Anuwat Jiravarnsirikul, Christopher Bowd, Akram Belghith, Raheleh Kafieh, Christopher A. Girkin, Sally L. Baxter, Robert N. Weinreb, Linda M. Zangwill, Mark Christopher

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 该研究开发的智能体AI框架整合LLM与专用深度学习工具,提升了眼底照相青光眼检测的准确率、一致性,纠正了仅用LLM的缺陷,具有通用性,或推动医学AI向多智能体系统转变。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08126 2026-08-11 cs.LG cs.CL 新提交 92%

Accurate Ensembles, Fragile Narratives: Multi-Scale Stacking and a Fidelity Audit of LLM-Generated Explanations for Credit Risk

准确集成,脆弱叙事:多尺度堆叠与LLM生成信用风险解释的保真度审计

Gregorius Reynaldi Pratama, Kuo-Kun Tseng

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 本研究构建多尺度堆叠集成预测模型并测试LLM生成信用风险解释的保真度,发现预测性能提升有限,LLM生成的解释存在事实错误,需对生成解释进行验证。

Comments 13 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07499 2026-08-11 cs.HC cs.AI cs.CL 新提交 92%

Evaluation of Motivational Interviewing Counsellors with Task-Aware Multi-Stage LLM-Based Simulated Clients

基于任务感知多阶段大语言模型(LLM)模拟来访者的动机访谈咨询师评估

Jiading Zhu, Xinyu Cindy Wang, Thomas Nguyen, Yan Qing Lee, Osnat C. Melamed, Peter Selby, Jonathan Rose

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文针对动机访谈的关键唤起任务,提出Evoke-Sim任务感知多阶段LLM模拟来访者框架,用于戒烟场景下MI咨询师评估,其评估效果优于现有模拟来访者,为相关评估设定了更高标准。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19517 2026-08-11 cs.LG cs.AI 版本更新 92%

Automating Deception: Scalable Multi-Turn LLM Jailbreaks

自动化欺骗:可扩展的多轮LLM欺骗攻击

Adarsh Kumarappan, Ananya Mujoo

机构 * California Institute of Technology(加州理工学院) Evergreen Valley College(埃弗格林谷学院)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出自动化生成多轮LLM欺骗数据集的方法,揭示GPT家族模型在对话历史中的脆弱性,而Gemini 2.5 Flash则表现出极强的抗性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01629 2026-08-11 cs.CL 版本更新 92%

Benchmarking LLM-as-a-Judge for Long-Form Output Evaluation

基准测试LLM作为裁判在长文本输出评估中的应用

Junjie Chen, Yuxi Dong, Haitao Li, Weihang Su, Yujia Zhou, Min Zhang, Yiqun Liu, Qingyao Ai

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) University of Science and Technology Beijing(北京科技大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出LongJudgeBench基准,系统评估LLM裁判在长文本输出评估中的可靠性,发现当前模型存在显著可靠性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27887 2026-08-11 cs.AI q-fin.PM 版本更新 92%

PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management

PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准

Yuxuan Zhao, Sijia Chen, Ningxin Su

机构 * Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出PortBench基准,通过静态QA和动态五阶段分配流水线评估LLM在投资组合管理中的表现,发现多数模型无法超越等权重分配,且存在推理错误累积和压力下大幅回撤的问题。

Comments Project page: https://portbench.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08143 2026-08-11 cs.IR cs.CL 新提交 91%

DS@GT ARC at Touché: Large Language Models for Retrieval-Augmented Debate

DS@GT ARC参与Touché任务:用于检索增强辩论的大型语言模型

Anthony Miyaguchi, Conor Johnston

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)

AI总结 DS@GT ARC参与Touché 2025检索增强辩论任务,采用三家提供商的六个主流LLMs通过检索增强提示流水线,发现多LLM评估者一致性无法可靠追踪官方评估目标,在质准则上差距最大。

Comments 12 pages, 4 figures. Accepted for publication in the CLEF 2026 Best of Labs proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07223 2026-08-11 cs.CR cs.AI cs.CL cs.LG cs.SE 版本更新 91%

TraceSafe: A Systematic Assessment of LLM Guardrails on Multi-Step Tool-Calling Trajectories

TraceSafe: 对LLM在多步骤工具调用轨迹上的安全护栏的系统评估

Yen-Shan Chen, Sian-Yao Huang, Cheng-Lin Yang, Yun-Nung Chen

机构 * CyCraft AI Lab, Taiwan(CyCraft AI实验室(台湾)) National Taiwan University(国立台湾大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract,comments);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出TraceSafe-Bench,首个评估中间轨迹安全的综合基准,发现安全护栏效果更依赖结构数据能力而非语义安全对齐,通用模型在轨迹分析中表现更优,且准确性随执行步骤增加而提升。

Comments Accepted to Conference on Language Modeling (COLM) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07525 2026-08-11 cs.CL cs.AI 新提交 91%

Unified Hallucination Fuzzing for Multimodal Large Language Models

面向多模态大语言模型的统一幻觉模糊测试

Pengfei Zhou, Jiajun Song, Zhiwei Tang, Yixing Ma, Xiaopeng Peng, Donghui Si, Yuhang Xu, Huiqi Song, Yiyuan Miao, Yichen Qian, Weihua Chen, Wangbo Zhao, Bohan Zhuang, Jiasheng Tang, Yang You

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型的幻觉问题,提出含UniHall基准与SAMF自演化模糊测试的评估框架,发现SOTA模型在模糊测试下性能显著下降,存在有用性-幻觉权衡。

Comments 47 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07920 2026-08-11 cs.CV 新提交 90%

Forged Peer Judgments Mislead Multimodal LLM Judge Panels: Source-Blind Anchoring and Panel-Consensus Verification

伪造的同行判断会误导多模态大语言模型(LLM)评判小组:无来源锚定与小组共识验证

Yang Shu

机构 * Zhejiang University(浙江大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract)

AI总结 研究发现多模态LLM评判小组存在无来源锚定的文本攻击面,伪造同行判断可误导判决,提出的小组共识验证方法能有效阻断此类攻击并降低损害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07881 2026-08-11 cs.AI cs.CL cs.IT cs.LG math.IT 新提交 90%

GRACE: LLM-Grounded Semantic Metric Spaces for Scalable Mixed-Data Clustering

GRACE:用于可扩展混合数据聚类的大语言模型(LLM)基础语义度量空间

Zihua Yang, Zhencheng Xie, Junyang Chen, Liang Xie, Yiqun Zhang, Mengke Li, Yang Lu

机构 * Guangdong University of Technology(广东工业大学) Tsinghua University(清华大学) Peking University(北京大学) Shenzhen University(深圳大学) Xiamen University(厦门大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 针对混合数据聚类中语义丰富度与可扩展性的矛盾,提出GRACE框架,通过多视角LLM查询实现一次性语义嵌入,兼顾可扩展性与聚类性能,优于11种对比方法。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08467 2026-08-11 cs.AI cs.CL cs.IR 新提交 90%

LLM within MCP Matters: Measuring Inefficient Resource Utilization Driven by LLMs

MCP中的大语言模型很重要:测量由大语言模型驱动的低效资源利用

Minhan Cho, Soyoung Park, Kihyeon Jeong, Byeongkyu Jeon, Daejin Choi, Jinyoung Han

机构 * Sungkyunkwan University(成均馆大学) National Assembly Research Service(国会研究服务处) AlphaBridge(阿尔法桥公司) Ewha Womans University(梨花女子大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对24个LLM开展54000次试验,发现MCP中服务器嵌入的参考数据会因LLM偏好导致低效资源利用,提出需将服务器指令置于客户端LLM工具选择之前的改进方向。

Comments 4 pages, 1 table. Accepted at the AgentSearch Workshop at SIGIR 2026, Melbourne, Australia (non-archival). Code and data: https://github.com/rabqatab/llm-in-mcp-matters

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07762 2026-08-11 cs.AI cs.CR 新提交 90%

Who Verifies the Benchmark? Decentralizing Trust in Large Language Model Evaluation

谁来验证基准?去中心化大语言模型评估中的信任问题

Sahil Pardasani, Madhusudan Singh

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI

AI总结 针对LLM基准测试的信任问题,该研究分析7种验证模型的身份感知偏差,提出基于区块链的提交-披露协议以实现去中心化、可验证的LLM评估。

Comments Accepted to International Conference on Quantum Enhanced AI and Secure Computing (QASC2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00077 2026-08-11 cs.CL cs.AI 版本更新 90%

Autorubric: A Unifying Framework for Rubric-Based LLM Evaluation on Non-Verifiable Tasks

Autorubric:统一基于评分标准的LLM评估

Delip Rao, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 Autorubric通过整合多种评分标准评估技术,提供统一的评分框架和默认设置,提升LLM评估的可靠性与一致性,并在多个基准测试中展示了其有效性。

Comments 60 pages; COLM 2026 camera ready copy

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22087 2026-08-11 cs.AR cs.AI cs.LG cs.SE 版本更新 90%

QuArch: A Benchmark for Evaluating LLM Reasoning in Computer Architecture

QuArch:评估计算机体系结构中大型语言模型推理的基准

Shvetank Prakash, Andrew Cheng, Mark Mazumder, Arya Tschand, Varun Gohil, Jeffrey Ma, Jason Yik, Zishen Wan, Jessica Quaye, Elisavet Lydia Alvanaki, Avinash Kumar, Chandrashis Mazumdar, Tuhin Khare, Alexander Ingare, Ikechukwu Uchendu, Radhika Ghosal, Abhishek Tyagi, Chenyu Wang, Andrea Mattia Garavagno, Sarah Gu, Alice Guo, Grace Hur, Luca P. Carloni, Tushar Krishna, Ankita Nayak, Amir Yazdanbakhsh, Vijay Janapa Reddi

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出QuArch基准,用于评估LLM在计算机体系结构中的推理能力。它包含2671个问答对,发现前沿模型在高阶思维技能上有差距。经微调可提升内存层次结构设计任务性能,为构建和衡量LLM能力提供基础,推动计算系统创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14373 2026-08-11 cs.AI cs.CL cs.CY cs.HC cs.MA 版本更新 90%

Artificial Leviathan: Exploring Social Evolution of LLM Agents Through the Lens of Hobbesian Social Contract Theory

人工智能利维坦:通过霍布斯社会契约理论视角探索大语言模型智能体的社会演化

Gordon Dai, Weijia Zhang, Jinhan Li, Siqi Yang, Chidera Onochie lbe, Srihas Rao, Arthur Caetano, Misha Sra

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究基于LLM智能体构建模拟社会,通过霍布斯社会契约理论验证其演化契合该理论,证实LLMs可模拟复杂社会动态,有望助力人类对社会系统的理解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10904 2026-08-11 cs.CR 版本更新 90%

When the Defense Writes the Refusal: Auditing Keyword-Scored Evaluation of Inference-Time Defenses for Multimodal Large Language Models

多模态大语言模型推理时防御方法的比较分析

Bulat Nutfullin, Vladimir Evgrafov, Dmitry Namiot

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文比较评估了三种推理时防御方法及其组合在InternVL和Qwen-VL系列共8个模型上的效果,发现无单一防御在所有设置中占优,组合防御导致良性查询过度拒绝率达97-100%,而简单安全提示在保持实用性的同时带来适度安全提升。

Comments 15 pages, 3 figures. Conditionally accepted at DAMDID/RCDL 2026; revised after peer review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08284 2026-08-11 cs.AI 新提交 90%

Fair on the Surface? Benchmarking Hidden-Output Fairness Gaps in LLM Recommenders

表面上公平?对LLM推荐器的隐藏输出公平性差距进行基准测试

Chan Aristella Lu, Arya Fayyazi, Junhao Zhang, Saeid Shokoufa, Yue Xing, Zhen Xiang, Kyu Hyung Lee, Mehdi Kamal, Massoud Pedram

机构 * University of Georgia(佐治亚大学) University of Southern California(南加州大学) Carnegie Mellon University(卡内基梅隆大学) Michigan State University(密歇根州立大学)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究提出首个联合评估LLM推荐器可观测输出与隐藏表示公平性的基准FairGap,发现二者存在根本张力,现有框架无法诊断。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08265 2026-08-11 cs.LG 新提交 90%

Opportunity Is Not Realizability: Selection-Valid Diagnostics for Multi-LLM Routing

机遇并非可实现性:多大型语言模型(LLM)路由的选择有效诊断方法

Ibne Farabi Shihab, Abu Sa-Adat Mohamed Moon-Im Al Ahsan, Md Najmus Swaqeeb

机构 * Iowa State University(爱荷华州立大学) BRAC University(BRAC大学)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);分类 cs.LG

AI总结 该研究针对多LLM路由的神谕路由诊断缺陷,提出选择有效置信区间方法,通过实验发现可部署路由器仅能恢复部分神谕机遇,且最佳策略的增益下限可能为零。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07544 2026-08-11 cs.NE cs.AI 新提交 90%

MOSAIC: Adversarial Co-evolution of Specialist Heuristics and Problem Instances for LLM-based Automated Heuristic Design

MOSAIC:针对基于大语言模型的自动启发式设计的专用启发式算法与问题实例的对抗性协同进化

Oguzhan Gungordu, Siheng Xiong, Faramarz Fekri

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出MOSAIC框架,通过对抗性协同进化组合优化问题的专用启发式算法与问题实例,构建区域专用启发式算法池,所提取的组合在各类基准测试中均优于现有最先进的基于LLM的自动启发式设计方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27204 2026-08-11 cs.CL cs.IR 版本更新 90%

GraphReview: Scientific Paper Evaluation via LLM-based Graph Evidence Expansion

GraphReview: 基于LLM的图消息传递的科学论文评估

Pujun Zheng, Wanying Ren, Jiacheng Yao, Guoxiu He, Star X. Zhao

机构 * School of Economics and Management, East China Normal University(东华师范大学经济管理学院) Institute of Big Data, Fudan University(复旦大学大数据研究院)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL

AI总结 提出GraphReview框架,通过图消息传递整合论文内在质量、同期关联和历时关联,利用LLM生成节点先验和边比较证据,结合个性化PageRank进行质量排序、决策预测和审稿生成,在决策和排序指标上平均提升29.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07635 2026-08-11 stat.AP 新提交 89%

SurroPilot: An LLM-Assisted Platform for Heterogeneous Surrogate Endpoint Evaluation in Clinical Trials

SurroPilot:用于临床试验中异质性替代终点评估的大语言模型辅助平台

Xingyu Li, Peng Wei

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 SurroPilot是集成LLM与异质性中介框架的辅助平台,可通过自然语言交互完成临床试验异质性替代终点评估全流程,降低了相关方法的应用技术门槛。

Comments Submitted for journal

详情

展开后加载摘要…

URL PDF HTML 收藏