arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-05-28 至 2026-05-28 共收录 525 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 92 篇

2511.02841 2026-05-28 cs.CR cs.MA 67%

AI Agents with Decentralized Identifiers and Verifiable Credentials

具有去中心化标识符和可验证凭证的AI智能体

Sandro Rodriguez Garzon, Awid Vaziry, Enis Mert Kuzu, Dennis Enrique Gehrmann, Buse Varkan, Alexander Gaballa, Axel Küpper

专题命中 推理与问题求解 :LLM(abstract,abstract_cn)

AI总结 提出一种基于W3C去中心化标识符和可验证凭证的框架,使AI智能体在对话初期能够建立跨域信任关系,并实现原型系统验证其可行性。

Comments Accepted for presentation at the 18th International Conference on Agents and Artificial Intelligence 2026

Journal ref 18th International Conference on Agents and Artificial Intelligence (ICAART), 2026, volume 1, pp. 252-259

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28142 2026-05-28 cs.LG cs.CL 62%

Self-Consistency via Marginal Sharpening

通过边际锐化实现自一致性

Aleksei Arzhantsev, Otmane Sakhi, Nicolas Chopin

机构 * Criteo AI Lab(Criteo AI实验室) CREST IP Paris(巴黎CREST研究所) ENSAE, Institut Polytechnique de Paris(巴黎理工学院ENSAE)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种自回归并行采样算法,通过锐化答案边际分布而非完整输出分布,在数学和编程基准上优于标准功率采样且速度更快。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27817 2026-05-28 cs.RO cs.AI cs.CV cs.LG 62%

Turning Video Models into Generalist Robot Policies

将视频模型转化为通用机器人策略

Sizhe Lester Li, Evan Kim, Xingjian Bai, Tong Zhao, Tao Pang, Max Simchowitz, Vincent Sitzmann

机构 * MIT(麻省理工学院) CMU(卡内基梅隆大学) Amazon FAR(亚马逊公司)

专题命中 推理与问题求解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出一种解耦的视频到动作策略VERA,利用无动作视频世界模型和基于机器人雅可比矩阵的逆动力学模型,实现跨本体的零样本机器人控制。

Comments project page: https://vera.csail.mit.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28600 2026-05-28 cs.LG 57%

Transformers Provably Learn to Internalize Chain-of-Thought

Transformer可证明地内化思维链

Yixiao Huang, Hanlin Zhu, Zixuan Wang, Jiantao Jiao, Stuart Russell, Somayeh Sojoudi, Song Mei

机构 * UC Berkeley(伯克利大学) Princeton University(普林斯顿大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.LG

AI总结 提出Log-ICoT课程训练,使L层Transformer用多项式样本学习k-奇偶性,匹配显式CoT的样本效率且消除推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28369 2026-05-28 cs.AI cs.SI 57%

CyberJurors: A Multi-Agent Simulation Task for E-Commerce Disputes Verdict

CyberJurors:电商纠纷裁决的多智能体模拟任务

Yanhui Sun, Wu Liu, Haifeng Ming, Xinru Wang, Hantao Yao, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.AI

AI总结 针对电商纠纷裁决需要从冗余多轮多模态证据中提取关键线索并依据平台特定惯例决策的问题,提出多智能体框架CyberJurors,通过个体裁决链式思维和集体陪审共识裁决提升裁决质量,在包含6000真实案例的基准上超越现有方法。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28077 2026-05-28 cs.AI 57%

MACReD: A Multi-Agent Collaborative Reasoning Framework for Reaction Diagram Parsing

MACReD:一种用于反应图解解析的多智能体协作推理框架

Chuang Tang, Chenhao Lin, Yin Xu, Hao Wang, Jinrui Zhou, Xin Li, Mingjun Xiao, Enhong Chen

机构 * University of Science Technology of China \& iFLYTEK Co., Ltd. Hefei China Technology of China \& iFLYTEK Co., Ltd.

专题命中 推理与问题求解 :language model(abstract);分类 cs.AI

AI总结 提出MACReD分层多智能体框架,通过协调分子感知、箭头理解、文本提取和反应重建等专用智能体,在统一VLM引导架构下实现化学图解解析,在RxnScribe基准上达到最优性能。

Comments Preprint. Code is available at https://github.com/TC9905/MACReD

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28022 2026-05-28 cs.CL cs.SE 57%

Beyond pass@k: Redundancy-Aware RLVR for Multi-Sample Code Generation

超越 pass@k:面向多样本代码生成的冗余感知 RLVR

Le Bronnec Florian, Alexandre Verine, Rio Yokota, Benjamin Negrevergne

机构 * RIKEN Center for Computational Science(日本计算科学中心)

专题命中 推理与问题求解 :LLM(abstract_cn);分类 cs.CL

AI总结 针对代码生成中重复采样评估的冗余问题,提出基于 JPlag 相似度的反冗余奖励增强 RLVR,在有限预算下提升可执行正确性。

Comments Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28003 2026-05-28 cs.CL 57%

ResearchMath-14K: Scaling Research-Level Mathematics via Agents

ResearchMath-14K: 通过智能体扩展研究级数学

Guijin Son, Seungyeop Yi, Minju Gwak, Hyunwoo Ko, Wongi Jang, Youngjae Yu

机构 * Seoul National University(首尔国立大学) OneLineAI Yonsei University(延世大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 本文通过多智能体流程从学术来源构建了最大的研究级数学问题数据集ResearchMath-14K(14,056个问题),并生成220K教师轨迹,经智能体过滤后微调Qwen3模型(4B-30B)平均提升9.2个点,表明过滤后的开放问题尝试即使没有完全正确的推理轨迹也能提供有效监督。

Comments Work in progress. Dataset available at: https://huggingface.co/datasets/amphora/ResearchMath-14k

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27934 2026-05-28 cs.CL 57%

GeneralThinker: Domain-General Reasoning through Likelihood-Guided Answer-Conditioned Optimization

GeneralThinker: 通过似然引导的答案条件优化实现领域通用推理

Shengmin Piao, Sanghyun Park

机构 * Yonsei University(延世大学)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 提出GeneralThinker框架,利用答案似然进行密集监督和细粒度信用分配,无需领域特定验证器,在数学、STEM和通用推理等11个基准上取得最佳平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15864 2026-05-28 cs.CV cs.CL 57%

Are VLMs Seeing or Just Saying? Uncovering the Illusion of Visual Re-examination

VLMs 是在看还是只是在说?揭示视觉重新检查的幻觉

Chufan Shi, Cheng Yang, Yaokang Wu, Linghao Jin, Bo Shui, Taylor Berg-Kirkpatrick, Xuezhe Ma

机构 * University of Southern California(南加州大学) University of California San Diego(加州大学圣地亚哥分校) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL

AI总结 通过图像交换探测框架 VisualSwap 和 800 对图像基准 VS-Bench,发现视觉语言模型在推理时声称的“重新检查图像”多为文本模式,而非真正的视觉重新检查,且思考模型更易受影响,用户指令可恢复视觉基础但自我反思无效。

Comments ICML 2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28548 2026-05-28 cs.CV 50%

GEM: Generative Supervision Helps Embodied Intelligence

GEM: 生成式监督助力具身智能

Ruowen Zhao, Bangguo Li, Zuyan Liu, Yinan Liang, Junliang Ye, Fangfu Liu, Diankun Wu, Zhengyi Wang, Xumin Yu, Yongming Rao, Han Hu, Jun Zhu

机构 * Tsinghua University(清华大学) Tencent Hunyuan(腾讯文心)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出GEM模型,通过在视觉语言模型预训练中引入深度图生成任务,联合训练以提升具身智能的语义理解与物理操作能力,并发布大规模数据集GEM-4M,在多个基准上取得最优结果。

Comments Project Page: https://zhaorw02.github.io/GEM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28480 2026-05-28 eess.AS cs.SD 50%

Audio-Mind: An Auditable Agentic Framework for Audio Understanding

Audio-Mind: 一种可审计的音频理解智能体框架

Yucheng Wang, Jing Peng, Hanqi Li, Chenghao Wang, Wenming Tu, Yu Xi, Zhaokai Sun, Kai Yu, Shuai Wang

机构 * School of Intelligence Science and Technology, Nanjing University, China(南京大学智能科学与技术学院) Department of Computer Science, ETH Zürich, Switzerland(苏黎世联邦理工学院计算机科学系) X-LANCE Lab, School of Computer Science, Shanghai Jiao Tong University, China(上海交通大学计算机科学学院X-LANCE实验室) School of Automation Science and Engineering, Xi’an Jiaotong University, China(西安交通大学自动化科学与工程学院) School of Computer Science, Northwestern Polytechnical University, China(西北工业大学计算机科学学院)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出Audio-Mind框架,通过条件性证据获取动态结合强前端与规划器引导的工具使用,解决音频理解中智能体证据获取的时机问题,在MMAR和MSU-Bench上分别达到80.4%和82.8%的准确率,并生成可审计的推理轨迹。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27948 2026-05-28 cs.RO 50%

VLM-Based Advanced Rider Assistance System for Motorcycle Safety

基于VLM的摩托车安全高级骑手辅助系统

Mohamed Elnoor, Francesca Baldini, Ananya Trivedi, Faizan M. Tariq, Jovin D'sa, David Isele, Sangjae Bae, Dinesh Manocha, Yosuke Sakamoto

机构 * HRI Honda Research Institute(本田研究院) University of Maryland(马里兰大学) Northeastern University(东北大学)

专题命中 推理与问题求解 :language model(abstract)

AI总结 提出一种利用视觉语言模型进行语义感知和风险感知规划的摩托车高级骑手辅助系统,通过构建密集风险地图并采用基于采样的规划器,在CARLA模拟器中实现更高的成功率和更低的风险暴露。

Comments Accepted to IEEE IV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 121 篇

2605.11154 2026-05-28 astro-ph.IM cs.AI cs.LG 92%

Quantifying the Reconstructability of Astrophysical Methods with Large Language Models and Information Theory: A Case Study in Spectral Reconstruction

利用大语言模型和信息论量化天体物理方法的可重建性:光谱重建的案例研究

Hsing Wen Lin, Zong-Fu Sie

机构 * Department of Physics, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学物理系) Michigan Institute for Data and AI in Society, University of Michigan, Ann Arbor, MI 48109, USA(密歇根大学数据与人工智能在社会中的研究所) Independent Researcher, Taiwan(台湾独立研究员)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);prompting(abstract)

AI总结 提出信息论框架,通过大语言模型生成的概率分布和香农熵、JS散度,量化文本描述对算法重建的约束力,以海王星外天体光谱重建为例,发现文本虽能明确算法结构但无法消除实现级方差,存在“熵下限”,且LLM无法推断隐性专家知识。

Comments 26 pages, 6 figures, Accepted for publication in PASP

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27789 2026-05-28 cs.AI cs.CL 92%

A Fixed-Budget, Cluster-Aware Standard for LLM-as-a-Judge Evaluation: A Multi-Hop RAG Stress Test

固定预算、聚类感知的 LLM-as-a-Judge 评估标准:多跳 RAG 压力测试

Camilo Chacón Sartori, José H. García

机构 * Catalan Institute of Nanoscience and Nanotechnology(加泰罗尼亚纳米科学与纳米技术研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对多跳 RAG 系统评估中的统计偏差问题,提出一种固定预算、聚类感知的 LLM-as-a-Judge 比较标准,并通过遗传算法证据选择器 GADMEC 在 400 个多跳问题上进行压力测试,揭示聚类感知推断改变了实证结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27388 2026-05-28 cs.CL cs.AI cs.SI 92%

Modeling Community Attitude through Reaction Tone: A Human-AI Collaborative Framework for Evaluating LLM Alignment with Linguistic Behaviors in Online Communities

通过反应语气建模社区态度:评估LLM与在线社区语言行为对齐的人机协作框架

Nuan Wen, Xuezhe Ma

机构 * Information Sciences Institute University of Southern California(南加州大学信息科学研究所)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CARE框架,通过细粒度言语气势分析,评估LLM模拟社区对真实新闻的反应,揭示其存在“现实主义差距”,表明当前对齐策略不足以捕捉在线群体的社会语言动态。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19743 2026-05-28 cs.AI cs.LG cs.MA 92%

EngiAI: A Multi-Agent Framework and Benchmark Suite for LLM-Driven Engineering Design

EngiAI: 面向LLM驱动工程设计的智能体框架与基准测试套件

Gioele Molinari, Florian Felten, Soheyl Massoudi, Mark Fuge

机构 * IDEAL Chair of Artificial Intelligence in Engineering Design(人工智能与工程设计理想 chair) ETH Zurich(苏黎世联邦理工学院) Autom8.build

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出EngiAI多智能体系统框架和包含工作流、RAG、HPC三维度的基准套件,通过监督架构协调七个专业智能体,验证了LLM在工程设计中的能力与局限。

Comments 26 pages, 10 figures, to be published at IDETC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17375 2026-05-28 cs.LG cs.CL cs.CR 92%

AdvJudge-Zero: Binary Decision Flips in LLM-as-a-Judge via Adversarial Control Tokens

AdvJudge-Zero:通过对抗控制令牌在LLM作为评判者中实现二元决策翻转

Tung-Ling Li, Yuhao Wu, Hongliang Liu

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 评测与基准 :LLM(title,title_cn);RLHF(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出AdvJudge-Zero方法,通过从评判模型自身分布中采样低困惑度令牌,无需梯度优化即可将LLM评判者的二元判决从“否”翻转为“是”,并基于发现的令牌池提出防御策略以增强评判鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12468 2026-05-28 cs.LG cs.AI 92%

MCTS-Judge: Test-Time Scaling in LLM-as-a-Judge for Code Correctness Evaluation

MCTS-Judge:LLM作为裁判在代码正确性评估中的测试时扩展

Yutong Wang, Pengliang Ji, Chaoqun Yang, Kaixin Li, Ming Hu, Jiaoyang Li, Guillaume Sartoretti

机构 * Independent Contributor(独立贡献者)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出MCTS-Judge框架,利用蒙特卡洛树搜索在测试时进行多视角分解评估,显著提升LLM作为裁判在代码正确性评估中的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07882 2026-05-28 cs.SE 92%

Rethinking Code Complexity Through the Lens of Large Language Models

通过大语言模型的视角重新思考代码复杂度

Chen Xie, Xiaodong Gu, Yuling Shi, Beijun Shen

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract)

AI总结 针对传统复杂度指标与LLM感知难度不匹配的问题,提出基于语义非线性的熵引导语义组合层次复杂度度量LM-CC,实验证明其与LLM性能强相关且语义保持的复杂度降低能提升下游任务表现。

Comments accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.01829 2026-05-28 cs.CL cs.AI cs.LG cs.MA 92%

Persuade Me if You Can: A Framework for Evaluating Persuasion Effectiveness and Susceptibility Among Large Language Models

如果你能说服我:评估大型语言模型说服效果与易受影响性的框架

Nimet Beyza Bozdag, Shuhaib Mehri, Gokhan Tur, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PMIYC框架,通过多智能体对话自动评估LLM的说服效果与易受影响性,发现不同模型在说服力和抗说服性上存在显著差异。

Comments Paper published at the ACM Conference on AI and Agentic Systems 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28359 2026-05-28 cs.AI q-fin.TR 92%

From Knowing to Doing: A Memory-Controlled Benchmark for LLM Trading Agents on Stock Markets

从知道到做到:面向LLM股票市场交易智能体的记忆控制基准

Taojie Zhu, Wentao Zhao, Rui Sun, Beidi Luan, Jiacheng Lu, Sinuo Wang, Jing Li, Daxin Jiang, Yonghong He, Zuo Bai

机构 * Tsinghua University(清华大学) Stepfun FinStep Shanghai Jiao Tong University(上海交通大学) Adelaide University(阿德莱德大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对LLM交易智能体评估中的知识泄露和收益归因问题,提出KTD-Fin基准,通过数据掩码和Barra风格归因框架,分离市场记忆与投资决策,并揭示收益主要来自被动市场暴露而非选股能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28313 2026-05-28 cs.CL 91%

Argument Quality Assessment with Large Language Models: A Pairwise Bradley-Terry Approach

基于大语言模型的论证质量评估:一种成对Bradley-Terry方法

Nicolás Benjamín Ocampo, Agnes Paullate Nyiranziza, Davide Ceolin

机构 * Centrum Wiskunde & Informatica, The Netherlands(荷兰代尔夫特理工大学) Vrije Universiteit Amsterdam, The Netherlands(荷兰阿姆斯特丹自由大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究利用12种开源大语言模型,通过成对比较和Bradley-Terry模型评估论证质量,发现Llama-70B与人类专家判断具有中等一致性(Cohen's κ=0.493),其他模型表现各异但互补。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28037 2026-05-28 cs.CL 91%

Personality, Role, and Expressive Style in Large Language Models: An Interactionist Analysis

大型语言模型中的个性、角色与表达风格:一种互动主义分析

Moe Nagao, Koichiro Terao, Mikio Nakano, Naoto Iwahashi

机构 * Okayama Prefectural University(冈山县立大学) AI & Humans Lab(人工智能与人类实验室) C4A Research Institute(C4A研究所)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究从互动主义视角,通过因子设计实验分析个性特质、对话角色和表达风格如何共同影响大型语言模型生成对话中感知的大五人格特质表达。

Comments 26 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18481 2026-05-28 q-fin.TR cs.AI 91%

AlphaForgeBench: Benchmarking End-to-End Trading Strategy Design with Large Language Models

AlphaForgeBench:用大型语言模型对端到端交易策略设计进行基准测试

Wentao Zhang, Mingxuan Zhao, Jincheng Gao, Jieshun You, Huaiyu Jia, Yilei Zhao, Bo An, Shuo Sun

机构 * Nanyang Technological University(南洋理工大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Hong Kong Polytechnic University(香港理工大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 提出AlphaForgeBench框架,将LLM从随机交易代理重新定义为量化研究员,通过生成可执行alpha因子和基于因子的交易策略,消除执行不稳定,实现可复现的金融推理评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09580 2026-05-28 cs.CR 91%

AICrypto: Evaluating Cryptography Capabilities of Large Language Models

AICrypto:评估大型语言模型的密码学能力

Yu Wang, Yijian Liu, Liheng Ji, Han Luo, Wenjie Li, Xiaofei Zhou, Chiyun Feng, Puji Wang, Yuhan Cao, Geyuan Zhang, Xiaojian Li, Rongwu Xu, Yilei Chen, Tianxing He

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn)

AI总结 构建AICrypto基准测试,通过多项选择题、夺旗挑战和证明题评估LLM在密码学知识记忆、漏洞利用和形式推理方面的能力,发现最先进模型在常规任务上匹配或超越人类专家,但在抽象概念理解和多步推理上仍有不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04975 2026-05-28 cs.CY 91%

Evaluating Chinese Large Language Models: The Influence of Persona Assignment on Stereotypes and Safeguards

评估中文大语言模型:角色分配对刻板印象和安全机制的影响

Geng Liu, Li Feng, Carlo Alberto Bono, Songbo Yang, Mengxiao Zhu, Francesco Pierri

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)

AI总结 本研究通过大规模跨模型分析,量化了角色分配对四个中文大语言模型在拒绝行为和毒性输出放大方面的影响,并探索了基于外部评估器的迭代缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26730 2026-05-28 cs.CL 91%

PRISM: A Multi-Dimensional Benchmark for Evaluating LLM Peer Reviewers

PRISM:评估LLM同行评审员的多维基准

Ngoc Phan Phuoc Loc, Toan Huynh La Viet, Thanh Tran Khanh, Duy A Nguyen, Tuan Anh Nguyen Pham, Thanh Nguyen, Nitesh V. Chawla, Wray Buntine, Kok-Seng Wong, Khoa D. Doan, Binh T. Nguyen

机构 * VinUniversity(Vin大学) University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Notre Dame(诺丁汉大学) Monash University(莫纳什大学)

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL

AI总结 提出PRISM基准,从分析深度、新颖性评估、缺陷识别与主要问题排序、多维建设性四个维度评估LLM评审质量,发现LLM在单维度上可媲美甚至超越人类,但无系统在所有维度上一致平衡,表明LLM评审员更适合作为人类评审的针对性补充。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04505 2026-05-28 cs.AI cs.CL cs.SY eess.SY 90%

CircuitLM: A Multi-Agent LLM-Aided Design Framework for Generating Circuit Schematics from Natural Language Prompts

CircuitLM: 一种基于多智能体的大语言模型辅助设计框架,用于从自然语言提示生成电路原理图

Khandakar Shakib Al Hasan, Syed Rifat Raiyan, Hasin Mahtab Alvee, Wahid Sadik

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Department of Electrical and Electronic Engineering(电气与电子工程系) Islamic University of Technology(伊斯兰技术大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CircuitLM多智能体流水线,通过嵌入驱动的组件知识库和五阶段流程,将自然语言提示转化为结构化的CircuitJSON原理图,并采用确定性电气规则检查和LLM作为评判的元评估器双重验证,解决大语言模型在电路设计中的幻觉和物理约束问题。

Comments Accepted at the 2026 IEEE International Conference on LLM-Aided Design (ICLAD), 10 pages, 8 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27373 2026-05-28 cs.AI cs.CL cs.CY 90%

Identifying and Understanding Human Values in Text: A Tailorable LLM-based Architecture

识别和理解文本中的人类价值观:一种可定制的基于LLM的架构

Eduardo de la Cruz Fernández, Marcelo Karanik, Sascha Ossowski

机构 * Universidad Politécnica de Madrid(马德里理工大学) CETINIA, Universidad Rey Juan Carlos(CETINIA,雷伊·胡安·卡洛斯大学)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于大型语言模型的可定制架构,通过三个模块(规范生成、文本标注、强度评估)检测文本中人类价值观的强度,避免依赖特定价值理论或复杂提示工程,实验表明具有良好检测性能。

Comments 8 pages, 1 figure. Published in Proceedings of the 18th International Conference on Agents and Artificial Intelligence (ICAART 2026), Volume 5

Journal ref Proc. ICAART 2026, Vol. 5, SciTePress, 2026, pp. 4096-4103

详情

展开后加载摘要…

URL PDF HTML 收藏