arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-04-23 至 2026-04-23 共收录 287 信号源:cs.CL, cs.AI, cs.LG

1. 推理与问题求解 49 篇

2604.20382 2026-04-23 cs.CL 77%

Graph2Counsel: Clinically Grounded Synthetic Counseling Dialogue Generation from Client Psychological Graphs

Graph2Counsel: 从客户端心理图谱生成临床导向的合成咨询对话

Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych

机构 * UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI)) Zuse School ELIZA(Zuse学院ELIZA) National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE) Indian Institute of Technology Delhi(印度德里理工学院) Yardi School of Artificial Intelligence(Yardi人工智能学院) University of Louisville(路易斯维尔大学) University of Toledo(托莱多大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出Graph2Counsel框架,通过客户端心理图谱生成合成咨询对话,提升数据真实性与质量,实验表明其在特定性、咨询师能力等方面优于现有数据集。

Comments 49 pages, 46 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22343 2026-04-23 cs.CL cs.AI cs.LG cs.LO 75%

Transformers Can Learn Connectivity in Some Graphs but Not Others

变换器在某些图中可以学习连接性,但在其他图中不行

Amit Roy, Abulhair Saparov

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究探讨了变换器在推断传递关系任务中的能力,发现其在网格状图中能有效推断连接性,但对非网格图尤其是具有多个不连通组件的图表现较差。

Comments This paper contains some assumption which is not correct

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19245 2026-04-23 cs.CL cs.AI 73%

Talking to a Know-It-All GPT or a Second-Guesser Claude? How Repair reveals unreliable Multi-Turn Behavior in LLMs

与一个无所不知的GPT或一个犹豫不决的Claude交谈:如何通过修复揭示LLMs在多轮对话中的不可靠行为

Clara Lachenmaier, Hannah Bultmann, Sina Zarrieß

机构 * Computational Linguistics, Department of Linguistics(计算语言学系,语言学系)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究探讨LLMs在解决可解和不可解数学问题的多轮对话中进行修复的交互过程,发现不同模型对修复的反应差异显著,行为随对话轮次增加而更不可预测。

Comments Preprint accepted at ACL Main Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21373 2026-04-23 cs.LG cs.CL 73%

PLR: Plackett-Luce for Reordering In-Context Learning Examples

PLR:基于Plackett-Luce模型的上下文学习示例重排

Pawel Batorski, Paul Swoboda

机构 * Heinrich Heine Universität Düsseldorf(杜塞尔多夫海因里希-海涅大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PLR提出一种基于Plackett-Luce模型的概率方法,通过学习上下文学习示例的排列概率分布,提高小样本分类任务的准确性,尤其在数学推理任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01706 2026-04-23 cs.LG cs.AI 73%

Representational Alignment Across Model Layers and Brain Regions with Multi-Level Optimal Transport

跨模型层和脑区的多级最优传输表示对齐

Shaan Shah, Meenakshi Khosla

机构 * University of California San Diego(加州大学圣地亚哥分校)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多级最优传输框架,通过全局优化实现层间和神经元级的软耦合,解决传统方法在深度不一致和全局结构忽略的问题,提升跨网络表示对比的解释性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20370 2026-04-23 cs.LG stat.ML 70%

Cold-Start Forecasting of New Product Life-Cycles via Conditional Diffusion Models

通过条件扩散模型进行新产品生命周期的冷启动预测

Ruihan Zhou, Zishi Zhang, Jinhui Han, Yijie Peng, Xiaowei Zhang

机构 * Guanghua School of Management, Peking University(北京大学光华管理学院) Department of Industrial Engineering and Decision Analytics, The Hong Kong University of Science and Technology(香港科技大学工业工程与决策分析系)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出CDLF模型,利用静态描述、参考轨迹和新观察数据预测新产品生命周期,解决冷启动问题,提升预测准确性与概率预测质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20090 2026-04-23 cs.CL 70%

Less Languages, Less Tokens: An Efficient Unified Logic Cross-lingual Chain-of-Thought Reasoning Framework

少语言,少令牌:一种高效的统一逻辑跨语言推理框架

Chenyuan Zhang, Qiguang Chen, Xie Chen, Zhuotao Tian, Bowen Xing, Meishan Zhang, Libo Qin, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Central South University(中南大学) Text Computing and Cognitive Intelligence Ministry of Education Engineering Research Center, Guizhou University(贵州省教育厅Text Computing and Cognitive Intelligence工程研究中心,贵州大学) University of Science and Technology Beijing(北京科技大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文提出UL-XCoT框架,通过减少语言和令牌数量提升跨语言推理效率,实验证明在多语言任务中准确率高且令牌成本降低超50%。

Comments Accepted by ACL2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08712 2026-04-23 cs.AI 70%

Model Space Reasoning as Search in Feedback Space for Planning Domain Generation

模型空间推理作为反馈空间中的搜索用于规划领域生成

James Oswald, Daniel Obolensky, Volodymyr Varha, Vasilije Dragovic, Kavitha Srinivas, Harsha Kokel, Michael Katz, Shirin Sohrabi

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文探讨了通过反馈空间中的启发式搜索优化规划领域生成的质量,利用符号反馈机制提升生成效果。

Comments Accepted at ICLR 2026 the 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10312 2026-04-23 cs.LG 70%

Training-free retrieval-augmented generation with reinforced reasoning for flood damage nowcasting

无需训练的检索增强生成与强化推理用于洪水损害现在预测

Lipai Huang, Kai Yin, Chia-Fu Liu, Ali Mostafavi

机构 * Urban Resilience.AI Lab, Zachry Department of Civil and Environmental Engineering(城市韧性.AI实验室,土木与环境工程系) Department of Computer Science and Engineering(计算机科学与工程系) Department of Civil, Environmental and Architectural Engineering(土木、环境与建筑工程系) Institute for a Disaster Resilient Texas(德克萨斯灾害韧性研究所)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本文提出R2RAG-Flood框架,通过强化推理实现无需训练的洪水损害现在预测,利用结构化预测器、文本摘要和推理轨迹构建知识库,在推理阶段通过地理邻近和自由样本支持案例推理,提升预测准确性与成本效率。

Comments 18 pages, 3 figures, 8 tables, submitted to CACAIE journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15146 2026-04-23 cs.CL 70%

Beyond Majority Voting: Towards Fine-grained and More Reliable Reward Signal for Test-Time Reinforcement Learning

超越多数投票:面向细粒度和更可靠的测试时间强化学习奖励信号

Weiqin Wang, Yile Wang, Kehao Chen, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出SCOPE框架,通过结合模型置信度和动态子组划分,解决测试时间强化学习中多数投票策略导致的确认偏误和稀疏奖励问题,提升大语言模型推理能力。

Comments Accepted to ACL 2025 Main Conference. 15 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24765 2026-04-23 cs.AI 70%

Semantic-Aware Logical Reasoning via a Semiotic Framework

通过象征框架实现语义感知的逻辑推理

Yunyao Zhang, Xinglang Zhang, Junxi Sheng, Wenbing Li, Junqing Yu, Yi-Ping Phoebe Chen, Wei Yang, Zikai Song

机构 * Huazhong University of Science and Technology(华中科技大学) La Trobe University(拉筹伯大学)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LogicAgent框架,结合自动推演与反思验证,解决逻辑复杂性与语义复杂性的交互问题,通过RepublicQA基准验证其在抽象命题和逻辑深度上的表现,实现SOTA性能。

Comments Accepted at ACL 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20749 2026-04-23 cs.AI 70%

Where and What: Reasoning Dynamic and Implicit Preferences in Situated Conversational Recommendation

何处与何物:在情境对话推荐中推理动态和隐性偏好

Dongding Lin, Jian Wang, Yongqi Li, Wenjie Li

机构 * Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出SiPeR框架,通过场景转换估计和贝叶斯逆推推理,提升情境对话推荐的准确性和响应质量。

Comments Accpeted by ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06870 2026-04-23 cs.AI 70%

LEAD: Breaking the No-Recovery Bottleneck in Long-Horizon Reasoning

LEAD:突破长horizon推理中的无恢复瓶颈

Denys Pushkin, Emmanuel Abbe

机构 * EPFL(瑞士联邦理工学院) Apple(苹果公司)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出LEAD方法,通过结合短horizon验证与重叠回放,解决长horizon推理中因非均匀误差分布导致的无恢复瓶颈问题,使o4-mini模型能解决复杂度达n=13的Checkers Jumping问题。

Comments 28 pages, 5 figures, 2 tables. Updated version to reflect the manuscript under review at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05605 2026-04-23 cs.CR cs.CL 70%

ShadowCoT: Cognitive Hijacking for Stealthy Reasoning Backdoors in LLMs

ShadowCoT:针对大语言模型内部推理机制的隐秘推理后门攻击

Gejian Zhao, Hanzhou Wu, Xinpeng Zhang, Athanasios V. Vasilakos

机构 * School of Communication and Information Engineering, Shanghai University(上海大学通信与信息工程学院) College of Computer Science and Information Technology, IAU(国际应用技术大学计算机科学与信息学院) Center for AI Research (CAIR), University of Agder (UiA)(阿格德大学人工智能研究中心)

专题命中 推理与问题求解 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 ShadowCoT提出一种新型攻击框架,通过操控模型认知推理路径,实现多步推理链的劫持,产生逻辑连贯但对抗性的结果,实验显示其攻击成功率高达94.4%。

Comments Zhao et al., 16 pages, 2025, uploaded by Hanzhou Wu, Shanghai University

Journal ref IEEE Transactions on Information Forensics and Security (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20319 2026-04-23 cs.CV 67%

SurgCoT: Advancing Spatiotemporal Reasoning in Surgical Videos through a Chain-of-Thought Benchmark

SurgCoT:通过链式推理基准提升手术视频中的时空推理

Gui Wang, YongSong Zhou, Kaijun Deng, Wooi Ping Cheah, Rong Qu, Jianfeng Ren, Linlin Shen

机构 * School of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) University of Nottingham(诺丁汉大学) School of AI, Shenzhen University(深圳大学人工智能学院) Guangdong Provincial Key Laboratory of Intelligent Information Processing, Shenzhen University(广东省智能信息处理重点实验室)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 SurgCoT通过统一的链式推理框架评估多模态大语言模型在7个外科领域35种手术中的时空推理能力,揭示了商业模型在手术推理中的优势及现有模型的不足。

Comments Accept by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19945 2026-04-23 cs.CV 67%

Visual Reasoning through Tool-supervised Reinforcement Learning

通过工具监督强化学习进行视觉推理

Qihua Dong, Gozde Sahin, Pei Wang, Zhaowei Cai, Robik Shrestha, Hao Yang, Davide Modolo

机构 * Northeastern University(东北大学) Amazon AGI(亚马逊人工智能研究院)

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出工具监督强化学习框架,通过简单可解释的视觉工具提升多模态大语言模型的复杂视觉推理能力,实验表明其高效且具备强大工具使用能力。

Comments Accepted to CVPR 2026 Findings. 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13942 2026-04-23 q-fin.GN 67%

AI Agents in Financial Markets: Architecture, Applications, and Systemic Implications

金融市场中的AI代理:架构、应用与系统性影响

Hui Gong

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出一个整合框架分析代理金融,探讨自主AI系统在信息处理、决策支持等流程中的作用,通过四层架构和代理金融市场模型,研究代理设计参数与市场结果的关系,展示如何利用公开数据研究可观察预期渠道。

Comments 35 pages, 3 figures, 7 tables. Updated to reflect the published journal version in FinTech; journal reference and DOI added

Journal ref FinTech 2026, 5(2), 34

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16251 2026-04-23 cs.HC 67%

RelianceScope: An Analytical Framework for Examining Students' Reliance on Generative AI Chatbots in Problem Solving

RelianceScope:一种分析学生在问题解决中依赖生成式AI聊天机器人行为的分析框架

Hyoungwook Jin, Minju Yoo, Jieun Han, Zixin Chen, So-Yeon Ahn, Xu Wang

专题命中 推理与问题求解 :large language model(abstract);language model(abstract)

AI总结 本文提出RelianceScope框架,通过分析学生在求助和响应使用中的参与模式,揭示其依赖行为,为教育系统设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20254 2026-04-23 cs.AI cs.LG 62%

Mol-Debate: Multi-Agent Debate Improves Structural Reasoning in Molecular Design

Mol-Debate:多智能体辩论提升分子设计中的结构推理

Wengyu Zhang, Xiao-Yong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 推理与问题求解 :prompting(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Mol-Debate框架,通过生成-辩论-细化循环提升分子设计中的结构推理能力,实验显示其在多个基准测试中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04225 2026-04-23 cs.CV cs.AI cs.CL 62%

Locate-Then-Examine: Grounded Region Reasoning Improves Detection of AI-Generated Images

定位后检查:基于区域的推理提升AI生成图像的检测

Yikun Ji, Yan Hong, Bowen Deng, Jun Lan, Huijia Zhu, Weiqiang Wang, Liqing Zhang, Jianfu Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 推理与问题求解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LTE框架,通过定位可疑区域并重新检查以提升AI生成图像检测的准确性和鲁棒性,提供可理解的区域级解释。

Comments 18 pages, 11 figures (including supplementary material)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13533 2026-04-23 cs.RO cs.CV 50%

Evolvable Embodied Agent for Robotic Manipulation via Long Short-Term Reflection and Optimization

可进化具身代理:通过长期短期反思与优化实现机器人操作

Jianzong Wang, Botao Zhao, Yayun He, Junqing Peng, Xulong Zhang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司)

专题命中 推理与问题求解 :language model(abstract)

AI总结 本文提出EEAgent框架,通过长短期反思优化机制提升机器人在复杂任务中的适应能力,实现自我进化,优于现有方法。

Comments This work has been accepted for publication in the Proceedings of the 2026 International Joint Conference on Neural Networks (IJCNN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20696 2026-04-23 cs.CV 50%

R-CoV: Region-Aware Chain-of-Verification for Alleviating Object Hallucinations in LVLMs

R-CoV:区域感知的验证链用于减轻LVLMs中的物体幻觉

Jiahao Xie, Alessio Tonioni, Nathalie Rauschmayr, Federico Tombari, Bernt Schiele

机构 * Max Planck Institute for Informatics, SIC(马克斯·普朗克信息研究所,SIC) VIA Research Center(VIA研究中心) Google(谷歌)

专题命中 推理与问题求解 :language model(abstract)

AI总结 R-CoV通过区域感知的验证链方法,减轻LVLMs中的物体幻觉问题,采用六步流程,无需额外训练即可集成至多种LVLMs,实验表明有效缓解幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 评测与基准 70 篇

2502.18036 2026-04-23 cs.CL 94%

Harnessing Multiple Large Language Models: A Survey on LLM Ensemble

利用多个大语言模型:关于LLM集成的综述

Zhijun Chen, Xiaodong Lu, Jingzheng Li, Pengpeng Chen, Zhuoran Li, Kai Sun, Yuankai Luo, Qianren Mao, Ming Li, Likang Xiao, Dingqi Yang, Xiao Huang, Yikun Ban, Hailong Sun, Philip S. Yu

机构 * State Key Laboratory of Complex & Critical Software Environment, Beihang University, Beijing, China(复杂与关键软件环境国家重点实验室,北京航空航天大学,北京,中国) Zhongguancun Laboratory, Beijing, China(中关村实验室,北京,中国) Aviation System Engineering Institute of China, Beijing, China(中国航空系统工程研究院,北京,中国) Xi’an Jiaotong University, Xi’an, China(西安交通大学,西安,中国) Nanjing University, Nanjing, China(南京大学,南京,中国) Tsinghua University, Beijing, China(清华大学,北京,中国) University of Macau, Macau SAR, China(澳门大学,澳门特别行政区,中国) The Hong Kong Polytechnic University, Hong Kong, China(香港理工大学,香港,中国) University of Illinois at Chicago, Chicago, USA(伊利诺伊大学香槟分校,芝加哥,美国)

专题命中 评测与基准 :LLM(title,title_cn);large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文系统回顾了LLM集成的最新发展,介绍了分类方法,讨论了相关研究问题,并提出了未来研究方向。

Comments 12 pages, 2 figures, codebase: https://github.com/junchenzhi/Awesome-LLM-Ensemble

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.00585 2026-04-23 cs.CY cs.AI 92%

Fairness Testing of Large Language Models in Role-Playing

大型语言模型在角色扮演中的公平性测试

Xinyue Li, Zhenpeng Chen, Jie M. Zhang, Ying Xiao, Tianlin Li, Weisong Sun, Yang Liu, Yiling Lou, Xuanzhe Liu

机构 * Peking University(北京大学) Tsinghua University(清华大学) King's College London(伦敦国王学院) Nanyang Technological University(南洋理工大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文通过生成33000个角色特定问题,评估10种先进LLM在角色扮演场景中的公平性,发现107580次偏见响应,揭示角色扮演中偏见的普遍性。

Comments Accepted by ACM International Conference on the Foundations of Software Engineering (FSE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19787 2026-04-23 cs.CL cs.AI cs.CY 92%

LLM Agents Predict Social Media Reactions but Do Not Outperform Text Classifiers: Benchmarking Simulation Accuracy Using 120K+ Personas of 1511 Humans

LLM代理预测社交媒体反应但不优于文本分类器:使用120,000多个1511人的人设进行基准测试

Ljubisa Bojic, Alexander Felfernig, Bojana Dinic, Velibor Ilic, Achim Rettinger, Vera Mevorah, Damian Trilling

机构 * Institute for Artificial Intelligence Research and Development of Serbia(塞尔维亚人工智能研究与开发研究所) University of Belgrade, Institute for Philosophy and Social Theory, Digital Society Lab(贝尔格莱德大学,哲学与社会理论研究所,数字社会实验室) Complexity Science Hub, Vienna, Austria(维也纳复杂科学中心) Graz University of Technology, Graz, Austria(技术大学格拉茨,格拉茨,奥地利) University of Novi Sad, Faculty of Philosophy, Novi Sad, Serbia(诺维萨德大学,哲学学院,诺维萨德,塞尔维亚) University of Trier, Trier, Germany(特里尔大学,特里尔,德国) Vrije University Amsterdam, Amsterdam, Netherlands(阿姆斯特丹自由大学,阿姆斯特丹,荷兰)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文研究LLM代理预测人类社交媒体反应的准确性,发现其表现不如传统文本分类器,揭示了零样本代理在模拟极化动态中的潜力及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20131 2026-04-23 cs.CL 92%

Whose Story Gets Told? Positionality and Bias in LLM Summaries of Life Narratives

谁的故事被讲述?LLM在生命叙事中的位置性与偏见

Melanie Subbiah, Haaris Mian, Nicholas Deas, Ananya Mayukha, Dan P. McAdams, Kathleen McKeown

机构 * Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系) Department of Applied Physics and Applied Mathematics, Columbia University(哥伦比亚大学应用物理与应用数学系) Department of Psychology, Northwestern University(西北大学心理学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究LLM在生命叙事抽象分析中的伦理与有效性,提出基于总结的管道以揭示LLM在解读叙事时的偏见,识别种族和性别偏见并呼吁未来研究中使用该分析方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15037 2026-04-23 cs.SE cs.AI 92%

CircuChain: Disentangling Competence and Compliance in LLM Circuit Analysis

CircuChain: 解构LLM电路分析中的能力与合规性

Mayank Ravishankara

机构 * Independent Researcher(独立研究员) San Francisco, CA, USA(美国加州旧金山)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 CircuChain通过设计控制/陷阱问题对,评估LLM在电路分析中遵循指令与物理推理能力的差异,揭示模型能力与约束对齐的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15319 2026-04-23 cs.HC cs.AI 92%

Explainable Iterative Data Visualisation Refinement via an LLM Agent

通过LLM代理的可解释迭代数据可视化细化

Burak Susam, Tingting Mu

机构 * Department of Computer Science, University of Manchester(曼彻斯特大学计算机科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用LLM代理的自动化方法,通过结合定量评估与人类洞察,实现高维数据可视化优化,生成高质量可视化结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10271 2026-04-23 cs.SE cs.AI 92%

Quality Assurance of LLM-generated Code: Addressing Non-Functional Quality Characteristics

LLM生成代码的质量保障:解决非功能性质量特性

Xin Sun, Daniel Ståhl, Kristian Sandahl, Christoph Kessler

机构 * Department of Computer and Information Science, Linköping University, Sweden(Linköping大学计算机与信息科学系)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究通过文献综述、行业研讨会和实证分析,探讨LLM生成代码在安全、可维护性和性能效率等非功能性质量特性上的表现,揭示学术研究与行业需求的不匹配,强调需在代码生成流程中集成质量保障机制。

Journal ref Journal of Systems and Software (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20310 2026-04-23 cs.HC 91%

Odor Maps from the LLM-derived similarity scores

从LLM衍生的相似性得分生成气味图

Yuki Harada, Manuel Aleixandre, Manabu Okumura, Takamichi Nakamoto

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 研究通过比较LLM生成的气味相似性与原始数据距离,验证了LLM在气味图生成中的潜力,展示了精油在气味图中的分布与人类评价的一致性。

Comments 9 pages, 7 figures, Under review

详情

展开后加载摘要…

URL PDF HTML 收藏