arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 548 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 548 篇

2607.19261 2026-07-31 cs.CV cs.AI 版本更新 57%

PathAgentBench: Benchmarking Evidence-Seeking Vision-Language Models on Whole-Slide Pathology Image

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11015 2026-07-31 cs.AI 版本更新 57%

Numbers Beat Words: A Rigorous On-Premise Benchmark for Coupled MIMO Controller Tuning

从推理中获取结构,从搜索中获取数值:本地部署的开放大语言模型作为耦合MIMO控制器整定的结构先验

Yang Shu, Jiaxuan Chen, Haonan Li

机构 * Jinling Institute of Technology(金陵科技学院) College of Water Resources and Civil Engineering, China Agricultural University(中国农业大学水利与土木工程学院) Zhejiang University(浙江大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 针对强耦合MIMO过程,提出利用本地部署的开源大语言模型作为结构先验,通过推理耦合关系提出非对称结构,结合经典优化器实现样本高效且可解释的控制器整定。

Comments 17 pages, 7 figures, 6 tables. Substantially revised benchmark, analysis, and presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10579 2026-07-31 cs.CL 版本更新 57%

VISTA: A Controllable Platform for Generating and Auditing Egocentric Assistance Scenarios

VISTA:一种用于日常协助的生成性眼动视频框架

Yu-Hsiang Liu, Yu-Chien Tang, An-Zi Yen

机构 * Department of Computer Science, National Yang Ming Chiao Tung University(国立阳明交通大学计算机科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 VISTA通过生成高保真眼动视频为AI代理提供训练和评估数据,支持从日常家务到紧急安全情况的主动协助,包含反应性和前瞻性干预模式,提供可定制的视频基准测试。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10913 2026-07-31 cs.CL 版本更新 57%

LLM2Vec-Gen: Generative Embeddings from Large Language Models

LLM2Vec-Gen:从大型语言模型生成嵌入向量

Parishad BehnamGhader, Vaibhav Adlakha, Fabian David Schmidt, Nicolas Chapados, Marius Mosbach, Siva Reddy

机构 * McGill University(麦吉尔大学) Mila–Quebec AI Institute(米拉-魁北克人工智能研究所) ServiceNow Research(ServiceNow研究院) Cohere Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 LLM2Vec-Gen通过自监督学习生成大型语言模型的嵌入向量,无需微调,提升MTEB基准测试性能,并保留语义和推理能力。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14649 2026-07-31 cs.CL 版本更新 57%

GradMAP: Faster Layer Pruning with Gradient Metric and Projection Compensation

GradMAP: 更快的层剪枝与梯度度量和投影补偿

Hao Liu, Guangyan Li, Wensheng Zhang, Yongqiang Tang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 GradMAP通过梯度度量和投影补偿实现更快的层剪枝,提升剪枝效率和性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19982 2026-07-31 cs.CV cs.AI 版本更新 57%

EmoFeedback$^2$: Reinforcement of Continuous Emotional Image Generation via LVLM-based Reward and Textual Feedback

EmoFeedback$^2$:基于LVLM的奖励与文本反馈的连续情绪图像生成强化

Kai Shu, Jingyang Jia, Gang Yang, Long Xing, Xun Chen, Aiping Liu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 EmoFeedback$^2$通过基于LVLM的奖励与文本反馈机制,提升连续情绪图像生成的质量与情绪保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04281 2026-07-31 cs.AI 版本更新 57%

RetiBridge: Bridging Quantitative Retinal Biomarkers and Qualitative Diagnosis with a Knowledge-Guided Multimodal Large Language Model

RetiBridge:用知识引导的多模态大语言模型连接定量视网膜生物标志物与定性诊断

Zhuangzhi Gao, Hongyi Qin, He Zhao, Qinkai Yu, Feixiang Zhou, Fu Wang, Jinru Ding, Eduard Shantsila, Uazman Alam, Alena Shantsila, Wahbi El-Bouri, Gregory Y. H. Lip, Yalin Zheng

机构 * University of Liverpool(利物浦大学) Institute of Life Course & Medical Sciences(生命课程与医学科学研究院) Department of Eye and Vision Sciences(眼科与视觉科学系) Computer Science Department(计算机科学系) Cardiovascular & Metabolic Medicine(心血管与代谢医学) Liverpool Centre for Cardiovascular Science(利物浦心血管科学中心)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 该研究提出RetiBridge模型,结合CFP、OCT数据与文本,通过知识引导微调学习定量到定性诊断路径,在眼科理解基准上表现优于开源基线及OpenAI o3,代码数据已公开。

Comments 10 pages, 4 figures, 3 table. Equal contribution: Zhuangzhi Gao and Hongyi Qin. Corresponding author: Yalin Zheng (yzheng@liverpool.ac.uk)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02464 2026-07-30 cs.CL 版本更新 57%

Will Scaling Improve Social Simulation with LLMs?

扩展规模会改善基于LLM的社会模拟吗?

Caleb Ziems, William Held, Su Doga Karaca, David Grusky, Tatsunori Hashimoto, Diyi Yang

机构 * Stanford University(斯坦福大学) Open Athena(开放雅典娜)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究LLM规模扩展对社会模拟保真度的影响,发现多数任务随规模提升而改善,但存在例外,如纵向预测和低资源领域改进缓慢。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24155 2026-07-30 cs.CY cs.AI cs.HC 版本更新 57%

The Alignment Target Problem: Divergent Moral Judgments of Humans, AI Systems, and Their Designers

对齐目标问题:人类、人工智能系统及其设计者的道德判断分歧

Benjamin Minhao Chen, Xinyu Xie

机构 * The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究探讨了人类、AI系统及其设计者在道德判断上的差异,通过实验发现人类设计的AI行为会引发更强烈的道德约束,揭示了价值对齐的挑战。

Comments ACM FAccT 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08285 2026-07-29 cs.AI 版本更新 57%

Psychological Competence as a Missing Dimension in AI Evaluation

心理能力作为人工智能评估中缺失的维度

Marcos Economides, Paul M. Sacher, Samuel Salzer, Alexis Michelle Abellar, Fendi Tsim, Antoine Ferrère

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究指出当前人工智能评估框架对面向人类的系统不足,引入心理能力这一缺失维度,借鉴多领域研究概述其概念框架,定义结构、阐明边界并说明评估方式,强调其应成为多方关注的核心考量。

Comments 12 pages, 3 figures. LaTeX source added to enable accessible HTML; minor wording and typesetting revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18985 2026-07-28 cs.AI 版本更新 57%

Athena-Brain Technical Report: An Efficient Robot Brain for General Intelligence and Embodied Interaction

雅典娜大脑技术报告:用于通用智能和具身交互的高效机器人大脑

Jialian Li, Junhong Liu, Yuchen Cao, Weiran Guo, Jiaming Song, Xutao Wang, Yi Zhao, Jiangpin Liu, Jie Chen

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对具身智能体对设备端紧凑模型需求,提出雅典娜大脑8B模型,经多阶段训练流程,使其兼具通用与具身交互能力,实验证明该模型在通用和具身评估中有效,能在保持性能同时生成更简洁回复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24941 2026-07-28 cs.SD cs.AI 版本更新 57%

EmotionAI: A Privacy-Preserving Computational Intelligence Pipeline for Speech-Emotion-Grounded Conversational Analysis

EmotionAI:一种面向语音情感驱动的对话分析的隐私保护计算智能流水线

Wai Laam Mak, Isibor Kennedy Ihianle, Pedro Machado

机构 * School of Science and Technology, Nottingham Trent University(诺丁汉特伦特大学科学与技术学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 提出一种完全本地的计算智能流水线,结合语音情感识别与生成式推理,实现隐私保护的对话情感分析,在RAVDESS数据集上达到48.8%准确率,零外部调用。

Comments 12 pages, 4 figures. Submitted to UK Workshop on Computational Intelligence (UKCI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23356 2026-07-28 cs.CL cs.HC 版本更新 57%

VeriLLMed: Interactive Visual Debugging of Medical Large Language Models with Knowledge Graphs

VeriLLMed: 基于知识图谱的医疗大语言模型交互式可视化调试

Yurui Xiang, Xingyi Mao, Rui Sheng, Zixin Chen, Zelin Zang, Yuyang Wu, Haipeng Zeng, Huamin Qu, Yushi Sun, Yanna Lin

机构 * IEEE

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文提出VeriLLMed系统,通过整合外部生物医学知识,帮助开发者审计和调试医疗大语言模型的诊断推理过程,识别三种常见诊断错误类型,提升模型可靠性。

Comments Accepted by VIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21003 2026-07-28 cs.AI 版本更新 57%

Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models

贝叶斯-LoRA:大型语言模型的概率低秩适应

Moule Lin, Shuhao Guan, Andrea Patane, David Gregg, Goetz Botterweck

机构 * School of Computer Science and Statistics, Trinity College Dublin, Dublin, Ireland(特里尼蒂学院都柏林分校计算机科学与统计学学院) School of Computer Science, University College Dublin, Dublin, Ireland(都柏林大学学院计算机科学学院)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出贝叶斯-LoRA,通过概率低秩表示改进LoRA,提升模型校准性,在多个常识推理基准中实现84%的ECE和76%的NLL减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21947 2026-07-28 cs.CL 版本更新 57%

Algorithmic Blindness in Large Language Models: A Calibration Study of Performance Prediction

大语言模型是算法上盲目

Sohan Venkatesh, Ashish Mahendran Kurapath, Tejas Melkote

机构 * School of Computer Engineering, Manipal Institute of Technology, Bengaluru, India(马尼帕尔理工学院计算机工程学院,班加罗尔,印度)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究发现大语言模型在算法推理上存在系统性失败,主要贡献是揭示了算法盲目的本质,即声明性知识与校准过程预测之间的差距。

Comments Code available at https://github.com/sohv/algorithmic-blindness

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09001 2026-07-28 cs.CL 版本更新 57%

Entropy Sentinel: Probing Entropy Traces for LLM Monitoring

熵哨兵:基于STEM解码熵迹的连续LLM准确性监控

Pedro Memoli Buffa, Luciano Del Corro

机构 * Departamento de Matematica, FCEyN Universidad de Buenos Aires(数学系,布宜诺斯艾利斯大学) ELIAS Lab, Departamento de Ingeniería Universidad de San Andres(ELIAS实验室,圣安德烈斯大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 提出利用输出熵迹作为推理时信号,通过轻量分类器预测实例正确性并聚合为领域级准确性估计,在STEM推理基准上验证了其用于监控和数据采集的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02594 2026-07-28 q-bio.QM cs.AI cs.ET cs.IR 版本更新 57%

OpenAIs HealthBench in Action: Evaluating an LLM-Based Medical Assistant on Realistic Clinical Queries

OpenAIs HealthBench in Action: 评估基于LLM的医疗助手在真实临床查询中的表现

Sandhanakrishnan Ravichandran, Shivesh Kumar, Rogerio Corga Da Silva, Miguel Romano, Reinhard Berkels, Michiel van der Heijden, Olivier Fail, Valentine Emmanuel Gnanapragasam

机构 * OpenAI

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 DR.INFO在HealthBench基准测试中表现优异,优于多个前沿LLM,在复杂临床查询中展现出高准确性和情境感知能力。

Comments 13 pages, two graphs

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12650 2026-07-28 cs.CV cs.AI 版本更新 57%

AutoMat: Enabling Automated Crystal Structure Reconstruction from Microscopy via Agentic Tool Use

AutoMat:通过智能工具使用实现从显微镜图像自动重建晶体结构

Yaotian Yang, Yiwen Tang, Yizhe Chen, Xiao Chen, Jiangjie Qiu, Hao Xiong, Haoyu Yin, Zhiyao Luo, Yifei Zhang, Sijia Tao, Wentao Li, Qinghua Zhang, Yuqiang Li, Wanli Ouyang, Bin Zhao, Xiaonan Wang, Fei Wei

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究旨在从有噪声的STEM投影重建晶体结构,提出AutoMat智能控制器,通过闭环验证和多模块组合实现。引入基准数据集评估,结果显示其性能优于现有方法,建立了从微观到原子尺度建模的途径。

Comments The code and dataset are publicly available at https://github.com/yyt-2378/AutoMat and https://huggingface.co/datasets/yaotianvector/STEM2Mat

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15781 2026-07-27 cs.AI cs.ET cs.MA 版本更新 57%

AgentFAIR: A Multi-Agent Collaborative Framework for FAIRness Evaluation of Geospatial Datasets

AgentFAIR:用于地理空间数据集公平性评估的多智能体协作框架

Ming Chen, Pranav Pai

机构 * The University of Melbourne(墨尔本大学)

专题命中 推理评测 :planning(abstract);分类 cs.AI

AI总结 研究地理空间数据集公平性评估难题,提出AgentFAIR多智能体框架,结合结构化元数据提取与特定子原则语言模型评估器,给出各项评估结果,支持可审计性与可行性,不过受限于多种因素对准确性和泛化性声明有约束。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10428 2026-07-27 cs.CL 版本更新 57%

Enjoy Your Talk: A Human-Centered Benchmark for Multi-Turn Dialogue with Decoupled User Simulation, Target Modeling, and Judging

享受你的对话:一个用于多轮对话的以人为本基准,具有解耦的用户模拟、目标建模和评判

Jinglan Gong, Jiefan Lu, Hewei Guo, Kehan Li, Zhiyuan Han, Jihang Jiang, Wenwen Tong, Lewei Lu

机构 * SenseTime Research(商汤科技研究院) University of Science and Technology of China(中国科学技术大学) Tsinghua University(清华大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 该研究提出EYT-Bench基准,通过三方解耦设计评估大语言模型多轮对话能力,引入新指标,发现先进模型在主观维度相近但客观意图跟踪差异大,推理可提升客观跟踪,角色格式影响轨迹分布,且热身效应稳健。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18119 2026-07-27 cs.AI 版本更新 57%

Beyond Text-to-SQL: Can LLMs Really Debug Enterprise ETL SQL?

超越文本到SQL:LLMs真的能调试企业级ETL SQL吗?

Jing Ye, Yiwen Duan, Yonghong Yu, Victor Ma, Yang Gao, Xing Chen

机构 * ByteDance Inc.(字节跳动公司)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文提出OurBench基准测试,用于评估LLMs在企业级SQL推理和调试中的性能,发现现有模型在复杂SQL错误检测上表现有限,需进一步改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20121 2026-07-24 cs.CL 版本更新 57%

OpenSkillRisk: Benchmarking Agent Safety When Using Real-World Risky Third-Party Skills

开放技能风险:使用现实世界中的危险第三方技能时对智能体安全性进行基准测试

Qiyuan Liu, Tingfeng Hui, Kun Zhan, Kaike Zhang, Ning Miao

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 研究基于语言模型的智能体使用第三方危险技能时的安全问题,构建OpenSkillRisk基准测试,涵盖多种不安全场景并能细粒度分析。实验发现当前系统处理危险技能能力不足,揭示三种失败模式,强调需改进语言模型风险推理和智能体框架执行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03447 2026-07-23 cs.SE cs.AI 版本更新 57%

Measuring LLM Trust Allocation Across Conflicting Software Artifacts

在冲突软件构件中衡量LLM的信任分配

Noshin Ulfat, Ahsanul Ameen Sabit, Soneya Binta Hossain

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) IQVIA Inc.(IQVIA公司)

专题命中 推理评测 :reasoning(abstract_cn);分类 cs.AI

AI总结 研究探讨LLM在处理冲突软件构件时的信任分配问题,提出TRACE框架评估不同构件的质量、不一致性和信任校准,发现模型在检测文档错误时表现优于实现错误,但对实现漂移而文档无误的情况检测率下降,且信任校准不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05462 2026-07-22 cs.CR cs.AI 版本更新 57%

BioSecBench-Refusal: A paired metric for performance and alignment in agentic biosecurity risk assessment

评估两用生物学环境中的校准拒绝和安全有用性

Edwin H. Wintermute, Harmon Bhasin, Christina M. Agapakis, Dianzhuo Wang, Evan Seeyave, Arjun Banerjee, Daniel Fulop, Matthew C. Watson, Adam J. Meyer, Sandrine Boissel, Jens H. Kuhn, Rishi Jain, Noah D. Taylor, Helena Shomar, Patrick M. Boyle, Kenny Workman

机构 * American Wetware(美国湿科公司) LatchBio

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对人工智能用于生命科学工作流可能导致滥用的问题,提出BioSecBench-Refusal基准,将常规与红队任务配对,测试16种配置下模型拒绝率,发现多数配置对常规工作拒绝率高,有推理空间的模型能识别更多威胁,为开发者提供校准工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16107 2026-07-22 cs.CV cs.AI 版本更新 57%

T2T-VICL: Cross-Task Visual In-Context Learning via Implicit Text-Driven VLMs

T2T-VICL:通过隐式文本驱动的视觉语言模型进行跨任务视觉上下文学习

Shao-Jun Xia, Huixin Zhang, Zhengzhong Tu

机构 * Duke University(杜克大学) Texas A&M University(德克萨斯农工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究跨任务视觉上下文学习问题,提出T2T-VICL协作式提示转移框架,通过大教师VLM生成结构化描述构建数据集,提炼能力到轻量级学生VLM,实验表明该框架能改进任务感知对齐,揭示跨任务VICL的潜力与局限。

Comments 22 pages, 6 figures, under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26548 2026-07-21 cs.CR cs.LG 版本更新 57%

SEC-bench Pro: Can Language Models Solve Long-Horizon Software Security Tasks?

SEC-bench Pro:语言模型能解决长周期软件安全任务吗?

Hwiwon Lee, Jiawei Liu, Dongjun Kim, Wubing Xia, Ziqi Zhang, Chunqiu Steven Xia, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 提出SEC-bench Pro基准,通过三阶段流程构建包含V8和SpiderMonkey共183个已验证漏洞的测试集,评估前沿语言模型在长周期漏洞狩猎任务中的表现,发现最高成功率仅48.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26648 2026-07-21 cs.SE cs.AI 版本更新 57%

Vision2Web: A Hierarchical Benchmark for Visual Website Development with Agent Verification

Vision2Web: 一个用于视觉网站开发的分层基准,包含代理验证

Zehai He, Wenyi Hong, Zhen Yang, Ziyang Pan, Mingdao Liu, Xiaotao Gu, Jie Tang

机构 * Tsinghua University(清华大学)

专题命中 推理评测 :verifier(abstract);分类 cs.AI

AI总结 本文提出Vision2Web基准,用于评估视觉网站开发能力,包含193个任务和16类,通过GUI代理验证器和基于VLM的裁判器评估多个视觉语言模型,揭示了在全栈开发中现有模型的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20804 2026-07-21 cs.AI 版本更新 57%

MMGraphRAG: Bridging Vision and Language with Interpretable Multimodal Knowledge Graphs

MMGraphRAG: 通过可解释的多模态知识图谱弥合视觉与语言的鸿沟

Xueyao Wan, Hang Yu

机构 * Harbin Institute of Technology(哈尔滨工业大学) Nanyang Technological University(南洋理工大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 MMGraphRAG通过引入可解释的多模态知识图谱,解决多模态场景下的实体链接和跨模态推理问题,实现最先进的多模态信息处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14335 2026-07-21 cs.CR cs.AI cs.SE 版本更新 57%

Is "Knowing It's Malicious Enough?" Evaluating LLMs for Fine-Grained Malware Behavior Auditing

“知道它足够恶意吗?”评估用于细粒度恶意软件行为审计的大语言模型

Xinran Zheng, Xingzhi Qian, Yiling He, Shuo Yang, Lorenzo Cavallaro

机构 * University College London(伦敦大学学院) The University of Hong Kong(香港大学)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对大语言模型用于恶意软件审计可靠性不明问题,引入MalEval诊断框架,通过配对代码库与审计报告提供基本事实,经中间表示压缩代码库,映射输出到证据链,分解审计为四阶段任务,评估发现大语言模型在审计中有诸多问题,为后续可靠工作流程研究提供参考。

Comments Paper has beed accepted by ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15079 2026-07-20 cs.AI 版本更新 57%

BrainPilot: Automating Brain Discovery with Agentic Research

BrainPilot:通过智能研究实现大脑发现自动化

Haoxuan Li, Tianci Gao, Jianhe Li, Yang Fan, Runze Shi, Weiran Wang, Tianxiang Zhao, Zezhao Wu, Xiaoyang Jiang, Qihui Zhang, Jia Li, Xiao Xiao, Kai Du, Xiaoxuan Jia, Chao Xie, Lu Mi

机构 * College of AI, Tsinghua University(清华大学人工智能学院) Shanghai Qizhi Institute(上海期智研究院) Business School, Renmin University of China(中国人民大学商学院) School of Physics, Beihang University(北京航空航天大学物理学院) School of Information and Software Engineering, University of Electronic Science and Technology of China(电子科技大学信息与软件工程学院) Behavioral and Cognitive Neuroscience Center, Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University(复旦大学脑科学与智能技术研究院行为与认知神经科学中心) College of Engineering, Georgia Institute of Technology(佐治亚理工学院工程学院) School of Life Sciences & IDG/McGovern Institute for Brain Research, Tsinghua University(清华大学生命科学学院&清华-IDG/麦戈文脑科学研究院) School of Computing and Artificial Intelligence, Southwest Jiaotong University(西南交通大学计算机与人工智能学院) Weixian College, Tsinghua University(清华大学未央学院) Department of Psychological and Cognitive Sciences, Tsinghua University(清华大学心理学与认知科学系)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 研究针对脑科学研究整合证据难、人工智能代理有缺陷的问题,提出完全开源的多智能体系统BrainPilot,它有可追溯日志和验证结果,含知识库与技能库,经实验评估,其开源模型以低成本达先进框架性能。

详情

展开后加载摘要…

URL PDF HTML 收藏