arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

2026-03-31 至 2026-03-31 共收录 158 信号源:cs.CL, cs.AI, cs.LG

1. 推理评测 42 篇

2603.26994 2026-03-31 cs.LG q-bio.QM 57%

ImmSET: Sequence-Based Predictor of TCR-pMHC Specificity at Scale

ImmSET:基于序列的TCR-pMHC特异性预测方法

Marco Garcia Noceda, Matthew T Noakes, Andrew FigPope, Daniel E Mattox, Bryan Howie, Harlan Robins

机构 * Adaptive Biotechnologies

专题命中 推理评测 :reasoning(abstract);分类 cs.LG

AI总结 本文提出ImmSET模型,通过多序列交互建模提升TCR-pMHC特异性预测精度,展示了其在不同数据规模下的鲁棒性和性能优势。

Comments Accepted to ML4H 2025 (Proceedings Track). To appear in PMLR 297

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15392 2026-03-31 cs.CL 57%

Understanding the Anchoring Effect of LLM with Synthetic Data: Existence, Mechanism, and Potential Mitigations

理解大语言模型中锚定效应的锚定作用:存在性、机制与潜在缓解方法

Yiming Huang, Biquan Bie, Zuqiu Na, Weilin Ruan, Songxin Lei, Yutao Yue, Xinlei He

机构 * The Hong Kong University of Science and Technology, Guangzhou(香港科技大学(广州)) Independent Researcher(独立研究员)

专题命中 推理评测 :reasoning(abstract);分类 cs.CL

AI总结 本文研究大语言模型是否受锚定效应影响,揭示其机制并提出缓解策略,通过SynAnchors数据集验证了LLM存在锚定偏误,浅层结构难以消除,而推理能部分缓解。

Comments Accepted by the HCAIR workshop of ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26769 2026-03-31 cs.CV cs.AI 57%

Edge Reliability Gap in Vision-Language Models: Quantifying Failure Modes of Compressed VLMs Under Visual Corruption

视觉-语言模型边缘可靠性差距:压缩VLM在视觉损坏下的失败模式量化

Mehmet Kaan Erol

机构 * Marmara University, Institute of Pure and Applied Sciences(马尔马拉大学纯科学与应用科学研究所)

专题命中 推理评测 :reasoning(abstract);分类 cs.AI

AI总结 本文比较了压缩的视觉-语言模型在视觉损坏下的失败模式,发现紧凑模型在COCO上表现出更高的语义漂移和对象盲区,且置信度校准存在显著差异。

Comments 16 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28766 2026-03-31 cs.CV 50%

HandX: Scaling Bimanual Motion and Interaction Generation

HandX:扩展双臂运动和交互生成

Zimu Zhang, Yucheng Zhang, Xiyan Xu, Ziyin Wang, Sirui Xu, Kai Zhou, Bing Zhou, Chuan Guo, Jian Wang, Yu-Xiong Wang, Liang-Yan Gui

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Specs Inc.(Specs公司) Snap Inc.(Snap公司)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出HandX,通过整合数据、标注和评估,解决双臂运动生成中精细指节动态和协作的不足,验证了大模型在生成高质量双臂运动中的有效性。

Comments CVPR 2026. Project Page: https://handx-project.github.io. Code: https://github.com/handx-project/HandX

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28576 2026-03-31 cs.CE 50%

Tiered Super-Moore's Law: Price Evolution, Production Frontiers, and Market Competition in Large Language Model Inference Services

分层超级摩尔定律:大型语言模型推理服务中的价格演变、生产前沿与市场竞争

Mingdeng Du

专题命中 推理评测 :reasoning(abstract)

AI总结 本文系统分析了大型语言模型推理市场中token定价,发现token价格下降约600倍,并提出分层超级摩尔假说,揭示软件和架构创新驱动价格下降,而非硬件进步。

Comments 23 pages, 12 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28504 2026-03-31 astro-ph.SR astro-ph.IM 50%

JW-VL: A Vision-Language Model for Solar Physics

JW-VL:用于太阳物理的视觉-语言模型

Mingfu Shao, Hui Wang, Liyue Tong, Yuyang Li, Cunshi Wang, Jiaben Lin, Suo Liu, Haiqing Xu, Yin Zhang, Jing Huang

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出JW-VL模型,专为太阳物理设计,整合多波段观测数据,实现从原始观测数据到图像识别、活动分析和OCR的端到端处理,同时构建多波段图像基准数据集。

Comments 16 Pages,8figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28393 2026-03-31 cs.HC 50%

Within the MDT Room: Situated in Multidisciplinary Team-Grounded Agent Debate for Clinical Diagnosis

在MDT房间内:多学科团队基础的智能体辩论用于临床诊断

Peng Kuai, Yukun Yang, Shaolun Ruan, Junchi Xu, Yanjie Zhang, Lin Zhang, Min Zhu, Rui Sheng

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出MDTRoom系统,通过将多智能体讨论转化为结构化可查看的工作空间,帮助医生与智能体协作,提升罕见病诊断效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28309 2026-03-31 cs.CR 50%

VulnScout-C: A Lightweight Transformer for C Code Vulnerability Detection

VulnScout-C:一种轻量级的Transformer用于C代码漏洞检测

Aymen Lassoued, Nacef Mbarek, Bechir Dardouri, Bassem Ouni, Qing Li, Fakhri Karray

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出VulnScout-C,一种轻量级Transformer模型,用于C代码漏洞检测,同时构建了VulnScout数据集,实验表明其在检测性能上优于现有方法,且具有更低的推理成本。

Comments Submitted to IEEE Transactions on Dependable and Secure Computing

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28211 2026-03-31 cs.CV 50%

Explaining CLIP Zero-shot Predictions Through Concepts

通过概念解释CLIP零样本预测

Onat Ozdemir, Anders Christensen, Stephan Alaniz, Zeynep Akata, Emre Akbas

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院) Dept. of Computer Eng., Middle East Technical University (METU)(中东技术大学计算机工程系) Orbital DTU Compute, Technical University of Denmark(丹麦技术大学DTU计算学院) Dept. of Biology, University of Copenhagen(哥本哈根大学生物系) LTCI, Télécom Paris, Institut Polytechnique de Paris(巴黎理工学院巴黎电信学院LTCI实验室) Technical University of Munich (TUM)(慕尼黑工业大学) Helmholtz Munich(亥姆霍兹慕尼黑中心) MCML MDSI Robotics & AI Center (ROMER), METU(中东技术大学机器人与人工智能中心)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出EZPC方法,通过人类可理解的概念解释CLIP的零样本预测,保持分类精度并提供概念层面的解释。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08282 2026-03-31 cs.CV cs.MM cs.SD 50%

PAVAS: Physics-Aware Video-to-Audio Synthesis

PAVAS:物理感知的视频到音频合成

Oh Hyun-Bin, Yuhta Takida, Toshimitsu Uesaka, Tae-Hyun Oh, Yuki Mitsufuji

机构 * POSTECH(浦项科技大学) Sony AI(索尼人工智能) Sony Group Corporation(索尼集团公司) KAIST(韩国科学技术院)

专题命中 推理评测 :reasoning(abstract)

AI总结 PAVAS通过引入物理推理,结合物理参数估计器和物理驱动音频适配器,生成符合物理规律的音频,优于现有视频到音频生成模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27375 2026-03-31 cs.CV 50%

Bridging Visual Representation and Reinforcement Learning from Verifiable Rewards in Large Vision-Language Models

弥合可验证奖励下的视觉表征与强化学习在大视觉-语言模型中的应用

Yuhang Han, Yuyang Wu, Zhengbo Jiao, Yiyu Wang, Xuyang Liu, Shaobo Wang, Hanlin Xu, Xuming Hu, Linfeng Zhang

机构 * EPIC Lab, SJTU(上海交通大学EPIC实验室) Huawei(华为) HKUST (GZ)(香港科技大学(广州))

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出KAWHI机制,通过整合结构化视觉信息提升大视觉-语言模型的多模态推理性能,改进现有统一奖励优化方法。

Comments Homepage: \url{https://kawhiiiileo.github.io/KAWHI_PAGE/}

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12533 2026-03-31 cs.CV 50%

Do You See What I Am Pointing At? Gesture-Based Egocentric Video Question Answering

你看到我指向的是什么?基于手势的 egocentric 视频问答

Yura Choi, Roy Miles, Rolandos Alexandros Potamias, Ismail Elezi, Jiankang Deng, Stefanos Zafeiriou

机构 * Imperial College London(伦敦帝国理工学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出 EgoPointVQA 数据集和基准,结合 Hand Intent Tokens 提升手势引导的 egocentric 问答性能,HINT-14B 在多个任务上超越现有最佳模型。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11410 2026-03-31 cs.CV 50%

Seeing Isn't Orienting: A Cognitively Grounded Benchmark Reveals Systematic Orientation Failures in MLLMs Supplementary

看见并不意味着定向:一个认知基础的基准揭示了多模态大语言模型在定向任务中的系统性失败

Nazia Tasnim, Keanu Nichols, Yuting Yang, Nicholas Ikechukwu, Elva Zou, Deepti Ghadiyaram, Bryan A. Plummer

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出DORI基准,通过分解定向为四个维度,揭示多模态模型在物体定向任务中的系统性不足,指出其依赖分类启发式而非几何推理。

Comments This is a replacement and updated version for submission arXiv:2505.21649 : Right Side Up? Disentangling Orientation Understanding in MLLMs with Fine-grained Multi-axis Perception Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07619 2026-03-31 cs.CV 50%

Overthinking Causes Hallucination: Tracing Confounder Propagation in Vision Language Models

过度思考导致幻觉:追踪视觉语言模型中的混杂因素传播

Abin Shoby, Ta Duc Huy, Tuan Dung Nguyen, Minh Khoi Ho, Qi Chen, Anton van den Hengel, Phi Le Nguyen, Johan W. Verjans, Vu Minh Hieu Phan

机构 * Australian Institute for Machine Learning, University of Adelaide(阿德莱德大学澳大利亚机器学习研究所) Hanoi University of Science and Technology(河内科技大学) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)

专题命中 推理评测 :reasoning(abstract)

AI总结 研究发现视觉语言模型幻觉源于过度思考,通过分析模型推理过程揭示混杂因素传播机制,提出Overthinking Score提升幻觉检测性能。

Comments CVPR2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21356 2026-03-31 cs.CV 50%

ShotBench: Expert-Level Cinematic Understanding in Vision-Language Models

ShotBench:视觉语言模型中的专家级电影叙事理解

Hongbo Liu, Jingwen He, Yi Jin, Dian Zheng, Yuhao Dong, Fan Zhang, Ziqi Huang, Yinan He, Yangguang Li, Weichao Chen, Yu Qiao, Wanli Ouyang, Shengjie Zhao, Ziwei Liu

机构 * Tongji University(同济大学) The Chinese University of Hong Kong(香港中文大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出ShotBench基准测试,用于评估视觉语言模型对电影叙事语言的理解能力,通过专家标注的3500多对问答数据揭示现有模型在细粒度视觉线索和复杂空间推理上的不足,并开发ShotVL模型在该基准上取得新突破。

Journal ref Advances in Neural Information Processing Systems 38 (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26832 2026-03-31 eess.IV cs.CV 50%

External Benchmarking of Lung Ultrasound Models for Pneumothorax-Related Signs: A Manifest-Based Multi-Source Study

肺超声模型对气胸相关征象的外部基准测试:基于表现的多源研究

Takehiro Ishikawa

机构 * College of Computing, Georgia Institute of Technology(佐治亚理工学院计算学院)

专题命中 推理评测 :reasoning(abstract)

AI总结 本文提出基于表现的多源基准,用于评估肺超声模型对气胸相关征象的外部基准,发现二元肺滑动分类无法准确反映气胸推理,需考虑盲区和模糊状态。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他推理 22 篇

2502.18273 2026-03-31 cs.CL 85%

Beyond In-Distribution Success: Scaling Curves of CoT Granularity for Language Model Generalization

超越分布内表现:CoT粒度的缩放曲线对语言模型泛化能力的提升

Ru Wang, Wei Huang, Selena Song, Haoyu Zhang, Qian Niu, Yusuke Iwasawa, Yutaka Matsuo, Jiaxian Guo

专题命中 其他推理 :CoT(title,abstract);reasoning(abstract);chain-of-thought(abstract);分类 cs.CL

AI总结 本文通过实验揭示CoT数据粒度与泛化性能的关联,证明CoT在减少样本需求的同时提升模型在分布偏移任务中的泛化能力。

Comments Accepted at the Conference on Parsimony and Learning (CPAL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11404 2026-03-31 cs.RO 82%

ACoT-VLA: Action Chain-of-Thought for Vision-Language-Action Models

ACoT-VLA:面向视觉-语言-动作模型的行动链式推理

Linqing Zhong, Yi Liu, Yifei Wei, Ziyu Xiong, Maoqing Yao, Si Liu, Guanghui Ren

机构 * Beihang University(北京航空航天大学) AgiBot

专题命中 其他推理 :chain-of-thought(title,abstract);reasoning(abstract)

AI总结 本文提出ACoT-VLA,通过在动作空间中直接进行推理,改进视觉-语言-动作模型的行动生成,引入显式和隐式动作推理器,实验证明其在真实和仿真环境中的优越性。

Comments Accepted by Conference on Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27057 2026-03-31 cs.CL cs.AI 79%

Debiasing Large Language Models toward Social Factors in Online Behavior Analytics through Prompt Knowledge Tuning

通过提示知识微调去偏大型语言模型在在线行为分析中的社会因素

Hossein Salemi, Jitin Krishnan, Hemant Purohit

机构 * George Mason University(乔治梅森大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);CoT(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了在社交情境中通过引入用户目标推断 dispositional 因果性和消息上下文推断 situational 因果性对 LLM 性能的影响,提出了一种通过增强指令提示来减少社会归因偏见的方法,提升零样本分类任务的性能。

Comments This is a preprint of the accepted paper for publication in IEEE Transactions on Computational Social Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13874 2026-03-31 cs.CV 78%

SAGE: Training Smart Any-Horizon Agents for Long Video Reasoning with Reinforcement Learning

SAGE:基于强化学习训练长视频推理的智能任意时间范围智能体

Jitesh Jain, Jialuo Li, Zixian Ma, Jieyu Zhang, Chris Dongjoo Kim, Sangho Lee, Rohun Tripathi, Tanmay Gupta, Christopher Clark, Humphrey Shi

机构 * Allen AI(艾伦人工智能研究所) University of Washington(华盛顿大学)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出SAGE系统,通过多轮推理处理长视频并单轮处理简单问题,结合Gemini-2.5-Flash生成合成数据,提出RL后训练方案,并通过SAGE-Bench验证系统有效性,提升视频推理性能达6.1%。

Comments Project Page: https://praeclarumjj3.github.io/sage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27179 2026-03-31 cs.CV 78%

Reasoning-Driven Anomaly Detection and Localization with Image-Level Supervision

基于推理的异常检测与定位:图像级监督

Yizhou Jin, Yuezhu Feng, Jinjin Zhang, Peng Wang, Qingjie Liu, Yunhong Wang

机构 * State Key Laboratory of Virtual Reality Technology and Systems, Beihang University(北京航空航天大学虚拟现实技术与系统国家重点实验室) Hangzhou Innovation Institute, Beihang University(北京航空航天大学杭州创新研究院)

专题命中 其他推理 :reasoning(title,abstract)

AI总结 本文提出基于图像级监督的异常检测与定位方法,利用大语言模型的推理能力实现像素级定位,无需额外组件或标注。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27522 2026-03-31 cs.CL cs.CR cs.LG 73%

Hidden Ads: Behavior Triggered Semantic Backdoors for Advertisement Injection in Vision Language Models

隐性广告:用于视觉语言模型中广告注入的行为触发语义后门

Duanyi Yao, Changyue Li, Zhicong Huang, Cheng Hong, Songze Li

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.CL、cs.LG

AI总结 本文提出隐性广告攻击,通过用户行为触发在视觉语言模型中注入未经授权的广告,利用自然用户行为实现高效且隐蔽的广告注入,同时评估了不同防御方法的失效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13719 2026-03-31 cs.CV cs.AI cs.LG cs.MM cs.RO 73%

Scaling Spatial Intelligence with Multimodal Foundation Models

通过多模态基础模型提升空间智能

Zhongang Cai, Ruisi Wang, Chenyang Gu, Fanyi Pu, Junxiang Xu, Yubo Wang, Wanqi Yin, Zhitao Yang, Chen Wei, Qingping Sun, Tongxi Zhou, Jiaqi Li, Hui En Pang, Oscar Qian, Yukun Wei, Zhiqian Lin, Xuanke Shi, Kewang Deng, Xiaoyang Han, Zukai Chen, Xiangyu Fan, Hanming Deng, Lewei Lu, Liang Pan, Bo Li, Ziwei Liu, Quan Wang, Dahua Lin, Lei Yang

机构 * SenseTime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract);分类 cs.AI、cs.LG

AI总结 本文通过构建SenseNova-SI家族,利用八百万多样数据样本提升空间智能,在多个基准测试中取得优异成绩,并分析数据扩展的影响及潜在应用。

Comments Codebase: https://github.com/OpenSenseNova/SenseNova-SI ; Models: https://huggingface.co/collections/sensenova/sensenova-si . This report is based on the v1.1 version of SenseNova-SI. Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 67%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 其他推理 :reasoning(abstract);chain-of-thought(abstract)

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16430 2026-03-31 cs.CL cs.AI 62%

EngGPT2: Sovereign, Efficient and Open Intelligence

EngGPT2:主权、高效且开放的智能

G. Ciarfaglia, A. Rosanova, S. Cipolla, J. Bartoli, A. Di Domenico, C. Fioroni, A. Fontana, M. R. Scoleri, M. I. Mone, D. Franchi, M. C. Del Gaudio, A. Leodori, F. Cinti, M. Capozzi, C. Baston, F. Picariello, M. Gabusi, S. Bonura, V. Morreale, I. Bailo

机构 * Engineering Group(工程集团)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 EngGPT2是工程集团最新迭代的意大利大语言模型,通过训练2.5万亿token实现高效性能,其在多个基准测试中表现接近8B-16B密集模型,同时消耗更少的推理和训练资源,支持多语言推理模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27056 2026-03-31 cs.CY cs.AI cs.LG 62%

Persona-Based Simulation of Human Opinion at Population Scale

基于人设的大众意见模拟

Mao Li, Frederick G. Conrad

机构 * University of Michigan(密歇根大学) Institute for Social Research(社会研究所)

专题命中 其他推理 :reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SPIRIT框架,通过分析社交媒体数据构建人设,实现个体化模拟,提升对人口层面意见和干预效果的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14575 2026-03-31 cs.LG cs.CL stat.ML 62%

CausalEvolve: Towards Open-Ended Discovery with Causal Scratchpad

CausalEvolve:迈向开放性发现的因果草稿

Yongqiang Chen, Chenxi Liu, Zhenhao Chen, Tongliang Liu, Bo Han, Kun Zhang

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学) Carnegie Mellon University(卡内基梅隆大学) TMLR Group, Hong Kong Baptist University(香港浸会大学TMLR实验室) SAIC Centre, The University of Sydney(悉尼大学SAIC中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.LG

AI总结 CausalEvolve通过因果草稿机制提升进化效率,在四个开放性科学任务中发现更优解,解决传统进化代理在指导和知识利用上的不足。

Comments Preprint of ongoing work; Yongqiang and Chenxi contributed equally;

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14043 2026-03-31 cs.AI cs.CL cs.MA 62%

AISAC: An Integrated multi-agent System for Transparent, Retrieval-Grounded Scientific Assistance

AISAC:一个集成的多智能体系统,用于透明、基于检索的科学协助

Chandrachur Bhattacharya, Sibendu Som

机构 * Transportation and Power Systems Division, Argonne National Laboratory, USA(美国阿贡国家实验室交通与动力系统部)

专题命中 其他推理 :reasoning(abstract);分类 cs.CL、cs.AI

AI总结 AISAC 提供了一个透明的多智能体运行环境,支持长期的证据支持科学推理,通过结构化保证实现角色语义、预算管理、可追溯执行和工具交互可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28361 2026-03-31 cs.AI cs.MA 57%

Deep Research of Deep Research: From Transformer to Agent, From AI to AI for Science

深度研究的深度研究:从Transformer到代理,从AI到AI为科学

Yipeng Yu

专题命中 其他推理 :reasoning(abstract);分类 cs.AI

AI总结 本文探讨深度研究的定义与发展方向,整合行业深度研究与AI为科学的视角,提出生成式AI的双支柱,并讨论AI4S在各学科的进展及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03904 2026-03-31 cs.LG 57%

LLM as an Algorithmist: Enhancing Anomaly Detectors via Programmatic Synthesis

LLM作为算法家:通过程序合成增强异常检测器

Hangting Ye, Jinmeng Li, He Zhao, Mingchen Zhuge, Dandan Guo, Yi Chang, Hongyuan Zha

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) CUHK-Shenzhen(香港中文大学(深圳)) Department of DSAI, Monash University(莫纳什大学数据科学与人工智能系) KAUST(阿卜杜拉国王科技大学) International Center of Future Science, Jilin University(吉林大学未来科学国际合作中心) Engineering Research Center of Knowledge-Driven Human-Machine Intelligence, MOE, China(教育部知识驱动人机智能工程研究中心)

专题命中 其他推理 :reasoning(abstract);分类 cs.LG

AI总结 本文提出LLM-DAS框架,将LLM从数据处理者转变为算法家,通过程序合成生成对抗性异常,提升检测器鲁棒性。

Comments Accepted by the Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏