基于FPGA的神经网络加速器在空间应用中的综述
综述FPGA神经网络加速器提升星载计算潜力,分析文献、趋势与空白,提出未来方向。
The Accountability Paradox: How Platform API Restrictions Undermine AI Transparency Mandates
以部署为中心的评估:临床LLM系统中查询级拒绝风险预测
通过部署上下文而非仅查询内容,预测临床LLM用户拒绝风险,AUROC达0.719,证实可行性。
PersonaDrive:面向闭环驾驶模拟的人类风格检索增强VLA智能体
通过检索风格化人类驾驶数据,使VLA智能体实现多风格闭环模拟,零训练切换,弱风格超越强基线5.4%。
Arbor:树搜索作为自主智能体的认知层
Arbor多智能体框架以树搜索为认知层,协调优化LLM推理,实现吞吐量-延迟最高193%改进,硬件无关可复现。
TrajGenAgent:用于人类移动轨迹生成的分层LLM智能体
提出无需微调的语义感知分层LLM智能体,两阶段协同生成逼真轨迹,提升时空保真度与个体行为真实性。
“你撒谎了吗?”评估不同模型规模与信念验证模型生物上的谎言检测器
现有谎言检测器难验证模型真实信念,新构建13个推理模型及欺骗测试集,发现仅链式思维判断器表现稍好但仍有局限。
从通用人工智能到超级人工智能
报告探讨从人类级AGI到超级智能的路径、瓶颈及加速变革前景,强调需全球跨学科应对。
MLUBench:多模态大语言模型终身遗忘评估基准
MLUBench为多模态大模型终身遗忘提供大规模基准,揭示累积退化及多模态对齐挑战,提出LUMoE方法缓解退化。
中文标题
提出DAF-AGI框架,用五个标准裁决AGI定义争议,强调定义主权先于能力对齐,以公共问责制审查治理。
降低可穿戴设备上脑电分析深度学习模型的复杂度
通过参数量化与电极缩减,可显著降低可穿戴设备脑电分析DNN的复杂度,精度损失极小。
Constructing Evaluation Datasets for Procedural Reasoning: Balancing Naturalness, Grounding, and Multi-Hop Coverage
大型语言模型中的预填充感知
前沿模型能识别助手侧被篡改的预填充内容,影响安全评估的有效性,检测与抵抗依赖不同线索。
世界模型与物理AI教程
世界建模是智能系统核心,分显式与隐式模型,为物理AI奠定基础,但面临分层推理等挑战。
防护缺口:已部署的自主性AI框架如何未能满足面向公众的安全要求
三大自主AI框架缺乏结构性安全防护,内存中毒致88.9%误拒,轻量防护机制以<0.2ms开销消除威胁。
教与复:从移动屏幕演示中精确提取操作知识以赋能GUI代理
Teach VLM从屏幕演示提取操作知识,作为可复用参考,显著提升GUI代理任务成功率。
Topical Phase Transitions in Artificial Intelligence Research: Large-Scale Evidence and an Early-Warning Signature for Emerging Topics
GeoNatureAgent基准:面向环境地理空间分析的LLM代理评测(涵盖前沿与开放权重模型)
首个环境分析代理基准,93项任务评估7个LLM,Claude最佳,开放模型性价比高,比较任务全失败。
WISE:基于因果推理的Minecraft长周期智能体
提出因果事件图增强记忆,实现鲁棒回忆与机会性任务重排序,显著提升长周期稀疏任务成功率。
LoRA优化中缩放因子的隐藏力量
揭示LoRA中缩放因子α主导优化,优于学习率;最优α与秩呈平方根律,提出LoRA-α框架提升性能。
MDForge:基于稀疏模拟反馈的智能分子动力学管道设计
MDForge利用LLM agent和多智能体辩论自动设计MD管道,媲美专家,并发现新型高亲和力结合剂。
迭代至更优搜索:用于评估电商中智能体搜索架构的双智能体模拟框架
双智能体框架评估电商搜索,滚动窗口记忆更优,系统分析降62%失败率,LLM更换降低性能,评判者存分歧。
PRISMR:通过参数化表征内化克服多模态列表排序中的解析崩溃
PRISMR框架通过超网络生成LoRA权重,将列表结构参数化内化,有效消除解析崩溃,提升多模态排序性能。
多模态智能体用于配电缺陷检测:基础模型评估
提出多模态智能体框架,评估基础模型在配电缺陷检测中的感知、推理及工具使用能力,构建数据集与基准,揭示其优劣。
OpenMedQ:面向医学视觉语言模型的广泛开放预训练
OpenMedQ在开放医学混合数据上预训练,病理VQA达SOTA,视觉编码器分类最优,代码已开源。
面向协作解题与AI推理数据集生成的数学论坛平台
将图像转LaTeX嵌入论坛,实现数学协作解题,并自动生成社区验证的AI推理数据集。
面向LLM驱动HDL设计与验证数据整理的自动化测试平台生成框架
STG框架实现确定性测试生成,比LLM方法快720倍,覆盖高、误判少;数据整理效率提升11倍,能耗降低127倍。
Nous:尝试提取并注入预测市场行为背后的认知
提取有效(参数稳定、可识别),但提示层注入未传递认知,未改善预测性能,揭示提示层补救局限。
可见光与热红外视频监控的数据增强技术
研究多光谱CNN目标检测,探索利用可见光数据增强训练热红外模型,分析不同增强技术的鲁棒性。
重新思考长视频中的RAG:检索什么与如何使用?
提出V-RAGBench基准和CARVE方法,通过多配置并行检索与自适应重排序,解决视频RAG评估与检索缺陷,性能超越八个基线。
TerraBench:智能体能否推理异质地球系统数据?
TerraBench评估智能体推理异质地球数据的能力,要求协调工作流与精确参数化工具。
Mental-R1:对齐大语言模型推理用于心理健康评估
提出CRPO框架,通过强化学习对齐认知过程,提升大语言模型心理健康评估推理能力,平均F1提升10.4%。
多属性选择中有限权衡筛选的极简模型
提出有限权衡筛选模型,通过权衡容忍参数控制,产生情境依赖的偏好模式,为多属性选择提供计算机制。
机器何时能真正具有创造力?
提出机器真正创造力的十条要求,强调基于感知、冲突、能力三大法则,并认为主动AI伦理是内在条件。
Brick:面向混合模型范式的空间能力路由
Brick通过六维能力评分与查询难度估计,实现成本-质量平衡:最高准确率76.98%,成本最低降22.15倍,延迟从51.2秒降至22.8秒。
多字段混合检索增强生成用于海事事故根因分析
提出多字段混合RAG框架,从1.3万份海事报告检索案例生成根因分析,检索性能提升300%,生成评分提高。
EPIG:基于情感的个性化图像生成提示方法
EPIG方法在提示层面增强情感表达,无需训练,降低唤醒误差14%-12%,适用于个性化图像生成。
MOSAIC: 帕金森病步态评估中增量持续学习的模态特定适应
MOSAIC框架通过模态特定预热、解耦统计和可塑性恢复,提升帕金森病步态评估中模态增量学习的性能并缓解遗忘。
IterCAD:一种用于视觉引导的CAD生成与编辑的迭代式多模态智能体
提出IterCAD多模态智能体框架,实现闭环交互式CAD生成与编辑,通过数据合成和强化学习优化,显著提升代码可执行性和几何精度。
元数据驱动分类中的评估主权:面向弱监督信息系统的多轨道框架
提出评估主权概念,揭示弱监督下性能指标可能反映标注过程对齐而非真实能力,并提供审计方法。
ERTS:在受限后果空间中通过语义扰动测试伦理AI的对抗鲁棒性
提出ERTS框架,在22维伦理后果空间中用语义扰动测试AI伦理鲁棒性,仅33%模型通过评估。
ReSum:通过强化学习协同LLM推理与总结
提出ReSum框架,使LLM通过自总结压缩推理轨迹,性能平均提升4%,长度减少18.6%。
A Quantitative Experimental Repeated Measures Study of Training Dynamics in a Small Llama Style Language Model Under a Compute-Aware Token Budget
MiniMax稀疏注意力
基于GQA的分块稀疏注意力,通过轻量Top-k块选择,实现长上下文高效计算,减少28.4倍注意力计算并显著加速。
面向受监管流程自动化的神经符号智能体:挑战与研究议程
提出合规性构造范式,将符号结构嵌入智能体架构,以预防控制流违规,并识别神经符号研究挑战。
为什么采样不是选择:大型语言模型中的意向性、能动性与道德责任
LLM输出源于概率映射,缺乏真正意向性与自主选择,不能作为道德主体承担责任。
推理即模式匹配:人类与大型语言模型日常推理中的共享机制
人类与LLM日常推理均依赖模式匹配而非抽象模型,注意力头可预测无关细节引发的推理错误。
面向长文档RAG的不确定性感知混合检索
提出UMG-RAG,用多粒度分块和不确定性估计融合证据,提升检索质量,轻量有效。
是你还是你的环境?一种基于基因组锚定的个性化生理解读的贝叶斯推理框架
基因组锚定贝叶斯先验,区分个体固有与环境影响,解决个性化生理AI冷启动。
多智能体编排的奖励建模
提出OrchRM框架,利用多智能体执行中间产物训练奖励模型,提升训练效率10倍、精度8%,跨领域有效。