Echo-POSED:用于超声心动图引导的几何自蒸馏方法
提出自监督框架Echo-POSED,无需标注即可从2D超声图像实时推荐探头调整,保持几何一致性,平均角度误差8.2度。
基于解剖正则化张量辐射场的数字重建放射影像稀疏视角肺结节体积测量
提出AReT,解决TensoRF密度偏移,用三正交投影重建肺结节,体积误差11.4%,相关性0.983。
面向检索增强大语言模型的推理成本攻击
RA-ICA攻击通过污染知识库注入恶意文档,使RAG推理成本暴增13倍,成功率超90%。
CARVE: 基于包络的交互驾驶否决机动可认证经济修复
CARVE通过合作包络认证否决机动的可修复性,无需预测,接受率98.64%且无优先级违规。
AI代理网络安全拒绝行为的新框架
提出首个AI代理拒绝有害请求框架,定义原则与评估方法,测试显示多数前沿模型拒绝率极低。
目标更新可能稳定线性Q学习:周期与软动态
严格分析表明,周期和软目标更新在特定条件下保证线性Q学习收敛到投影Q-Bellman解。
多智能体LLM系统中的林格尔曼效应:有效团队规模的缩放律
多智能体LLM缩放律显示密集辩论不增多样性,收益来自重新评估,仅架构多样性突破硬上限。
EntangleCodec:基于语义-声学纠缠的统一离散音频分词器
EntangleCodec统一离散音频分词器,通过语义-声学对齐实现理解与生成,重建质量高,理解任务提升7.4%,小参数模型超越大型模型。
大型字节模型:教导语言模型理解编译代码
首个字节原生LLM,利用定制分词器,回答恶意软件二进制问题,分类准确率69%-98%。
CRAM-ER:用于可扩展内存计算的高容错自旋电子计算随机存取存储器
提出CRAM-ER架构,结合自旋电子与CMOS加法树,实现高能效矩阵乘法,通过误差感知微调与纠错,在DNN上近乎无损精度且延迟降低两个数量级。
面向稀疏脉冲语言模型的脉冲感知C++ INT8推理(商用CPU)
商用CPU上脉冲感知C++ INT8推理达22.63 tok/s,4线程47.90 tok/s,但质量略降(困惑度24.80)。
哪种防御针对哪种威胁?归因OWASP-LLM十大覆盖及其在改写下的脆弱性
通过归因实验,发现拒绝防御可被改写绕过,预算控制更稳健,全栈防御必要。
Echelon:跨隐私边界的可审计纯聚合语言模型适应
Echelon强制设备级模型不导出,仅传输聚合delta,实现稳定跨边界训练,性能优于基线。
LLM辅助重排序以实现推荐系统中的细微目标
LLM重排序不加约束会加剧极端内容,轻量正则化可提升多样性但略有相关性损失。
Patcher:事后修复后门大语言模型
仅用单个失败案例定位修复后门触发器,保持模型性能与鲁棒性。
在轨玻璃盒:可信自主立方星智能的宪法性AI验证框架
提出Glass Box运行时验证框架,用宪法规则和LTL不变量拦截立方星AI错误决策,开销线性,确保安全可解释。
可重现性是新的Copyleft:定义面向通用人工智能的可重现构建
AGI破坏Copyleft依赖的可重现前提,本文定义七项可重现构建要求,主张协议而非平台框架。
AnyAudio-Judge:基于动态准则的音频指令遵循基准与评估器
提出动态准则评估范式,构建双语基准与评估器,显著提升音频指令对齐检测与可解释性。
能力广告作为柠檬市场:异构智能体网络的信任层
当前智能体能力宣称不可靠引发柠檬市场问题,提出信任层(概率描述、筛选、声誉)以实现高信任均衡。
Brief Announcement: Generative Markov Model for Distributed Computing Systems
"请给我满分!"——探索针对LLM自动评分系统的提示注入攻击
研究表明,基于大语言模型的自动评分系统极易受提示注入攻击,威胁教育评估的公平性与可靠性。
BAHSD:在黑盒序列推荐中通过自适应蒸馏弥合长尾差距
提出自适应蒸馏框架,多尺度探测处理长尾信号异质性,动态温度KL散度与对比学习提升尾用户性能80%+。
论概率概念的演变作为理性演变的镜像
概率演变映射理性进化,贝叶斯推理整合先验与数据,但需结合模糊逻辑与深度学习应对模糊性与预测。
多模型AI系统中的涌现协作审议:一种基于BFT的认知综合协议
Consilium协议将模型分歧转为认知信号,低成本模型媲美前沿,揭示RLHF盲点,实现无偏知识综合。
通用量子Transformer
提出量子原生架构UQT,用少数量子比特实现精确数学推理,超越经典网络随机不稳定,实现确定性泛化,具有计算优势。
立场论文:决策引擎的求解后鲁棒性:可行域与扰动下的平滑性
指出MILP决策引擎求解后鲁棒性空白,定义ε-近优可行邻域与解平滑性,呼吁统一鲁棒性评估层。
MindGames竞技场泛化赛道:基于延迟每步奖励归因的In2AI解决方案
提出延迟每步奖励归因与资格门控,8B模型在NeurIPS 2025多智能体基准中双赛道夺冠,超越GPT-5。
树上的智能体:面向多目标分子优化的路径协调
提出ATOM多智能体框架,以树结构搜索协调路径,实现多目标分子优化,提升Pareto覆盖和超体积。
Evaluating Interactive Reasoning in Large Language Models: A Hierarchical Benchmark with Executable Games
CAST:用于GRPO的非特权裁剪非对称自教学与优势翻转
提出无参考答案自蒸馏法,通过优势翻转和边界约束改进GRPO令牌监督,提升数学推理性能。
用于去噪高维结构化表示的测地流匹配
测地流匹配去噪SSP,限定流形,SLAM误差减72%,效率提40%。
MindZero:零标注的在线心理推理学习
提出自监督强化学习框架,训练多模态大模型在线心理推理,无需标注,提升准确率和效率。
视觉-语言-动作模型中的闭环神经激活控制
提出CTRL-STEER闭环框架,用自适应时变控制替代固定干预,实现更稳定的概念调节与任务成功权衡。
能力自我评估:教会大语言模型认知自身局限
大语言模型普遍高估自身能力,强化学习可有效教会其自我评估,优于监督微调且能泛化到分布外场景。
鲁棒屏蔽:安全强化学习
针对鲁棒MDP提出屏蔽框架,保障LTL安全且最优,结合PAC采样确保未知MDP安全。
言行不一而非推理不符:定位LLM代理中的忠实度差距
研究LLM代理推理与行动差距,在德州扑克中分解两步,发现行为相反。
从“弱”信号到强模型:基于LoRA合并的偏好增量聚合
提出偏好增量聚合框架,通过LoRA合并聚合多个弱信号,几何对齐合并增强组合,显著提升强模型推理和搜索性能。
Coupling Language Models with Physics-based Simulation for Synthesis of Inorganic Materials
VESTA:统计工具代理的视觉探索
VESTA框架通过动态生成探索工具辅助统计模型优化,在复杂任务上优于基线,工具复杂度超越现有系统。
弱评判造就强学习者:面向可扩展监督的在策略批评蒸馏
弱批评帮助强模型利用自身知识,提出渐进式在策略批评蒸馏,有效提升强模型性能。
EnergyMamba: 不确定性感知的图增强选择性状态空间模型用于能耗预测
提出EnergyMamba框架,结合图增强状态空间与自适应分位数回归,预测准确度提升5%,不确定性量化提升6%。
TAPS: 面向扩散草稿推测解码的目标感知前缀树选择
TAPS通过目标感知前缀选择,在固定预算下选取紧凑前缀闭子树,实现最高7.9倍无损加速。
基于阈值的LLM推理独占批处理
混合批处理存在预填-解码干扰,独占批处理在低带宽GPU上吞吐量提升41.9%,混合调度器EB+动态切换性能最优。
与AI共行:基于交互的代理侵权责任框架
提出基于交互的代理侵权责任框架,区分三种交互类型,以交互日志为证据界定责任归属。
PropLLM:面向网络故障诊断的传播感知场景重建
PropLLM融合逐跳场景重建与LLM推理,通过双知识图谱和因果注意力机制提升故障诊断准确率,降低幻觉率。
CoMIC:云边系统中长时程LLM代理的协作记忆与洞察循环
CoMIC通过云端反思与边缘执行,利用子目标记忆和跨代理指导,无需参数更新即可提升弱边缘代理的长时任务表现。
AXIOM:一种信任优先的神经符号执行架构,用于可验证数学推理
AXIOM架构以信任优先实现可验证数学推理,零错误答案,支持可扩展部署。
基于边缘感知交互风险建模的阿尔茨海默病患者药物感知金融剥削检测
提出药物感知框架,整合用药与交易监控,交互模型在脆弱期召回率提升至0.907。
潜在奖励引导:一种自适应推理时框架,隐式促进推理大语言模型的认知行为
通过优化潜在状态和奖励梯度,自适应纠正推理错误,持续提升模型性能。
ForeSci:评估LLM智能体进行前瞻性AI研究判断
ForeSci基准评估LLM智能体基于历史证据做前瞻研究判断,发现证据引用与决策存在解耦。