基于关系锚定的自动驾驶潜世界模型
以交通场景图为语义监督对齐潜表征,推理时免图、免3D标注,轨迹误差降5.9%,碰撞率降52.4%。
针对哪个 Oracle 认证?执行标签决定 Text-to-SQL 共形弃权所报告的风险
共形弃权风险取决于校准基准;换严套件暴露风险低估,专家标签名义0.1实达17–20点,须双基准并审计
超越统一子空间:面向多任务模型融合的谱感知与深度自适应融合
提出SADA-Merging:按谱复杂度分配子空间容量,依可塑性保留谱信息,深度锚定补偿投影失真,实现免数据多任务融合。
FISSION:面向机器人检测的标签增强
FISSION将账号活动拆为正标签子账号生成标签,训练模型检测,在维基傀儡与X机器人上超越先前方法。
MICRO:面向严重错误发现的多保真主动搜索
提出MICRO多保真主动搜索框架,用低成本评分辅助高成本标注,经聚类与推演最大化严重错误发现。
xWhyL:因果交互学习
提出xWhyL框架,将解释转为因果学习信号,证明可拒绝错误解释,并用CIL支持因果发现。
干扰的来源至关重要:自适应调节中的外部、内部与控制生成噪声
干扰来源与时机决定暴露和调节负担:持续内部干扰影响最大;控制干扰成本升高致非单调响应并抑制纠正。
面向自适应联邦图聚类:一种基于全局社区感知对比学习的方法
提出AdaFGC,用全局社区锚点与对比学习实现自适应联邦图聚类,应对子图异构和簇数未知。
用于增强短期径流预测的多时间步LSTM集成回归器
提出多时间步LSTM集成回归器,经PSO优化预测阿吉柴河日径流,R²达74.95%~91.42%。
Qwen-Audio-3.1-Realtime:迈向可靠的智能体语音交互
融合思考、行动与表达协调,任务成功率提至82.0%,背景语音误响应率降至13%。
与人类对齐的模型是人类模型吗?偏好对齐中的图灵测试差距
偏好对齐未必使模型更像人类;偏好与行为对齐存在图灵测试差距,人类似然随偏好权重增强而下降。
RCShift:认证部分链接何时足以支持有限样本决策
RCShift在观测契约下认证部分链接足以支持有限样本决策,并将存储转化为决策校准的测量设计。
双前沿:智能体何时能信任其世界模型?
提出“双前沿”原则:仅当预测优势超过世界模型误差认证界时才采纳决策,否则转为模型验证,保证回报不降。
真实对话语音增强中多说话人提取的挑战
真实对话静音多、注册语音不匹配影响多说话人提取;新损失缓解静音影响,STOI与fwSNR提升。
面向学业指导的混合AI框架:融合基于集成的成绩预测与规则专家系统
融合分簇堆叠集成成绩预测与规则专家系统,为学业指导提供实时预警与选课建议。
从模式识别器到个性化陪伴者:大语言模型在心理健康领域应用综述
综述大模型在心理健康中的三阶段演进:从评估工具与共情对话,到具记忆推理的个性化陪伴智能体。
通用分形自然语言决策图:跨异构域的实时边缘分诊
提出通用分形自然语言决策图,零权重显存,基于Mandelbrot逃逸动力学实现跨异构域边缘实时分诊,防注入且低延迟。
后训练下块级权重空间结构持续存在:跨LLM家族的实证研究
后训练逐张量改变权重却保留块级几何;独立特化模型偏离,据此LinkerLLM共享块省显存18–48%。
TopoCompress:面向分布式边缘 MoE 推理的拓扑感知令牌压缩算法
提出拓扑感知令牌压缩框架TopoCompress,联合优化压缩、专家部署与路由,降低跨服务器流量与资源开销,保持推理质量。
解耦不是识别:下一词预测中的监督式证据学习
审计下一词预测中的证据学习:解耦不识别集中度,隐式训练无计数信号,显式监督可泛化但校准与效用仍失败。
PrismGPT:基于代理引导学习与自合成推理的区域感知照片编辑
提出PrismGPT框架,用代理引导学习与自合成推理生成区域感知编辑方案,仅约6%训练数据即达最优。
面向伯努利奖励的改进型多人多臂老虎机算法
用KL散度界替代Hoeffding界,为三类信息不对称伯努利多人多臂老虎机提出更优算法,遗憾更紧。
fp8 中的快速矩阵乘法:可认证的系数优化与实测误差
面向fp8优化Strassen型算法的系数泛函,证明全局最优并实测降低大模型NLL。
当更宽视角失效:前馈三维重建的压力测试
固定输入预算、扩大视角跨度会使前馈三维重建模型性能骤降,出现表面覆盖不全与几何失真,暴露分布偏移失效模式。
FuncCode:在函数空间用硬件感知量化压缩柯尔莫哥洛夫–阿诺德网络
FuncCode在函数空间构建共享码本并量化压缩KAN,最高31.6倍、精度损失小,且降低FPGA内存。
面向大语言模型越狱攻击防御的动态深度提示优化
以LLM中间层为特征提取器动态生成防御嵌入并注入后续层,无需改动权重,性能显著优于静态提示优化。
可靠性理论在AI控制中的应用
运用可靠性理论分析AI控制防御,揭示失效域决定罕见故障抑制效率,指引组件优先改进与隔离。
跨预算鲁棒性评估的间隔下降坐标
浅层评估的间隔下降坐标可预测深层鲁棒性崩溃,漂移排序显著优于生存率。
突破短片段限制:用向量档案扩展说话人嵌入
提出VAM-ECAPA,用向量档案映射增强短语音说话人嵌入,1秒EER 8.334%,相对降54.8%。
编程智能体是强大的提示优化器
编码智能体仅凭静态轨迹语料,一次离线分析即可合成优化提示,平均提升16.6个百分点,成本约1.6美元。
迈向森林点云的基础模型
自监督预训练多平台森林点云,标注稀缺时提升四类任务性能与迁移性,实例判别是通用基础模型的主要障碍。
可认证的机制可解释性:将单输入发现提升至有界邻域
提出基于约束多项式zonotope传播的框架,将单输入机制解释发现提升为有界扰动邻域内的认证结论。
Ananke:收缩环面吸引子网络
提出Ananke/CTAN,以乘积环面双相流学表示,0.27M参数在Kvasir-v2达90.52%。
面向医学诊断的移动成像解决方案:趋势与应用
综述移动设备图像医学诊断研究,比较各类方案优劣,指出低成本可及医疗的潜力与挑战。
从风险评分到风险分配:面向多智能体系统多样性监控的密度驱动框架
多智能体监控有“羊群”冗余,提出密度驱动风险分配框架,用QUBO权衡风险与多样性,并可迁移至量子硬件。
INTCORT:通过输入变换与置信度路由实现视觉语言模型免训练空间推理增强
免训练框架经输入变换构建多视图,以关系标记置信度路由聚合预测,空间推理平均提升10.01%。
WatchPoint:面向真实世界智能体 Web 开发的可执行用户反馈
模拟用户执行诊断脚本,为编码智能体提供可执行反馈,任务恢复率 57.6%,接近人类。
易于适配的流式视频编辑
提出SVEET,在预训练双向视频扩散模型上训练,解耦实现实时流式视频编辑,单H100达15FPS。
CoEvo:面向多步因果推理的预言机锚定单模型自进化
CoEvo用可查询预言机校验单步,让单模型交替提议与求解并协同自进化,8B多步因果推理路径正确率达82.1%。
BraTS 2026 任务 1 脑转移瘤分割:多架构比较
多架构对比脑转移瘤分割:Primus总体最优,ResEncL病灶级F1更佳,并揭示三个后处理陷阱。
ZVeC:面向实例级车辆提取与生成式点云补全的零样本框架
零样本实例级框架将场景补全分解为车辆实例重建,用扩散模型补全并重组,地下稀疏输入下几何一致。
虚拟神经网络:一身百魂
虚拟神经网络固定参数量、靠算力扩展,由少量物理模型生成数百共享权重虚拟模型,鲁棒性与精度随数量提升。
脉冲神经网络的激活能量剪枝:基于脉冲计数显著性的无监督个性化
激活能量剪枝用于脉冲神经网络:梯度剪枝在高稀疏下近乎失效,而该法在高稀疏度反超原模型。
AI研究智能体的递归自我改进
AIDE^2自主改写自身代码并择优保留,8天连获七项改进,迁移至多领域且减少奖励黑客。
SWE-Serve:面向生产推理服务的智能体工程基准测试
SWE-Serve 基准含 53 个 SGLang 生产推理任务,揭示本地通过而生产出错的差距。
可复现的 AI 需要可复现的随机性
PRNG完整内部状态跨库迁移未必保证复现;PyTorch的Philox与参考算法不兼容,危及AI可复现性。
行为并不足够:LLM社会中社会规范涌现的基于机制的评估
提出同时测量行为趋同与期望的评估框架,区分社会学习与社会选择机制,相同合作结果源于不同底层社会过程。
面向NOMA网络资源分配的中性原子量子优化
中性原子量子优化求解NOMA上行最大接入问题,重构为最大独立集,用里德堡原子阵列编码验证可行性。
通过文本实现不相交表格的发现驱动集成
LOKI用双向交叉注意力与全局对比学习,发现文本中介的行-句连接路径,实现不相交表格的发现驱动集成。
JEV 作为评判者:自信时接受,不确定时升级
JEV决策评判成本仅0.36%,精度差3个百分点内;级联接受高置信判断、升级存疑项,低成本保99%精度。