图工程、循环工程与执行支架工程:面向零信任智能体数据工程与分析处理
提出两套零信任框架,用图、循环与执行支架保障智能体数据工程及OLAP,凭证据验证完成、恢复与生产上线。
面向请求的预算约束阈值激励通用框架
提出请求驱动的预算阈值激励通用框架,含四阶段七模块,短期试点校正,显著提速并降后悔。
STRAND:面向视频大语言模型的以对象为中心的时空监测基准评测与改进
提出STRAND基准与忠实准确率诊断时空监测缺陷,并设计对象中心框架减少幻觉、提升时序推理一致性。
当相同行不一致:从基准可识别性到复制稳健的异常检测
重复行给表格基准带来隐藏偏差;SCOUT分解支持与计数证据,实现复制稳健且校准的异常检测。
AgenticCADedit:一种面向多模态3D CAD编辑的有状态、工具介导智能体方法
以持久状态上的可验证小步操作替代整体重生成,支持检查、验证与撤销,提升编辑有效性并降低输出开销。
从纵向文本数据建模组织级语义身份的计算框架
提出统一计算框架,融合语义表示学习、图建模与语义指纹,从纵向文本推断可解释、可验证的组织语义身份。
模型陈述的拒绝候选人的理由是否起作用?
模型拒绝候选人的理由有部分作用,但关键对比不显著,位置与无关句效应更强,仅界定效应。
融合不确定性感知与异构复杂度的联邦轨迹预测主动客户端选择
提出融合不确定性与复杂度的主动客户端选择方法,加速联邦轨迹预测收敛并提升性能。
广义图变分自编码器:有界散度控制后验坍缩
GGVA用有界Tsallis散度(q<1)替代KL正则,保留更多后验信息、延缓坍缩,但不提升链接预测精度。
胰腺导管腺癌切除术后生存预测多模态数据集
发布302例胰腺导管腺癌切除患者多模态数据集,含全切片、临床分子及生存数据,基准C指数约0.65。
Albireo:面向边缘端视频目标检测的自适应高能效推理框架
提出检测器无关的自适应推理框架,按逐目标卡尔曼滤波不确定性决定是否跳帧,节能12%–18%且精度不降。
衡量跨厂商与版本模型行为的低成本检测方法
提出低成本可复现模型行为检测,跨厂商版本运行,三种读数揭示行为差异与变迁。
面向第二语言发音分析的母语参照音素类几何
提出母语参照音素类几何,无需发音标注或配对录音,其投影距离与口语水平及发音质量负相关。
基于人工智能的低分辨率远程监测数据心力衰竭恶化检测
提出TRACER模型,可从低分辨率远程监测数据中检测心衰恶化,预测住院时间线准确率达66.7%。
偏见中的黄金:通过验证使AI设计流程成熟
将偏见重构为诊断工具,提出四维验证框架,梳理30类偏见、16种验证法与20项对策,倡导伦理内置设计以构建可信AI。
SpectralCTGaussians:基于3D高斯泼溅的光谱CT投影域重建与基材料分解
提出基于3D高斯泼溅的光谱CT投影域重建与基材料分解方法,利用可学习基材料分数和能量基函数联合优化,性能优于基线。
VG-TIE:一种基于可视图的具有可解释性的表格到图像编码方法
VG-TIE用可视图将表格特征编码为二维图像,像素对应特征、强度示偏差,具备可解释性与竞争力。
探究白细胞是否为非洲血涂片图像中疟原虫假阳性检测的来源
七项分析证实白细胞非疟原虫检测假阳性来源;假阳性源于染色碎片与制片伪影,多任务学习更优。
打破环境壁垒:为递归式自我改进演化LLM智能体环境
提出Env-Rethink,以环境组织、噪声识别与虚拟演化增强智能体,任务通过率提升超15.1%。
R-DEIM Net:一种用于复述检测的高效理据增强双专家交互模型
提出76M参数双专家模型R-DEIM Net,在Quora复述检测达90.07%准确率,并能生成可读理由。
ReCalMatch:面向半监督细粒度识别的可靠性校准语义引导
以多角度语义原型校准伪标签可靠性,结合视觉—语义一致性抑制高置信错误,提升半监督细粒度识别。
面向科学影响力的构思学习
以论文引用影响力为奖励信号,训练奖励模型并用强化学习对齐构思生成器,产出更高影响力的科研想法。
双向评分:大语言模型能实现其无法可靠解析的MRS
MRS双向评测:大模型生成强,但解析远逊ACE;生成高分不等于理解形式语义。
基于排序原型的流形感知主题建模方法
免训练流形感知主题建模,按排序原型选K个真实文档,性能优、更快且连贯多样。
SALI:基于电影语法知识的镜头感知后期交互,用于文本到视频检索中的跨镜头关系匹配
SALI用镜头感知后期交互,将查询的主宾语分别与各镜头嵌入匹配,并加电影语法惩罚,大幅提升多镜头关系查询的R@1。
TopoFuse:面向三维冷冻电子断层扫描分割的拓扑感知三平面融合
将拓扑建模为可微投影算子,用持续同调引导的稀疏编辑修正体素,Betti误差降54%、Dice升4.6点。
评估结论的可复现性如何?对LLM推断提示结构的自审计
LLM评估排名常被高估;重复推断不稳定,仅最差模型可靠,最佳/中间排名不可靠,可复现不等于准确。
时间序列验证的不可能三角:训练充分性、测试覆盖性与时间因果性之间的守恒定律
时间序列验证三者不可兼得;越界需未来数据,危害取决于距离。纯噪声下乱序5折信息系数虚高至0.32。
幻觉神经元在哪里:对幻觉神经元存在性的探究
幻觉神经元检测可复现且因果显著,但定位不唯一,稀疏预测结构不等同于唯一神经元定位。
返回还是修订?学习何时修订有助于检索增强问答
提出可恢复性预测修订效果,训练策略决定返回或修订,提升检索增强问答,但不及在草稿与标准RAG答案间选择。
公共教育预测基准的结构可靠性有限:对七个数据集的四维审计
七套教育预测数据集四维审计仅三套全过;跨群体脆弱性使随机划分高估信号,复杂度难补救,审计为最低门槛。
强化学习中成本感知语言模型引导的经认证预测性建议价值门控
建议获取为成本感知元推理,仅当预测价值下界超成本才查询;BabyAI上提升回报且减少97%调用,但未证明逐状态优势。
什么、何时与如何:音频描述作为受约束的全局优化
将音频描述形式化为受约束全局优化,联合决定内容、时机与表述;大模型提议并用整数规划调度,提升叙事与时间指标。
半监督安卓恶意软件家族归因中伪标签收益的分类器依赖性
伪标签增益依分类器而异:SVM最大+4.4%,随机森林低标签率受损,约10%标注近最优。
分布偏移下,科学代理模型重验证优于有状态路由
分布偏移下,科学代理模型每批重新验证选模优于有状态自适应;旧证据常无益。
编程教育中生成式AI反馈的风险自适应与证据约束框架
提出风险自适应、证据约束的生成式AI编程反馈框架,校准风险定干预时机,证据约束反馈内容,辅助逐级递进。
《PUBG Ally:作为AI队友的对话式具身智能体》
提出具身AI队友PUBG Ally,融合大模型推理与实时游戏控制,经3.9万局实战数据训练,玩家推荐正向反馈高出25.1个百分点。
推进 AgentX 中的模型研究:面向工业推荐系统的长时程自主性
AgentX-Model 以双智能体实现工业推荐长时程自主研究,多轮实验闭环,线上 A/B 显著提升。
注意间隙:网格引导的断裂血管修复
提出网格引导后处理修复nnU-Net断裂血管,Dice几乎不变,ccDice与连通性大幅提升。
OREO:通过即时渲染-编辑优化实现3D生成中的保真度对齐
提出OREO,利用2D扩散先验,以强化编辑动态优化渲染视图作监督,提升3D生成保真度。
面向无监督野外语音挑战赛多语言语音表征的BiMamba2掩码离散单元预测
BiMamba2掩码离散单元预测多语言语音表征,在67语种无标注数据训练;说话人聚类ARI达0.735超越四基线,但LID与CER仍逊于有监督。
Qwen-Planner-Agent:面向真实世界移动规划智能体的闭环 AI-for-AI 框架
提出 AI-for-AI 闭环框架,贯通数据、训练与模型-框架协同演化,移动规划智能体整体性能最佳。
一种在 Fat-Shattering 维数下近线性规模的平方损失不可知样本压缩方案
构造平方损失不可知样本压缩方案,规模近线性于 Fat-Shattering 维数,消除对偶因子并解决开放问题。
基于碰撞时间与过街区域上下文的城市交叉口安全导向行人轨迹预测
融合碰撞时间与过街区域上下文,安全导向训练降低城市交叉口行人轨迹预测误差及大误差频次。
长时程智能体何时可以遗忘其推理?ICLR:面向长时程智能体上下文压缩
提出免训练在线方法ICLR压缩智能体推理历史,提升奖励并大幅降低token消耗,发现推理可外化后更易遗忘。
ARGUS:面向美国就业歧视投诉的角色感知事件知识图谱
ARGUS结合5W1H模式、法律领域模型与LLM,从投诉文本构建文档级事件知识图谱,提升诉求分类与法律问答,检索后证据组织效果最佳。
基于轻量级视觉Transformer的U-Net用于MRI脑肿瘤分割
提出轻量ViT-UNet分割MRI脑肿瘤,仅260万参数,Dice达0.8446,优于UNet。
本体中介的多利益相关方神经符号约束获取
以OWL本体统一LLM软偏好与硬件硬约束,用描述逻辑检测冲突并生成解释供再协商,余者按优先级松弛。
S2Planner:面向端到端自动驾驶的多尺度语义规划器
多尺度语义轨迹规划器,融合三相机与自车运动,粗到细迭代优化路径点,NAVSIM达88.03 PDMS。
Bandit多类PAC学习:修正的下界、精确族与置信度直和现象
修正bandit多类PAC下界,提出aBDS;上界去除K;仿射复用类揭示置信度直和,维数不足以刻画。