从提示到路面穿越时间:智能场景到规划推理中的时间基础
研究时间条件对自动驾驶推理的影响,虽无统计改进,但定性显示预测性危险推理等,建立首个时间场景规划基准。
先验知识还是搜索?LLM智能体在硬件感知代码优化中的研究
LLM智能体代码优化高度依赖预训练先验,迭代反馈效果有限,CUDA改进而TVM IR退化。
可解释的废水数字孪生:自适应上下文条件化结构化模拟器与自我证伪决策支持
开发可解释数字孪生,通过上下文混合专家和自证伪决策,在真实污水厂减少不安全动作43.6%,阻止93/187次N2O误报。
受机器人学启发的基础模型在社交敏感领域中的护栏机制
借鉴机器人学,提出运行时行为控制框架,约束社交敏感领域模型交互轨迹,防止不良漂移。
概率性小型递归模型
PTRM通过注入高斯噪声实现随机探索,无需重训即大幅提升推理准确率(如数独达98.75%),参数仅7M,成本极低。
AutoResearchClaw:自我强化自主研究与人类-AI协作
提出多智能体自主研究管线,整合辩论、自修复与人机协作,性能提升54.7%。
STAR:面向图增强生成的语义调优与尾部自适应检索器
STAR通过令牌交互与路径加权对比学习,缓解语义与长尾偏差,检索和QA性能分别提升1.8%和2.2%。
无需基于分类法的错误分类来改进检索增强生成
RePAIR直接映射缺陷输出到纠错动作,无需显式错误分类,显著提升RAG性能。
PO4ISR的可重复性分析:诊断和缓解基于LLM的会话推荐中的语义漂移
PO4ISR存在长会话语义漂移,提出PO4ISR++(动态提示+一致排名检测),在Games和Bundle上分别提升54%和96%。
双视图:自适应局部-全局融合的多跳文档重排序
提出双视图级联重排序框架,融合局部与全局依赖,在MuSiQue达99.4%召回且低延迟。
代理式图RAG:协作AI驾驭非结构化金融数据
提出协作代理图RAG框架,通过三阶段构建知识图谱和模块化代理,在商业登记数据上显著优于向量RAG基线。
基于去中心化自治组织和区块链的社区设施管理激励框架
提出基于区块链和DAO的社区设施管理框架,通过代币奖励激励住户参与,评估显示可行。
查询感知流扩散:具有检索保证的基于图的RAG方法
提出QAFD-RAG,通过查询感知图遍历实现子图检索保证,指数收敛,性能优于现有方法。
Mask-to-Correct$^+$:利用检索器多样性实现基于掩码的忠实事实纠正
提出无需训练的M2C和M2C+框架,利用检索器多样性与掩码引导纠正错误,SARI提升14%。
Features have life history. And we should care
AI风险的可保性前沿:对肯定承保、沉默风险与除外责任的威胁进行映射
论文绘制AI风险的四层可保性边界,揭示肯定承保、沉默风险、除外责任及市场模式。
一种用于可穿戴PPG心血管稳定性的非线性复杂度指数:多尺度验证、系统评估修正与贝叶斯参数优化
提出SCSI指数,纠正评估伪影,经贝叶斯优化后AUC达0.720,实现可穿戴PPG心血管稳定性可靠评估。
基于头部随机探测的快速轻量级后门检测
提出HTell,无需数据,通过随机探测预测头检测后门模型,速度快、准确率高,检测延迟仅12.69毫秒。
SCAFDS: 基于边缘特征图注意力的银行间欺诈检测与归因驱动的可疑活动报告生成
SCAFDS用边缘特征图注意力与归因SAR生成,银行间欺诈检测AUPRC提升15.9个百分点。
不要在缺乏鲁棒性审计的情况下从LLM社会模拟中得出科学结论
LLM社会模拟结论需经鲁棒性审计,微小扰动可致巨大偏差,提出TRAILS分类法,呼吁鲁棒性为首要验证。
DMN:一种面向多图像输入的多模态大语言模型越狱的组合框架
提出DMN组合越狱框架,利用分布式指令、多模态证据和数字链任务,在多个MLLM上实现超90%攻击成功率。
CounterFlow:一种用于反事实视频拟音生成的两阶段推理时采样方法
提出CounterFlow双阶段采样,先抑制视觉源再聚焦音色,实现反事实视频拟音生成,显著优于基线。
ESLD(外部替代潜在防御):一种更快、更强的提示注入防御的潜在空间架构
直接读取防护模型内部信号,检测速度提升3倍、准确率提高16.4%,ESLD无需修改即可部署。
SynGR:释放跨模态协同在生成式推荐中的潜力
SynGR通过约束主导模态依赖,捕捉跨模态协同信息,提升生成式推荐性能。
Agent Security is a Systems Problem
应对未知:面向新型多轮多模态攻击的预测性防御
提出TRIAD框架,动态建模轨迹并集成贝叶斯HMM-Cox模型,实现有界失效时间的预测性防御。
迈向人工智能驱动的劳动力政策计算试验平台
利用LLM代理模拟员工对AI整合的心理与行为反应,为劳动力政策提供预测工具。
逐令牌妥协:统一自回归模型中的后门漏洞
首次提出针对统一自回归模型的后门攻击ToBAC,用微小触发器操纵多模态输出,成功率高达63.1%。
以善改写:通过重写实现良性投影防御大语言模型数据投毒攻击
开放书重写将样本投影至良性空间,有效抵御后门攻击,安全性能提升51%,高效且不降模型性能。
走向PLACES:全球南方文本到图像安全的参与式本地化红队测试
在加纳、尼日利亚、印度等地开展参与式本地化红队测试,发现26000+例T2I失败,揭示文化语境鸿沟与新危害,主张本地化方法论。
用于即时肺炎诊断的设备端持续学习:双阶段缓冲与动态损失
PneumoNet用双阶段缓冲和动态损失,在域偏移下准确率86.6%、遗忘仅1.4%,实现设备端自适应诊断。
基于强化学习的四旋翼控制实现林下树冠环境空中巡检行为
结合深度强化学习控制器与TSP/RRT*规划,实现林下树冠环境中的巡检目标跟踪与安全导航。
当Web应用自我修复:基于MAPE-K的容错与自适应恢复方法
提出基于MAPE-K的自愈框架,故障检测F1达90.7%,恢复成功率93.2%,平均恢复时间3.92秒,吞吐量维持88-95%。
面向神经网络模型合并的冲突无关复制数据类型:一种双层架构,支持跨26种策略的CRDT兼容模型合并
26种合并策略均不满足冲突无关性;提出双层CRDT架构,保证强一致性,开销低于0.5ms。
ContextFlow:面向长时域具身智能体的层次化任务状态对齐
提出ContextFlow框架,通过任务状态显式对齐与证据驱动更新,解决长时域具身智能体任务状态错位问题。
DEFLECT:基于流匹配似然估计的反事实调优实现VLA策略的延迟鲁棒执行
DEFLECT通过离线后训练将延迟转化为偏好信号,无需人工标注,显著提升高延迟异步VLA策略成功率。