与AI共事:人机协作设计框架
提出人机协作设计框架,统筹人、AI系统、任务、组织与社会环境,并以协作机器人装配案例演示其落地应用。
LLM引导的本体驱动非结构化文本知识图谱构建
以7B–32B开源大模型结合可复用提示,从法文电网事故报告构建OWL本体与知识图谱;模式引导提示可显著提升抽取质量。
SMARtCARE:面向有限自主临床决策支持的隐私保护智能体AI系统
四态架构融合六通道有损指纹,触发医生审查与授权检索,经MIMIC数据验证决策可追溯。
OMP-MoE:基于正交匹配追踪的混合专家大语言模型高效专家剪枝
OMP-MoE免训练框架,用正交匹配追踪把专家剪枝转为稀疏信号重建,25-50%剪枝率下性能领先。
基于LLM生成的ACSL契约与确定性驱动生成,用CIVL验证PETSc
用LLM生成ACSL契约、确定性驱动,经CIVL验证PETSc三函数,发现MatAYPX的缺陷。
域适应何时有助于物理振动传感器?基于留出轴承的神经算子与卷积模型研究
留出轴承协议下迁移仅0.36;傅里叶神经算子在阶次域达0.95,表明输入表征而非对齐方法决定域适应成效。
COUNTERMEM:面向语言智能体的世界模型验证式反事实记忆
用可执行世界模型验证失败后的反事实记忆,12项基准平均提升12.6个百分点,token降7.7%-42%。
见证重叠:开放权重模型家族内的方向性溯源
见证重叠法免训练免提示,以同族第三检查点为见证判断父子方向,176个模型上准确率95.3%。
什么驱动了方言越狱?表面形式、文化框架与策略库的消融研究
方言表面形式非高攻击成功率必要条件,优化器控制的策略库才是主因,文化中性策略库同样达近满分。
稀疏重叠下的LLM评审验证:从推断到设计
重叠稀疏致LLM评审验证错判:5%重叠时错判率达25%。提出最小重叠量ρ≥0.25及零成本分层分配,可使错误拒绝率减半。
不平衡SAR船舶分类中的跨数据集迁移与未知类检测
六模型在两SAR船舶数据集上评估域内、跨集迁移与未知类检测;跨集泛化差,任务不确定性常优于MC-dropout方差。
CP-Agent:面向晶体塑性仿真工作流的框架工程化智能体
基于LLM的CP-Agent自主完成晶体塑性建模全流程,四案例验证参数校准与织构复现。
ChestPheNoT:可部署、可审计的放射学报告标签-状态-证据抽取
提出0.5–3B模型,从放射报告联合抽取标签、三分类状态和原文证据,可本地部署审计,跨机构表现优。
EEGAgentBench:面向短时程与长时程脑电分析的LLM智能体基准测试
提出EEGAgentBench基准,含6类脑电任务、2秒至23小时信号与10种工具,评测29个LLM,发现其长时程证据累积与多步推理不足。
基于共享表示与领域特定头的IMU数字笔年龄自适应手写重建
提出共享表示与领域特定头的跨域网络,提升IMU数字笔跨年龄手写重建,无需用户适配。
对称商平坦性与泛化
建立对称商平坦性理论,关联商线性稳定性、输入平滑性与泛化。
时间拔河:通过轨迹方差可视化与检测扩散模型中的RAG冲突
提出轨迹方差分数TVS,以多条去噪轨迹答案嵌入的余弦距离检测RAG与参数知识冲突,轻量且跨架构有效。
ConflictVLA-Bench:评测视觉-语言-动作模型对前提冲突的行为响应
提出ConflictVLA-Bench,发现VLA面对前提冲突常现“失败坚持”,仅看结果不足以评估。
DriveHierarchy:从开环理解到闭环执行诊断VLM驾驶能力的基准
提出分层基准DriveHierarchy,覆盖感知、记忆、推理与闭环执行,评估15个VLM,贯通开环理解与闭环驾驶,助力诊断优化。
将视觉语言模型锚定于驾驶语义:面向可解释推理的多数据集谓词框架
提出跨数据集谓词框架,从可测证据推导驾驶语义并构建谓词知识图谱,F1达0.94/0.93,提升九项问答中七项准确率。
PalmLeaf-VQA:面向多地区历史贝叶手稿理解的多文种视觉问答基准
多文种贝叶手稿视觉问答基准,覆盖南亚东南亚八类藏品;最强多模态模型准确率仅58%,罕见文字与退化版面理解仍难。
AI支持的循证学习对公共演讲技能发展的评估
AI结合演讲情境提供针对性反馈与示范演讲;学生练习后表现提升,填充词减少,焦虑降低15%–34%。
静默自由度中的回放:无需离线阶段的持续学习
无需离线阶段,靠静默自由度回放巩固;旋转增益最大,隔离保不变,类增量MNIST达91.6%。
面向消费者投诉评估的情感分布建模与异常检测
将投诉负面情感视为有界连续变量,用贝塔分布建模并结合金额与回复做异常检测。
IndustryLLM:面向工业采购的失败驱动大语言模型训练
提出失败驱动训练的工业大模型IndustryLLM,融合国标与真实交易语料,线上GMV增4.25%,延迟由6-7秒降至1.5秒。
Metro-WM:基于可实现子目标的长时程潜空间规划
Metro-WM用经验真实状态构图,生成可实现子目标,完成长时程潜规划,成功率更高、速度更快。
文献引导的描述符组分搜索空间过滤框架
文献引导描述符过滤框架:词嵌入选描述符构建帕累托过滤,平均剔除74%候选组分,最优值误差1.9%。
下一事件准确率无法揭示的问题:急诊科轨迹模拟器的闭环评估
急诊轨迹模拟器仅靠下一事件准确率不足;闭环评估揭示误差累积、模型分歧及下游任务排名反转。
一步最优:无条件整流流是 Noise2Noise 去噪器,多步积分可证明有害——低剂量 CT 的基准与基于任务的可检测性研究
无标签去噪单步流最优,多步积分偏离MMSE降保真,配对关键;低剂量CT中PSNR升但病灶可测性反降。
FIDAL:真实世界分布偏移下的多样性感知联邦主动学习
FIDAL融合不确定性、多样性与自适应OOD剔除,在开放集联邦主动学习中提升医学影像标注效率与精度。
一次评估,任意工作点:超网络摊销MeanFlow用于3D MRI重建
超网络将采样模式等运行点映射至单步MeanFlow,一次评估重建3D MRI,学习采样掩膜增益显著,支持自监督。
视频扩散训练中时间注意力头的专门化
逐头普查视频扩散训练:整体集中度不升,仅少数头专门化,结构见于首个时间块,注意力呈自帧与邻帧局部路由。
Enhancing Foundation Models for Imbalanced SAR Ship Classification via Targeted Oversampling
提升端壁气膜冷却预测泛化能力:将叠加原理融入基于Transformer的神经算子
提出融合叠加原理的Transformer神经算子SDNO,两阶段预测端壁气膜冷却温度场,对未见10–20孔布局泛化强且更准。
Energy-aware frugal Bayesian optimization
印度政府监管文件检索增强生成中解析器、分块与嵌入的交互作用
印度政府监管文档RAG因子实验显示:无单一检索器占优,解析与分块交互显著,检索差异主要来自排序质量。
ForensicZoom:基于多模态大语言模型的自适应视觉检查,实现工业级人脸伪造检测
提出自适应视觉检查框架,模型可自主放大可疑区域进行多轮取证推理,工业级检测TPR超97%且可解释。
面向长视频理解的查询对齐视频帧选择
面向多项选择题,将答案选项作为语义线索扩展查询,按问题-答案对的余弦相似度评分选帧,同等帧预算下优于均匀采样。
稳步学习:累积相对点间隔分数用于人脸图像质量评估
提出CARPM-FIQA,累积训练全程相对点间隔分数,稳定人脸图像质量评估,提升判别与排序稳定性。
语言增强的视频动作预判:设计基础、基准与开放挑战
综述提出证据感知设计图谱,交叉任务设定与语言介入点,归纳五类任务,主张假设需匹配验证而非因果结论。
Ongiini-Eval-OW 基准:面向 Oshindonga 与 Oshikwanyama 机器翻译及大语言模型评测计划的概念论文
发布Ongiini-Eval-OW基准计划:600条英语—Oshindonga/Oshikwanyama数据,填补Oshiwambo语MT评测空白。
超越图模型:自适应元学习器融合可解释性、天气与动力学,实现鲁棒的公交到站时间预测
提出HYB(nm)元学习混合框架,融合时序、图模型与天气特征,实现高精度稳健的公交到站预测。
面向SoF数据集的局部人脸识别CNN骨干网络迁移学习对比研究
SoF局部人脸识别对比三种CNN迁移学习,PFN达97.4%准确率,表现最佳。
秩能换来什么?低秩适配的谱与分布分析
LoRA秩非容量控制;范数预算下复杂度与分布位移不随秩变,秩仅决定可及更新及抵消主奇异方向的代价。
MaD-RL:通过强化学习匹配分布以校准大语言模型
提出强化学习分布匹配框架,可将模型输出属性分布对齐目标分布,缓解多样性下降,并在数学与编程任务验证。
面向博弈型与学习型对手的信息设计
带弃权二分类器须依对手设计弃权:近边界弃权利博弈型却泄露给学习型,两种防御不可比。
Transformer MLP 门控阈值是与被携带参考方向的耦合
残差流均值方向是MLP门控阈值参考;阈值由与该方向耦合实现,偏置贡献很小,跨模型验证。
基于事件的行人横穿检测的无监督脉冲特征学习:无需标注训练数据逼近监督精度
无监督脉冲特征学习在行人横穿检测中达90.3%准确率,接近监督,性能主要取决于读出协议。
不要重复自己:面向覆盖率的自监督微调
DRY-SFT先生成多样解法、再独立微调,无需奖励或验证器,大幅提升pass@100与结构多样性。
迈向AI辅助家禽球虫病诊断:评估Gemini与BiomedParse在艾美耳球虫显微图像上的表现
Gemini诊断艾美耳球虫显微图像准确率仅14.9%,偏倚严重,报告未验证、分割不完整,尚不可靠。