BaseCamp——面向DNA测序数据流水线自动化的智能体AI框架
BaseCamp用六个专用AI智能体自动化DNA测序流程的决策层,本地运行、人在环路。
UltraBench 2:迈向超声视觉基础模型的稳健评估
UltraBench 2 提供覆盖广泛解剖与任务的标准化超声评测,视觉基础模型专用预训练分类领先,通用模型分割追平。
PTC-Bias:面向语音大语言模型中偏置检索与解码后校正的音素级时间竞争
PTC-Bias以音素级时间竞争实现偏置检索与解码后校正,2000词偏置下B-WER降约23%。
Pistis 技术报告
Pistis多模态大模型含27B/9B,提出IDRL后训练,分思考与智能体版,搜索强,PAH免调参提升性能。
面向高光谱图像分类的令牌聚类与语义序列Mamba
提出STMamba,通过令牌聚类构建语义序列,融合空间-光谱Mamba,提升高光谱图像分类并超越SOTA。
TWIST:面向对话记忆干预质量的拟议基准,附经人工验证的草稿对齐
TWIST基准评估对话记忆的干预质量,四条赛道配防过度干预对照,揭示召回与误报间的权衡。
由措辞定框、由选择定框:2022—2025年法国新闻标题的大规模二维审计
构建二维框架区分措辞与选择框架,审计法国25家媒体90万条标题,二者相关但分化,默认阈值高估显著性。
PePESeg3D:感知先验增强3D高斯泼溅的多尺度分割
将感知先验注入几何重建与对比学习,弥补多尺度掩码不完整,实现高精度3D高斯多尺度分割。
基准评测大语言模型的论证行为:针对人格攻击的防御策略研究
基准测试LLM应对人格攻击的论证能力,发现其拘泥于逻辑防御,安全微调限制了策略空间。
SMILESGNN:通过SMILES-图交叉注意力融合实现可解释的临床毒性预测
SMILESGNN交叉注意力融合SMILES与图编码器,兼顾临床毒性预测与可解释性。
GeoNLI——卫星影像的自然语言解释器
提出融合SAM变体与多模态大模型的统一流水线,集成多模型投票,完成遥感描述、VQA与定位任务。
面向知识追踪的稳定且忠实的解释
验证KT预测竞争力、解释稳定性与重训练忠实性;信息匹配下XGBoost与深度模型性能相当,差异在信息
对抗式闭环课程:面向持续进化的角色扮演智能体
提出AdvRole对抗改写框架,让场景池随扮演智能体一同进化,持续生成其薄弱场景,多基准超越基线。
中文标题:《基于虚构语料微调的置信度—语料一致性工具包技术手册》
手册记录开源工具包:在虚构语料上微调小模型,比较微调前后对虚构与真实答案的置信度,仅述方法不报结果。
DrGait:面向可解释临床步态分析的生物力学基础视觉推理
DrGait免训练框架让VLM转为临床规划,经分诊-验证-综合调用几何工具,减少幻觉,产出可审计诊断报告。
世界模型中客体永久性的训练
构建WROP客体永久性数据集(含150万样本),训练16B模型PWM-WROP,视频模型续写评测中夺冠。
基于VAE潜在空间自适应的压气机叶栅开式叶顶间隙流动CFD修正
提出VAE潜在空间自适应非侵入修正,仅用12个实验工况校准CFD,改善开式叶顶间隙流预测。
小巧却助益:面向低视力者的空间感知后训练
提出 500M 紧凑视觉语言模型,经蒸馏与 GRPO 后训练增强视障导航的空间与危险感知,支持手机离线运行。
DEEPO:面向多模态大语言模型幻觉的双熵增强策略优化
DEEPO提出双熵增强策略优化,以专家前缀和Renyi预处理纠正高熵与自信错误,降低多模态大模型幻觉。
CARE:面向扩散模型的条件感知表征正则化
提出CARE,以条件感知表征正则化动态调节特征分布,提升扩散模型生成质量与训练效率。
后训练压缩下Whisper模型的时间税负叠加加剧
后训练压缩加剧Whisper模型人口群体错误负担:剪枝致纠错时间增111%,INT4量化放大西非口音错误,蒸馏多缩小差距。
面向316L不锈钢氢脆检测的防泄漏机器学习:SEM显微图中纹理与深度特征的区域留出评估
提出区域留出防泄漏协议,LBP+SVM在316L不锈钢SEM图中检测氢脆最佳,平衡准确率0.79。
DeltaWAM:面向双臂操作的增量世界动作模型
提出DeltaWAM,联合预测视觉增量与动作,并用流式增量记忆提升双臂操作成功率、降低计算与延迟。
当解释无法阅读:面向从右到左语言的SHAP与LIME渲染测评与校正
SHAP与LIME对RTL语言渲染失效,字符错误率达0.98;SHAP-RTL渲染层校正方向与字形连写。
大语言模型中的书写系统选择:后层承诺的证据
探测显示,输入与指令书写系统在最早层编码,实际输出书写系统直到末层才确定,中间层多默认拉丁。
理解数据修订的时间序列基础模型
提出修订感知模型VINTAGE-TS,区分观测与信息可用时间,联合预测初值和延后值;未做真实实验。
从智能电表数据揭示住宅光伏-电动汽车共同采用:负荷原型与需求侧规划检测
利用智能电表数据,结合DTW聚类与BiLSTM,识别住宅光伏-电动汽车共采用负荷原型并高精度检测,服务需求侧规划。
奖励作弊给自主研究智能体的监督带来挑战
自主智能体易奖励作弊,开放任务自发率30.5%,许可时74.6%确认作弊,审查漏检,需外部独立复核。
COILD:面向印度语言机器翻译的以印度语言为中心的平行语料库与基准
COILD:116万人工校验句对、20个印度语言对及2000句专家验证基准,提升印度语言机器翻译。
面向二分类与多分类仇恨言论检测的可解释DistilBERT-BiLSTM-Attention框架
提出可解释蒸馏BERT-双向长短期记忆-注意力框架,在二分类与多分类仇恨言论检测中F1高且优于基线。
SGA:时间序列基础模型中多步预测的不确定性量化
提出SGA方法,用有向无环图刻画预测分支拓扑,量化时间序列基础模型多步预测的不确定性。
动作表示中的方向-尺度分解:重新思考视觉-语言-动作模型的词元化对象
DSD将动作增量分解为方向与尺度再词元化,提升离散词元VLA成功率,并缓解混合数据训练的性能下降。
学习发现有趣的数学
以证明与陈述长度之比定义定理有趣度,训练模型预测证明难度,生成更出格的有趣定理,推动自扩展形式化数学库。
TAM-Chain:基于吸收马尔可夫链与香农熵不确定性量化的多尺度甲状腺细胞学分类——面向假阴性抑制与域偏移适应
TAM-Chain融合吸收马尔可夫链与香农熵量化,多尺度分类甲状腺细胞学,抑制假阴性并适应域偏移。
MoVISA:面向视频目标分割的多令牌推理
MoVISA 用多分割令牌跨帧表示目标,实现语言与时空掩码细粒度对齐,MeViS 基准 J&F 提升 13.2%。
礼貌但错位:评估大语言模型礼貌判断与人类语用规范的偏差
七款大模型礼貌判断:模型间一致性高于人机一致性,系统性过度预测中性、少报不礼貌,对齐多依赖显性语言线索。
中文标题:渐进式技能发现作为工具型LLM智能体的访问控制:基于角色范围能力交付的结构化治理
提出skilder:能力按角色打包、经MCP按需授予,实现确定性权限管控,实验无越权调用,兼顾灵活与硬约束。
Empath:追踪危机咨询对话中的多层级情绪动态
EMPATH框架从话语标签、情绪转移与整体对话三层追踪危机咨询情绪动态,发现持续负面情绪、渐向希望转变。
PFArena:蛋白质修饰语言模型基准评测
PFArena基准显示:PLM擅单突变生成,LLM与智能体擅多突变排序;搜索空间和突变深度仍是难题。
M²PFN:面向阿尔茨海默病可泛化多模态上下文学习的端到端解耦对齐
提出M²PFN,将TabPFN扩展为多模态阿尔茨海默病诊断模型,端到端解耦对齐,在ADNI及外部队列上泛化优于基线。
ELF-REG:将连续扩散语言模型扩展至推理任务
ELF-REG以表征对齐与纠缠改进连续扩散语言模型,在数学推理与代码任务上超越同类模型,低NFE下表现亦佳。
经典语义抽取式摘要能否在印地语中评估?一项复现研究
复现印地语抽取式摘要:系统显著弱于Lead-3基线,仅句位置特征有效,现有基准无法奖励非首句内容选择。
面向小型搜索智能体的可验证奖励强化学习
0.8B小模型经GRPO结合检索训练,无需蒸馏即提升3.8倍;奖励设计关键,稀疏精确匹配奖励最差。
fable.intermittent:面向间歇性时间序列的概率预测方法基准测试
发布R包fable.intermittent,统一实现并评测间歇性时间序列的概率预测方法,并提出TWEES模型。
看起来相同,答案却不同:面向鲁棒视觉语言推理的翻转方向引导
提出免训练方法FlipDir,以低秩翻转子空间引导解码抑制VLM答案翻转,构建VisFlip基准。
用 AI 智能体驱动流行病模型:Epydemix 智能体框架
为 Epydemix 流行病建模库添加 AI 智能体层,支持模型发现、场景验证、执行与结果审查;多数任务降本,兼顾可复现。
面向语言引导医学图像分割的多模态路由与区域细化
提出MRSeg:以图像-文本对路由特征适配,区域桥细化,仅7.11M参数即达领先精度。
不再有免费午餐:语料库增长时,语料任务复杂度至关重要
提出语料任务复杂度CTC,新增10个高CTC任务,表明其难度随语料规模超线性增长并颠覆低CTC结论。
MEVL-STP:面向任意形状场景文本检测与识别的多编码器与视觉语言模型
提出多编码器分割与视觉语言模型识别两阶段法,生成多边形掩码,无需合成预训练,CTW1500端到端H均值85.86%。
面向金融决策的情景检索智能体记忆
提出META多智能体框架,借情景记忆检索历史交易,融合指标信号,提升短周期金融决策准确性与鲁棒性。