评估多任务形态学概念学习在3D CT肺结节恶性评估中的作用
基于LIDC-IDRI数据比较单任务与多任务3D CNN,发现联合学习毛刺、分叶等形态特征未明显提升恶性风险分类,类别失衡与标注结构是关键。
使用机器学习预测供应链管理中的运输时间
利用机器学习与深度学习,基于历史数据构建模型精准预测供应链运输时间,提升物流效率。
AREX-2:通过长时程反思任务推进自我改进智能体
AREX-2用长时程反思数据训练智能体,在MLE-bench等基准表现优异并可随迭代持续提升。
深度分类树的移动时域近似分支归约方法
提出移动时域近似分支归约法,融合全局搜索与贪心启发,可高效训练近最优深度分类树,精度与扩展性俱佳。
开发用于从韩语发票中提取信息的OCR模型
提出深度学习与图像预处理结合的高效OCR模型,自动提取韩语发票信息,F1达87%,处理耗时极低。
对齐预测:从训练数据中预测失准
提出训练前预测对齐失败的任务与五千题基准;其预测脚手架优于基线,能筛出有害样本,但实践指导仍需改进。
共形对抗生成集成
提出CAGE,融合生成、对抗与共形预测,动态调权,提升时序预测可靠性,抗异常噪声优于传统集成。
通过门控与衰减的同策略蒸馏提升OCR忠实性
视觉语言模型改写异常文本会损害OCR忠实性;GAD-RL按学生表现门控并衰减教师蒸馏,提升转录保真度。
TRACE:面向肿瘤学大语言模型的可部署树-关系结构增强
TRACE以可更新树关系结构增强肿瘤学大模型,离线学习、在线检索证据,提升分类问答且可解释。
MoFlow:多目标智能体工作流生成
MoFlow以凸包蒙特卡洛树搜索生成多目标智能体工作流,一次搜索近似帕累托前沿,按偏好查询即可,无需重训。
GaugeVLM:以可测量的几何干预结构化空间监督
通过三维场景可控干预生成关联观测,将测量误差转为偏好边际,提升视觉语言模型空间推理与跨域泛化。
是组合,而非对话:VLM 丢失的是场景,而非线索
VLM 需正确组合呈现视觉证据;场景碎片化损害使用与定位,仅有充分证据不够。
AI 智能体易受激进化影响
模拟两个大模型对话发现,AI智能体能被同伴激进化,强化既有信念的共鸣效应强于劝说,并波及相关信念。
对齐数据可通过语境混淆导致失准
对齐数据会因语境混淆在其他情境诱发失准,需针对性对齐与全面后训练评估。
FD-VAD:面向流式全双工语音的语义端点检测
FD-VAD以因果音频语言推理实现无ASR流式语义端点检测,直接判定继续/停止,提升话轮结束召回。
拨动心弦!模态动态字体
提出模态动态字体:用字形固有振动模态驱动平滑动画,冻结视频扩散模型仅调幅相,形状运动解耦,优于基线。
激活条件化自蒸馏
提出ACSD,以正确与其余轨迹激活对比构建引导向量,无需参考答案或教师更新,五模型数学基准平均最优。
CARAT:材料大语言模型是在推理还是在背诵?
CARAT以八种匹配视图检验材料LLM:增益多因基线缺信息,模型常引用却不使用关系,经监督可学会。
评估提示扰动对大型语言模型偏见与幻觉的影响
评估提示扰动对LLM偏见与幻觉的影响:扰动可缓解部分模型问题,Claude 3优于GPT3.5。
探究引导式AI导师化解学生卡壳方式的差异
分析2万余学生回合发现:卡壳每加深一轮恢复概率降12.7%,追问效果递减,直指错误更有效。
超越模式崩溃:基于生成流网络生成多样化的合成专家对话
提出用生成流网络生成多样合成专家对话,覆盖更全、更真实,下游训练信号更强。
筛与智:面向可靠RALM弃答的高效干扰过滤
检索失败分为无答与干扰,轻量Sieve先滤除干扰证据,再由Sage生成或弃答,准确率与效率大幅提升。
从词汇基线到智能体式检索增强生成:基于SFIA框架的结构化技能与责任级别抽取
首个SFIA结构化技能与级别抽取基线:检索召回最多,生成更准,仅显式判级可靠,多智能体增益有限。
环境引导:利用数据流控制提升智能体效用与安全性
将智能体与环境状态建模为数据库表,运行时按策略校验数据流,违规即引导安全轨迹,攻击成功率为0%。
以智能体为自身优化器的多任务自演化执行框架
冻结模型兼任求解者与提议者,直接改写自身执行框架;多任务分阶段演化,域外泛化提升12.64分,超越Codex
Masked Swingers:利用数据增强推动自监督学习中的自编码器发展
提出掩码交换者:双增强分别掩码编码,交换CLS后解码,学视角无关表示,显著优于MAE。
ExploreNet:在扩散GRPO中学习何处探索
提出ExploreNet自适应探索扩散GRPO各潜变量噪声,生成质量提升14%,人类偏好胜率67.2%。
多模态大语言模型能否生成并检测多模态社交媒体假新闻?
多智能体框架生成9000余条跨领域假新闻图文,测评16个MLLM:多数检测远逊人类,难辨图像真伪。
FlashDiffusion:融合分块核谱分解
提出无矩阵 FlashDiffusion,在 GPU 融合分块中计算稠密高斯核,并用 β-flow 选尺度、逐级热启动谱求解。
DualCast:面向双模态金融时间序列预测的双路径语言模型
双路径框架以金融词元扩展冻结语言模型,快路径预测、慢路径结合新闻修正,金融时序预测多数最优。
改写感知代价甚微:视觉语言模型在 ε ≤ 4/255 下的定向语义替换
白盒定向语义替换在ε≤4/255内即可改写VLM感知,将源语义完全替换为目标语义,并出现语义融合。
面向水平集界面平流的无数据物理信息神经算子
无数据物理信息神经算子用于水平集界面平流,仅用输运残差与几何约束,无需参考解;精度逊监督,守恒更优。
学习语义修补以实现可动画的高斯头部化身
提出SInGA,在UV空间做语义修补补全单图未观测面部区域,回归高斯属性,无需逐身份优化即可动画。
AI 智能体能否重新发现 Blaschke 曲线不变量?
AI 在 Blaschke 曲线受控环境中重新发现不变量,高精度拟合三次式,但未证明优于多项式拟合。
受损的运动学特征:利用传感器数据与机器学习检测电动滑板车骑手的酒精中毒
骑手醉驾时转向与侧向加速度信号熵降、波动增大;机器学习识别醉驾准确率达85%,AUC 0.94。
用于视觉语言模型少样本分布外适应的归纳视觉逻辑
免训练归纳视觉逻辑:借VLM残存描述能力构建类别特征词典,实现远域分布外可解释分类。
当成功的记忆误导具身智能体:面向任务条件执行的记忆适配
MATE将检索轨迹适配为执行记忆:去冗余、提取条件-动作-效果、归一化动作,成功率93.3%。
TrackFish3D:基于多视角视频的鱼群自监督三维跟踪
TrackFish3D利用多视角几何自监督实现鱼群三维跟踪,无需身份标注,3D MOTA达95.8%,并可泛化至鸟类。
Hermes:学习上下文推理,解锁测试时扩展
提出可配置Hermes框架与两阶段Hermes-Learn,使模型学会分配和复用上下文,解锁测试时扩展并可泛化迁移。
SimTrace:面向在线用户建模的基于真实交互的多模态用户轨迹生成
SimTrace基于真实轨迹生成逼真细粒度多模态点击流,支持虚拟客户端与在线用户行为建模。
MetaPersona:基于实证社会科学的任务锚定合成人群
基于1.1万项实证研究提出MetaPersona框架,按任务检索证据并采样合成人群,单任务成本低于0.5美元。
NAQD-Env:语言智能体的选择性撤回基准
NAQD-Env评测语言智能体选择性撤回:三模型召回率≤0.06,无有效恢复,仅1例符合参考策略。
基于上下文选择与目标加权的扩散语言模型微调
GoldiMask以子模最大化选上下文并加权目标,提升扩散语言模型微调,在推理和代码生成上更优。
如何对LLM评判者做统计并信任其结果:面向小样本AI评估的校准推断与evalstats工具
小样本AI评估中,原始LLM评判分数易致假阳性;提出PPI等校准方法,开源evalstats工具。
ArgGYM:一个面向结构化可废止推理的程序化、引擎验证基准
ArgGYM将可废止推理拆为12项任务,以符号论证引擎验证,提供1440实例基准及RLVR训练环境。
自主智能体失控的竞争风险系统化框架
提出竞争风险框架,将智能体行为归为完成、安全停止、越界、继续,审计表明失控多源于持续越界与宽松环境
具有自适应锚点的函数空间 Transformer
提出函数空间Transformer,用自适应锚点递归精炼潜表示,在PDE与图像分类上超越基线。
PhyProbe:重新思考生成视频中的物理一致性评估
PhyProbe 用冻结时空编码器加轻量评分头,融合排序、回归与校准,评估生成视频物理一致性;多数基准领先,与人类判断高度一致,偏好评估也有竞争力。
Lookahead-R:基于执行中心规划的预算感知工具检索
Lookahead-R把工具检索变为预算约束序贯决策,用轻量世界模型预测成功率与延迟,借蒙特卡洛树搜索实现更优精度效率权衡。
车载对话助手多轮对话的自动化评估
提出闭环仿真框架,以策略引导用户模拟器和双层LLM评判自动评估车载助手多轮对话,识别更多失败类型。