59515 条条目 · 106 个活跃源
2026年10月1日
04:00
arXiv cs.CV

评估多任务形态学概念学习在3D CT肺结节恶性评估中的作用

基于LIDC-IDRI数据比较单任务与多任务3D CNN,发现联合学习毛刺、分叶等形态特征未明显提升恶性风险分类,类别失衡与标注结构是关键。

04:00
arXiv cs.LG

使用机器学习预测供应链管理中的运输时间

利用机器学习与深度学习,基于历史数据构建模型精准预测供应链运输时间,提升物流效率。

04:00
ArXiv AI

AREX-2:通过长时程反思任务推进自我改进智能体

AREX-2用长时程反思数据训练智能体,在MLE-bench等基准表现优异并可随迭代持续提升。

04:00
arXiv cs.LG

深度分类树的移动时域近似分支归约方法

提出移动时域近似分支归约法,融合全局搜索与贪心启发,可高效训练近最优深度分类树,精度与扩展性俱佳。

04:00
arXiv cs.CL

开发用于从韩语发票中提取信息的OCR模型

提出深度学习与图像预处理结合的高效OCR模型,自动提取韩语发票信息,F1达87%,处理耗时极低。

04:00
arXiv cs.CL

对齐预测:从训练数据中预测失准

提出训练前预测对齐失败的任务与五千题基准;其预测脚手架优于基线,能筛出有害样本,但实践指导仍需改进。

04:00
arXiv cs.LG

共形对抗生成集成

提出CAGE,融合生成、对抗与共形预测,动态调权,提升时序预测可靠性,抗异常噪声优于传统集成。

04:00
arXiv cs.AI

通过门控与衰减的同策略蒸馏提升OCR忠实性

视觉语言模型改写异常文本会损害OCR忠实性;GAD-RL按学生表现门控并衰减教师蒸馏,提升转录保真度。

04:00
arXiv cs.CL

TRACE:面向肿瘤学大语言模型的可部署树-关系结构增强

TRACE以可更新树关系结构增强肿瘤学大模型,离线学习、在线检索证据,提升分类问答且可解释。

04:00
ArXiv AI

MoFlow:多目标智能体工作流生成

MoFlow以凸包蒙特卡洛树搜索生成多目标智能体工作流,一次搜索近似帕累托前沿,按偏好查询即可,无需重训。

04:00
arXiv cs.CV

GaugeVLM:以可测量的几何干预结构化空间监督

通过三维场景可控干预生成关联观测,将测量误差转为偏好边际,提升视觉语言模型空间推理与跨域泛化。

04:00
arXiv cs.CV

是组合,而非对话:VLM 丢失的是场景,而非线索

VLM 需正确组合呈现视觉证据;场景碎片化损害使用与定位,仅有充分证据不够。

04:00
arXiv cs.AI

AI 智能体易受激进化影响

模拟两个大模型对话发现,AI智能体能被同伴激进化,强化既有信念的共鸣效应强于劝说,并波及相关信念。

04:00
ArXiv AI

对齐数据可通过语境混淆导致失准

对齐数据会因语境混淆在其他情境诱发失准,需针对性对齐与全面后训练评估。

04:00
arXiv cs.CL

FD-VAD:面向流式全双工语音的语义端点检测

FD-VAD以因果音频语言推理实现无ASR流式语义端点检测,直接判定继续/停止,提升话轮结束召回。

04:00
arXiv cs.CV

拨动心弦!模态动态字体

提出模态动态字体:用字形固有振动模态驱动平滑动画,冻结视频扩散模型仅调幅相,形状运动解耦,优于基线。

04:00
arXiv cs.LG

激活条件化自蒸馏

提出ACSD,以正确与其余轨迹激活对比构建引导向量,无需参考答案或教师更新,五模型数学基准平均最优。

04:00
arXiv cs.AI

CARAT:材料大语言模型是在推理还是在背诵?

CARAT以八种匹配视图检验材料LLM:增益多因基线缺信息,模型常引用却不使用关系,经监督可学会。

04:00
arXiv cs.CL

评估提示扰动对大型语言模型偏见与幻觉的影响

评估提示扰动对LLM偏见与幻觉的影响:扰动可缓解部分模型问题,Claude 3优于GPT3.5。

04:00
ArXiv AI

探究引导式AI导师化解学生卡壳方式的差异

分析2万余学生回合发现:卡壳每加深一轮恢复概率降12.7%,追问效果递减,直指错误更有效。

04:00
ArXiv AI

超越模式崩溃:基于生成流网络生成多样化的合成专家对话

提出用生成流网络生成多样合成专家对话,覆盖更全、更真实,下游训练信号更强。

04:00
arXiv cs.CL

筛与智:面向可靠RALM弃答的高效干扰过滤

检索失败分为无答与干扰,轻量Sieve先滤除干扰证据,再由Sage生成或弃答,准确率与效率大幅提升。

04:00
arXiv cs.CL

从词汇基线到智能体式检索增强生成:基于SFIA框架的结构化技能与责任级别抽取

首个SFIA结构化技能与级别抽取基线:检索召回最多,生成更准,仅显式判级可靠,多智能体增益有限。

04:00
arXiv cs.CL

环境引导:利用数据流控制提升智能体效用与安全性

将智能体与环境状态建模为数据库表,运行时按策略校验数据流,违规即引导安全轨迹,攻击成功率为0%。

04:00
ArXiv AI

以智能体为自身优化器的多任务自演化执行框架

冻结模型兼任求解者与提议者,直接改写自身执行框架;多任务分阶段演化,域外泛化提升12.64分,超越Codex

04:00
arXiv cs.CV

Masked Swingers:利用数据增强推动自监督学习中的自编码器发展

提出掩码交换者:双增强分别掩码编码,交换CLS后解码,学视角无关表示,显著优于MAE。

04:00
arXiv cs.CV

ExploreNet:在扩散GRPO中学习何处探索

提出ExploreNet自适应探索扩散GRPO各潜变量噪声,生成质量提升14%,人类偏好胜率67.2%。

04:00
arXiv cs.CL

多模态大语言模型能否生成并检测多模态社交媒体假新闻?

多智能体框架生成9000余条跨领域假新闻图文,测评16个MLLM:多数检测远逊人类,难辨图像真伪。

04:00
arXiv cs.LG

FlashDiffusion:融合分块核谱分解

提出无矩阵 FlashDiffusion,在 GPU 融合分块中计算稠密高斯核,并用 β-flow 选尺度、逐级热启动谱求解。

04:00
arXiv cs.LG

DualCast:面向双模态金融时间序列预测的双路径语言模型

双路径框架以金融词元扩展冻结语言模型,快路径预测、慢路径结合新闻修正,金融时序预测多数最优。

04:00
arXiv cs.CV

改写感知代价甚微:视觉语言模型在 ε ≤ 4/255 下的定向语义替换

白盒定向语义替换在ε≤4/255内即可改写VLM感知,将源语义完全替换为目标语义,并出现语义融合。

04:00
arXiv cs.LG

面向水平集界面平流的无数据物理信息神经算子

无数据物理信息神经算子用于水平集界面平流,仅用输运残差与几何约束,无需参考解;精度逊监督,守恒更优。

04:00
arXiv cs.CV

学习语义修补以实现可动画的高斯头部化身

提出SInGA,在UV空间做语义修补补全单图未观测面部区域,回归高斯属性,无需逐身份优化即可动画。

04:00
ArXiv AI

AI 智能体能否重新发现 Blaschke 曲线不变量?

AI 在 Blaschke 曲线受控环境中重新发现不变量,高精度拟合三次式,但未证明优于多项式拟合。

04:00
arXiv cs.LG

受损的运动学特征:利用传感器数据与机器学习检测电动滑板车骑手的酒精中毒

骑手醉驾时转向与侧向加速度信号熵降、波动增大;机器学习识别醉驾准确率达85%,AUC 0.94。

04:00
arXiv cs.CV

用于视觉语言模型少样本分布外适应的归纳视觉逻辑

免训练归纳视觉逻辑:借VLM残存描述能力构建类别特征词典,实现远域分布外可解释分类。

04:00
arXiv cs.CL

当成功的记忆误导具身智能体:面向任务条件执行的记忆适配

MATE将检索轨迹适配为执行记忆:去冗余、提取条件-动作-效果、归一化动作,成功率93.3%。

04:00
arXiv cs.CV

TrackFish3D:基于多视角视频的鱼群自监督三维跟踪

TrackFish3D利用多视角几何自监督实现鱼群三维跟踪,无需身份标注,3D MOTA达95.8%,并可泛化至鸟类。

04:00
arXiv cs.LG

Hermes:学习上下文推理,解锁测试时扩展

提出可配置Hermes框架与两阶段Hermes-Learn,使模型学会分配和复用上下文,解锁测试时扩展并可泛化迁移。

04:00
ArXiv AI

SimTrace:面向在线用户建模的基于真实交互的多模态用户轨迹生成

SimTrace基于真实轨迹生成逼真细粒度多模态点击流,支持虚拟客户端与在线用户行为建模。

04:00
ArXiv AI

MetaPersona:基于实证社会科学的任务锚定合成人群

基于1.1万项实证研究提出MetaPersona框架,按任务检索证据并采样合成人群,单任务成本低于0.5美元。

04:00
arXiv cs.AI

NAQD-Env:语言智能体的选择性撤回基准

NAQD-Env评测语言智能体选择性撤回:三模型召回率≤0.06,无有效恢复,仅1例符合参考策略。

04:00
arXiv cs.AI

基于上下文选择与目标加权的扩散语言模型微调

GoldiMask以子模最大化选上下文并加权目标,提升扩散语言模型微调,在推理和代码生成上更优。

04:00
arXiv cs.CL

如何对LLM评判者做统计并信任其结果:面向小样本AI评估的校准推断与evalstats工具

小样本AI评估中,原始LLM评判分数易致假阳性;提出PPI等校准方法,开源evalstats工具。

04:00
ArXiv AI

ArgGYM:一个面向结构化可废止推理的程序化、引擎验证基准

ArgGYM将可废止推理拆为12项任务,以符号论证引擎验证,提供1440实例基准及RLVR训练环境。

04:00
ArXiv AI

自主智能体失控的竞争风险系统化框架

提出竞争风险框架,将智能体行为归为完成、安全停止、越界、继续,审计表明失控多源于持续越界与宽松环境

04:00
arXiv cs.LG

具有自适应锚点的函数空间 Transformer

提出函数空间Transformer,用自适应锚点递归精炼潜表示,在PDE与图像分类上超越基线。

04:00
arXiv cs.CV

PhyProbe:重新思考生成视频中的物理一致性评估

PhyProbe 用冻结时空编码器加轻量评分头,融合排序、回归与校准,评估生成视频物理一致性;多数基准领先,与人类判断高度一致,偏好评估也有竞争力。

04:00
arXiv cs.CL

Lookahead-R:基于执行中心规划的预算感知工具检索

Lookahead-R把工具检索变为预算约束序贯决策,用轻量世界模型预测成功率与延迟,借蒙特卡洛树搜索实现更优精度效率权衡。

04:00
arXiv cs.CL

车载对话助手多轮对话的自动化评估

提出闭环仿真框架,以策略引导用户模拟器和双层LLM评判自动评估车载助手多轮对话,识别更多失败类型。