ClusterFewshot:面向大语言模型工作流的少样本优化改进
结合语义聚类与效用评分构建代表性少样本示例,显著降低LLM工作流优化成本并提升准确率。
证候、协同与安全:面向中医处方生成的结构化推理与知识驱动对齐
针对中医处方生成中推理、随访调整与安全禁忌三大缺口,提出四阶段框架显著提升处方质量。
基于测试驱动的LLM智能体轨迹早期结果预测可靠性审计:目标特定校准迁移在单一基准内持续存在
审计显示,LLM智能体轨迹早期预测仅在两个特定目标组合出现持续校准迁移误差,跨基准未复现。
基于零空间基LoRA的强化学习后大模型推理保持微调
提出NB-LoRA,将LoRA更新经推理激活的近似零空间重参数化,微调后RL大模型时保持其推理能力,适配性能不降。
行为特质渗入偏好:诊断LLM用户模拟器中的特质干扰
LLM用户模拟器中活跃度特质干扰偏好、虚高评分;PQA以个性化质量锚点提前退出低质页,提升可靠性。
评估编码智能体生成内核漏洞利用原语的能力
提出KEX-bench基准:45项Linux/Windows内核利用原语任务;无参考PoC时最强配置仅解1/20个Windows、14/25个Linux任务,有PoC解31/45,瓶颈不在触发崩溃而在构造原语。
均值速度匹配:重新思考扩散模型中的生成动力学
提出均值速度匹配,实现单场参数化随机反向动力学,统一随机与确定性采样,生成质量有竞争力。
MemoryAthena:潜在记忆与生成记忆上的自适应路由
MemoryAthena以直接检索为锚,自适应路由生成记忆,问答与通用NLP任务平均分均提升。
ARAFA:一个由大语言模型生成的阿拉伯语事实核查数据集
大规模阿拉伯语事实核查数据集Arafa,含18万条声明-证据对,LLM三步构建,微调模型F1达77%。
自动定理证明中面向搜索的生成器直接优化
将计算对齐训练扩展至树搜索,提出搜索感知与均匀分配损失,在Lean基准上超越交叉熵并随测试算力扩展。
ArticleMiner:本体引导的科学出版物知识图谱构建
提出ArticleMiner:任务模块定义领域语义,融合多解析器与LLM证据构建知识图谱,163篇论文上优于同LLM基线。
BELXTR:基于上下文化词元检索的生物医学实体链接
提出BELXTR多向量模型,借词元级匹配改进生物医学实体链接,多语料平均提升5pp召回率。
冰岛手语孤立手语识别:低资源场景下的实验
首个冰岛手语孤立识别研究:数据极稀缺(849类中86%仅两样本),跨语言迁移(美手语预训练)使准确率提升14–24个百分点,多语言训练亦大幅增益。
思维之梯:逐步简化推理轨迹的自进化课程
LoT框架融合渐进式问题重写与自进化课程,显著提升中小模型数学与多跳推理,优于知识蒸馏。
结肠镜检查中假阳性计算机辅助检测提示的注视反应:一项配对视频与实时眼动追踪研究
假阳性CADe提示常吸引内镜医师注视,占位中位约1秒,远超提示时长,注意负担应纳入评估与设计。
知情掩码:面向扩散大语言模型强化学习的结构感知扰动
提出知情掩码,按去噪轨迹为token打分,偏向掩码下游token,提升dLLM强化学习效果与稳定性。
重新审视基于长度的训练:语音标记语言模型中的批次组成与损失归一化
固定批次组成与标记暴露后,短到长排序无独立收益;首轮分组增益仅见于批均值损失,与标记权重相关。
半监督联邦ASR的实用方案:在线伪标签与服务器更新稳定化
半监督联邦ASR中,在线伪标签需服务器标注数据更新稳定训练;两轴耦合,稳定化决定收敛并缩小与全监督差距。
《Transformer 注意力头在寻找顺序》
证明检测比特序列是否有序:单头单层Transformer不可为,双头单层可为,模型含输出MLP。
HappyWorld-Bench:世界模型综合评估基准
提出HappyWorld-Bench,从视频、空间、具身三轨道评估世界模型的交互可靠性与一致性。
DefaultGNN:基于买卖双方交易网络预测企业违约的双视角图神经网络框架
提出双视角GNN框架DefaultGNN,从买卖交易网络预测企业违约,优于基线,审批率提升7-11个百分点。
PermuFormer:代数组合学中排列表示的多任务预训练
提出PermuFormer以28亿词元多任务预训练,为代数组合学排列任务提供微调起点,并分析内部机制
ChatT2:一种用于开发面向天然产物领域研究的大语言模型智能体的自适应框架
ChatT2是基于大语言模型的多智能体框架,面向细菌II型聚酮等天然产物研究,助力专家与新手。
Document Retrieval-Aware Chunking (D-RAC): Universal Retrieval-Aware Ingestion of Enterprise Documents via PDF Normalization and Multimodal Markdown Conversion
DiaSeg:从DTW路径中提取对角片段用于可解释步态分析
DiaSeg从DTW路径提取对角片段,以五种几何特征实现可解释步态分析,定位步态周期中的协调断裂。
超越情感提示词:由效价-唤醒-支配度驱动的细粒度文本到图像生成
提出EMOTRANS,将VAD坐标转为独立于内容文本、跨去噪阶段调制的生成条件,并构建EMOVAD数据集,实现细粒度情感控制。
对arXiv:2512.07881和arXiv:2601.06104关于人类语言与AI生成语言中量子结构的评论的回复
回复两评论,回应大模型实验探索性、纠缠判定、玻色-爱因斯坦拟合、能级与量子空间等质疑,并更正笔误。
IMPLICIT-Bench:衡量中性提示下文本到图像模型的隐性偏见
构建IMPLICIT-Bench基准(11类偏见、5493条提示),揭示文生图模型在中性提示下的系统性隐性偏见,并发现去偏与语义保真度的权衡。
看向关键之处:一种免费、免标注的视觉证据信号,助力细粒度视觉语言推理
提出对比证据差信号,无需训练与标注即可定位答案区域,细粒度准确率由70%升至85%,并能识别自信错误。
终端收缩平均揭示LLM预训练中的调度-估计器交互
提出终端收缩平均TSA,插值末次迭代与近期检查点,揭示其与学习率调度交互,提升验证质量、加速训练。
Classifier-Free Guidance in Flow Matching: Non-Autonomous Potentials, Overshoot, and Posterior-Mean Control
SRPR-Net:面向自动SAM实例分割的语义与关系提示精炼
提出SRPR-Net,以序贯提示精炼融入视觉语言语义与实例依赖,实现自动SAM实例分割的上下文感知框调整,性能优于现有方法。
面向双曲视觉语言模型的分层提示学习
为冻结双曲视觉语言模型引入分层提示学习插件,借父类提示与双曲蕴含正则,提升泛化与迁移。
针对智能电表隐私的多样化推理攻击学习防御策略
提出代理引导分层强化学习,用电池负载塑形防御未知NILM攻击,跨模型/电器泛化,RMSE显著提升、F1显著下降。
p 进模型的连续优化
提出首个 p 进模型连续梯度下降法,用 Berkovich 仿射线支持优化与反传,可学模运算。
ChartJudgeBench:面向图表到代码生成的LMM评判器评估基准
提出ChartJudgeBench基准,评估发现LMM评判器存在位置偏见、过度接受与宽松偏差。
用于测试时扩展的爬山采样:重复采样、进化和训练的一种简单且更优的替代方案
提出爬山采样:反复以当前最优程序为条件采样编辑,简单测试时扩展,优于重复采样、进化和测试时训练。
面向表格基础模型的 JEPA 配方
提出 JEPA 表格基础模型训练配方,使潜变量项稳定收敛,但在147个数据集上仍逊于仅值目标且更慢。
SambaGraph:用于足球战术响应建模的动作-反应时空图
基于2022世界杯数据构建足球战术响应建模时空图数据集与基准。
EMGBlend:面向手势与力解码的异构感知自监督预训练
EMGBlend以几何注意力、频带受限目标和源平衡融合多源异构肌电数据,自监督预训练提升手势与力解码。
SpecialEduBench:面向自闭症儿童语言干预中知识、技能与态度的视觉语言模型基准评测
推出SpecialEduBench,从知识、技能、态度评测视觉语言模型在自闭症儿童语言干预中的教学能力,八款前沿模型均未饱和。
所见非所感:合成消费者何时能、何时不能预测试视觉营销
合成消费者预测试视觉营销效应复现差,且低估消费者异质性,需校准干预部署协议。
模态门控深度适配器:以精确保持方式为冻结嵌入模型添加模态
提出模态门控深度适配器,为冻结嵌入模型新增模态且原输出逐位不变,音频和热成像检索显著提升。
ToolCompass:引导工具试用,而非抑制试用
提出后训练框架ToolCompass,按功能组织工具调用表示,引导试用并迁移至相似未见工具,实验显著提升。
有品味的智能体:长时程任务中品味的度量与提升
提出Taste-Bench评测长时程决策品味,顶尖模型仅59.7%;品味可蒸馏训练,提升未见任务表现。
任务状态对 LLM 智能体的影响应有多强?
四种状态传递强度对比:展示状态不可靠,自写台账反优于清单;指令效果取决于模型服从度;强制执行无需服从,却受状态与匹配正确性所限。
TSS:面向领域特定大语言模型投机解码的目标端稀疏化
TSS提出目标端稀疏化,跳过部分目标层以降低验证成本,提升草稿接受率与任务性能,翻译任务提速1.68倍。
OmniFysics-Nano-V2 技术报告:跨模态理解物理世界
提出紧凑全模态模型,结合物理感知数据管线与两阶段强化学习,21项基准中17项领先,提升物理世界理解。
幅度轮廓剪枝:面向Transformer压缩的免校准结构化注意力头移除
提出幅度轮廓评分,通过权重行范数离群检测免校准剪枝注意力头,MP-G适配GQA,零数据与梯度开销,性能优于校准依赖基线。
TCMaster:面向多源中医药知识图谱的置信度感知查询与工作负载引导物理设计
TCMaster实现多源中医药知识图谱的置信度感知查询与负载引导物理设计,显著加速查询并提升问答准确率