突破边界:面向渐进式大语言模型演化的统一自学习框架
提出STRETCH框架,动态对齐难度,双角色协同进化,稳定训练并提升推理。
大小很重要:面向捷克语 HTML 文档的基础模型
154M参数HTML感知基础模型,基于1亿捷克网页多目标训练,性能超越更大模型并已投产。
选择靠检索,弃权则不然:面向70个韩英双语动作的端侧工具路由
在600个韩英请求、70个本地动作上,检索擅选工具但不擅弃权;弃权需神经编码器,端侧受延迟内存约束。
对齐、整合与发放:面向零样本语音大语言模型的高效词元级对齐
提出对齐连续整合发放框架,动态压缩声学帧至文本词元长度,无需LLM前向,单层蒸馏,零样本语音任务领先。
基于统计机器学习的英语与叙利亚语(东叙利亚方言)机器翻译
首个英-叙(东叙利亚方言)统计机器翻译模型,基于圣经语料,最佳BLEU 23.54,数据模型公开。
超越词频度量:上下文嵌入能否捕捉科学文本中的语义变化?
比较词频与上下文嵌入追踪科学文本语义变迁,二者互补,嵌入可发现词频遗漏的概念演进。
面向密集健康叙事的结构化主张级话语表示
提出主张级结构化话语表示框架,构建四领域1191条标注基准;大模型擅主题与立场,高维语用刻画仍难。
EviGen:面向可验证临床推理依据生成的预测性证据脚手架
EviGen 以预测归因检索证据为脚手架,助大模型生成临床推理并逐步验证,提升预测性能与忠实性。
PersonaPath:面向以知识为中心的个性化学习路径规划
提出PersonaPath基准,含2000学习者画像与347本教材知识图谱;评测显示大模型个性化路径规划适应性不足。
在不断变化的领域中追踪个体知识轨迹:以广义相对论与引力为例
通过比较研究者著述与领域文献,追踪广义相对论与引力五十位作者,发现语言、语义与引用轨迹分化。
HearInContext:语音识别中隐式上下文的基准测试
中英双语同音词基准含3764用例,微调Qwen3-ASR使隐式上下文目标召回提升约11个百分点。
面向低资源语言的自动化NER标注纠正可扩展框架
提出多步框架,结合自训练与双阈值迭代机制自动纠正NER标注噪声,显著提升低资源语言NER性能。
LocQE:利用后编辑实现本地化质量估计的原则性领域自适应
利用少量后编辑多任务微调,构建本地化质量估计模型,更好区分优劣译文。
ReFigBench:将科学图表重建为可编辑PowerPoint产物的基准测试
新基准用千张概览图评测科学图转可编辑幻灯片;感知是瓶颈,工作流与框架影响质量,保真与可编辑性难兼顾。
手语手形的零样本跨语言识别
首个零样本跨语言手形识别框架,利用五种共享音系特征从美国手语迁移至加泰罗尼亚手语,无需目标语视频标签。
长寿命角色,本地推理:面向游戏NPC的增量记忆维护
研究量化模型中游戏NPC的增量记忆维护:真尾更新保留循环状态与KV,实验保持关键绑定并避免语义错误。
LangSelect:面向LLM代码生成的成本感知目标语言路由
LangSelect按成本选目标语言、失败回退,实测token降50.3%,通过率92.9%。
超越结果:面向高效智能体基准测试的双视角关系学习
提出双视角关系学习,联合结果与过程信号压缩智能体基准,仅20任务达24–40倍压缩并提升评分预测。
对话式AI中的熵:作为可推断内在性的结构化不可预测性
提出“结构化不可预测性”概念,机制增加词汇新颖性,但未建立路径依赖。
一项人权价值几何?ECtHR-NPD:预测非金钱损害赔偿金额的基准
首个欧洲人权法院非金钱损害赔偿预测基准,含14,575案;先进模型未稳超基线,难判零赔偿并校准高额。
当审计质量无法预测下游效用:面向低资源非洲NLP的合成数据选择器反事实研究
在四种非洲语言上,审计质量排名与下游F1排名不一致,审计优的合成数据池未必提升下游效用。
MechSparse:机制引导的稀疏PEFT选择受任务塑造
因果选择器在信息抽取与翻译中均未胜出;结构主导任务宜用激活范数,因果得分适合内容主导任务。
面向IEC 61131-3梯形图程序形式化验证的基准套件与真值方法论
首个覆盖文本与梯形图的PLC形式化验证基准套件,含50程序83变体与形式属性、判定及违例见证,并提出三分真值方法。
WordPolo:通过迭代语义反馈评估语言模型
WordPolo以语义相似度反馈猜词,评估模型迭代推理,新进展指标揭示过度思考等问题,需兼顾过程与结果。
TalkMatrix:生成兼具一致性与多样性的角色对话
提出矩阵式联合选择,为角色—情境生成多候选,兼顾一致性与多样性,角色扮演实验优于基线。
目标 vs. 搜索:解构什么造就了好的分词器
解耦分词器的优化目标与搜索过程,发现搜索过程而非优化目标是主导因素:自底向上分词器比特/字节更低,但在BLiMP上无一致规律。
报告实践很重要:参考报告选择对胸部X光报告评估的影响
放射报告习惯差异会显著影响AI报告评估,甚至改变模型排名;提出ReRef改写参考并发布验证数据集。
在维基百科摘要上玩 log(N) 问题游戏:配对前沿模型间的通信效率
六款前沿模型配对玩log(N)问答博弈,胜率随文档集规模增大而下滑,每问信息量决定成败。
在LLM评估中利用内部表征监测与发现奖励作弊
研究发现,简单均值差向量能低成本检测大模型奖励作弊,并可借思维链提前预警。
ScienceIDE:将全球科学代码库转化为智能体可学习环境
将科学代码库转化为智能体可学习的可执行环境,支持任务生成与科学验证,训练PhAI-IDE系列模型,实现能力正向迁移。
字里行间:大语言模型能否发现文本背后的问题?
提出"问题考古"任务,推断催生文本的原始问题;新数据集评测显示,当前大模型在该任务上已超越人类。
大语言模型偏好对齐的零阶范式
提出零阶偏好对齐法ComPO,基于比较oracle,离线收敛、在线KL控制,实验优于直接对齐并缓解似然位移。
Safety-Flag:面向大语言模型内容审核器可靠性与校准的统一基准
统一七大安全基准评测十个模型,发现准确率掩盖错误方向、模型普遍过度自信,置信度弃权可降低选择性风险。
面向生物医学关系抽取的大语言模型基准评测
在SNPPhenA语料上评测MLM、混合架构与主流大模型,覆盖句子级、摘要级及关联强度分类;O1少样本刷新句子级与摘要级SOTA,微调Gemini 2.0 Pro关联强度最佳(F1 0.60)。
MIRAGE:对话状态如何塑造多模态个人智能体中的历史证据使用
历史证据使用随状态非线性变化,压缩前后失效不同,开源模型依赖上下文,检索压力压缩后反退化,按状态评估。
PageRecall:衡量基于文献的问答中的页面选择
证据定位瓶颈在检索而非阅读;改为整篇输入论文后页面召回率达100%,论文F1为0.762。
相关性引导的多编码器大型音频语言模型编码器选择
提出CUES:用编码器间性能相关性估计互补性,无需融合训练即可选组合,多基准上超越单编码器。
ActionPiece:重新思考自回归视觉-语言-动作模型的动作标记化
提出物理秩一致性PRC与ActionPiece,以保序监督优化动作标记化,提升VLA策略成功率。
通过适配器唤醒编码器:语音大语言模型的有效领域自适应微调
EAVA在语音编码器各层插入适配器单独训练,再用LoRA联合微调,提升儿语和方言等域偏移ASR性能。
G-Mamba:面向音视频语音增强的稀疏图引导 Mamba
提出稀疏图引导 Mamba 框架,以线性复杂度建模跨模态关系,实现轻量高效、鲁棒的音视频语音增强。
基于大语言模型的关系引导用例建模
提出FlowGen,利用LLM语义处理与语义关系图自动构建用例基本流、分支点与备选流,性能全面超越强基线。
M²Tok:面向视觉-语言-动作模型的多头多码本离散动作标记化
提出多头多码本动作标记器M²Tok,降低离散化重建损失并提升VLA模型成功率。
《生成式物理人工智能全面综述》
综述生成式物理AI,梳理机器人基础模型、视觉语言动作模型等五类架构,剖析应用局限并展望仿真到现实迁移。
理解本地服务市场中的AI服务提供者推荐
审计百大都会区四类注册服务:AI无检索时多编造,有检索则多匹配真实提供者,可信度取决于检索配置。
分而治之:信息丰富有序空间中用于视频多模态情感分析的瓶颈专家混合
将视频多模态情感分析重构为有序回归,分解极性与强度,提出瓶颈专家混合框架,借信息瓶颈与路由融合提升性能。
FRAUDSkill:面向音频反欺诈检测的结构化冻结权重技能优化
FRAUDSkill冻结音频语言模型,仅优化外部技能与决策规则,Macro-F1达73.50%,无效输出降至1.94%。
“你是专家标注员”:面向情绪强度建模的自动最佳-最差标度标注
自动标注情绪强度:最佳-最差标度法可靠性最高,基于其微调的回归器接近人工标注模型。
RankGround:基于轻量级重排序器引导裁剪选择的高效高分辨率GUI定位
RankGround用轻量级重排序器从密集候选中选出最优裁剪,单次VLM调用即实现高精度GUI定位,推理快1.4倍,精度平均提升5.5%。
“如果我只能买一个:Galaxy S26 Ultra”:审计AI生成的产品推荐
审计主流AI聊天机器人的购物建议,发现其推荐偏好、来源差异显著且不稳定,需独立审计。
TeleAntiFraud 2.0:一个可刷新、基于画像、面向音频的电信诈骗检测基准
提出可月度冻结更新的音频电信诈骗基准,引入画像驱动的近域非诈骗负例,揭示类别先验捷径与预测崩塌。