概率性文本时间序列抑郁症检测
提出PTTSD概率框架,预测抑郁症严重度并建模校准不确定性,性能竞争且预测区间可靠。
AugServe:增强型大语言模型推理服务的自适应请求调度
AugServe通过两阶段自适应调度和动态批处理,提升增强型LLM推理的有效吞吐量,大幅降低延迟。
QQ:多语言自然语言处理的元数据工具包
多语言NLP元数据工具包,支持语言标识标准化、元数据检索与资源联动发现。
潜在思维调优:在潜在标记中融合上下文与推理信息
提出LT-Tuning框架,融合上下文隐藏状态与词汇语义指导,缓解特征塌陷,实现稳健潜在推理。
迷失在反向传播中:语言模型头部是梯度瓶颈
语言模型输出层梯度瓶颈导致95%以上梯度信息丢失,造成优化方向次优,需改进头部设计。
分层思维链:提升大语言模型推理性能与效率
Hi-CoT通过分层子步骤,提升大模型推理准确率6.2%,缩短推理链长度13.9%。
RELISH:基于潜在迭代状态头的LLM回归
提出轻量级架构,通过迭代潜在状态和线性回归,从冻结LLM直接预测标量,性能优且参数极少。
对比弱到强泛化
提出ConG框架,利用对比解码去噪,提升弱到强模型的泛化鲁棒性,实验验证有效。
通过对话对齐世界模型的具身多智能体协调
对话减少动作冲突但降低成功率,需评估世界模型真实对齐程度。
超越黑盒混淆:白盒监控的机制分析与防御
揭示LLM白盒监控规避机制(几何移位与协方差操纵),SafetyNet集成防御实现近100% AUROC。
是看不见还是不知道?视觉-语言模型中错误的归因
提出解耦VLM失败模式的框架,发现预生成信号可预测失败源,支持定向干预。
基于多智能体系统与微调小语言模型的电信网络自动故障排除
提出多智能体系统框架,结合微调小语言模型自动诊断故障并推荐修复方案,显著加速电信网络故障排除。
铭记你的痕迹:面向一致性与层次化仓库级代码文档的记忆引导长时程智能体框架
MemDocAgent利用共享记忆积累痕迹,实现仓库级代码文档的一致层次化生成。
When Debiasing Backfires: Counterintuitive Side Effects of Preprocessing-Based Stereotype Mitigation
通过人类-大语言模型协作构建可扩展且文化特定的刻板印象数据集
提出人机协作标注框架,构建西班牙语刻板印象数据集,捕捉文化特定偏见,揭示模型跨国家差异,可扩展至多语言。
幻觉自我博弈:通过进化生成器引导强化检测器
HSP框架通过检测器与生成器自我博弈,强化学习迭代提升,使小模型媲美先进LLM,无需外部监督。
一种基于MiniLM嵌入的多簇边界学习方法用于范围外意图检测
提出多簇边界学习法,利用MiniLM嵌入在单类分类中检测范围外意图,三数据集达最优性能。
面向全双工语音助手的LALM音频评判器可靠性评估
评估Gemini模型作为全双工语音对话音频评判器的可靠性,结果支持替代人类评分,成本降低两个数量级。
当不合理令牌被强化:面向LLM强化学习的尾部感知信用校准
TACO通过尾部风险校准正信用,抑制低概率错误令牌被强化,提升LLM推理训练稳定性与性能。
从解题器到研究:大语言模型驱动的前沿形式化数学
综述AI4Math,指出需从解题器转向研究智能体,识别数据集等局限并给出路线图。
揭示公众舆论:基于LSTM与传统模型的情感分析研究
LSTM在Twitter情感分析中达90.98%训练准确率、80%测试准确率、0.92 ROC-AUC,优于传统模型。
DeepSearch-World:可验证环境中深度搜索智能体的自蒸馏
提出自蒸馏框架DeepSearch-Evolve,基于可验证环境DeepSearch-World,无需教师模型即可实现长程web智能体自我进化,性能领先。
How Do I Know What to Say Next? Barenholtz's Autogenerative Theory as an Enrichment of Harrisean Integrationism
从执行到教育:一种基于布鲁姆分类法的LLM教育控制度量框架
提出布鲁姆对齐框架度量LLM教育控制,发现模型能提升但难降低认知需求,执行强不等同教育控制。
COALA:基于对比正则化和偏置得分估计的鲁棒上下文感知语音增强语言模型(用于ASR)
COALA框架通过映射语音表示量化匹配,解决多目标训练崩溃,提升ASR上下文偏置性能。
低延迟系统中的工具制作与自进化LLM智能体
将重复步骤预编译为版本化工具,降低延迟42%、错误率53%,实现自进化以提升工业LLM系统可靠性与效率。
基于幂变换和保持符号的分数聚合与自适应特征保留的大语言模型结构化剪枝
通过幂变换、符号保留聚合和异常值去除,解决结构化剪枝中的分布与符号问题,保持精度并实现加速。
PLURAL:一个面向价值观对齐的全球数据集
PLURAL基于全球调查构建价值观偏好数据集,训练后可减少27.7%误差,提升文化代表性。
LLM的逻辑可信吗?基于图的框架量化不确定性、一致性与鲁棒性
提出GRAPHEVAL框架和GRCS指标,量化LLM推理一致性并与忠实性负相关,GSC解码提升忠实性并暴露自一致性缺陷。
中文标题:大语言模型预测器知道却不言说:通过探查内部表征实现校准与忠实性
摘要:探针可从模型内部表征中更好校准预测、检测不忠实推理,且推理前答案已固定,可节省30-47%生成成本。
全息神经概率上下文无关文法用于无监督句法分析
提出Hol-PCFG,用全息嵌入代数建模规则概率,参数减少99.94%,六种语言达SOTA,可直接解析日语字符。
MASTE:面向零样本方面情感三元组提取的多智能体流水线
提出多智能体流水线MASTE,分解ASTE为四阶段,零样本无训练,大幅超越基线,逼近全监督方法。
COBART: 受控、优化、双向自回归Transformer用于广告标题生成
提出前缀控制标记与BART微调方法,可调控标题长度,点击率与Rouge-L分别提升5.82%和25.82%。
XALPHA:记忆驱动的AI量化研究员,实现从假设到代码的Alpha发现
XAlpha以多源记忆系统驱动假设到代码闭环验证,在CSI300上取得更优Alpha发现性能。
说话人分割引导的Qwen-ASR自适应用于多语言双说话人对话语音
结合说话人分割和Qwen-ASR,通过监督微调、合成语音LoRA及强化学习,将tcpMER降至17.97。
TypeProbe:从预训练代码模型的隐藏状态中重构类型表示
使用平行数据集探测预训练代码模型内部类型表示,发现跨语言类型表示可从无类型代码中线性解码,且具鲁棒性。
最佳N选一TTS评估受到ASR系列对齐混淆
ASR系列对齐导致评估偏差,跨家族排名集成将WER降至1.61%
越南高地、三角洲和海岸的回响:占语、高棉语和岱侬语的多语言语料库
提出CKTN语料库及脚本感知适应方法,减少多语言编码器碎片化,提升分类性能并揭示词汇检索局限。
LEXIC:通过注入复杂性实现的轻量级眼动追踪扩展
通过注入词级难度信号,两种轻量级机制使纯眼动模型在阅读理解预测中AUROC提升1.8-2.9个百分点。
ICDAR 2026 HIPE-OCRepair竞赛:基于大语言模型的历史文档OCR后校正
ICDAR竞赛评估大语言模型辅助历史文档OCR后校正,多语言数据集显示可提升质量但存在过度校正问题。
SQuaD-SQL:基于大语言模型指导的知识蒸馏实现小型语言模型高效文本到SQL
本文提出SQuaD-SQL方法,通过知识蒸馏让小模型接近大模型性能,在WikiSQL上达86.9%准确率,效率更高。
大规模隐式解码:大型语言模型的潜在计算扩展
提出隐藏解码方法,通过序列长度扩展增加计算,首次在百亿参数MoE模型上验证,实现固定骨干网络的性能提升。
SEC 8-K文件有依据事件提取与细粒度分类体系
两阶段系统从SEC 8-K文件提取119类有依据事件,质量评分精确度达96%,有效区分经济事件。
LLM拒答的两个维度:答案正确性与问题可回答性
LLM拒答需区分答案正确与问题可答,隐藏态探针可识别,但模型自报失效;校准策略分开控制,优于单阈值。
UltraX:通过自适应程序化编辑大规模优化预训练数据
UltraX提出函数调用框架,通过插入、删除、修改实现细粒度实例级编辑,提升大规模预训练数据优化效率与可靠性。
人格识别中基于大语言模型裁判的理论无关自适应度量对齐原型网络
提出JAM框架,利用LLM裁判与原型网络实现理论无关人格识别,提升跨框架泛化性能。
当只有合成语音可用时:请调用GRPO
GRPO强化学习在仅用合成语音时比监督微调降低词错误率40%,改善校准与对齐。
基于激活聚合的提示压缩
通过加权激活和将提示信息压缩为单向量注入模型,准确率下降<2%,揭示激活空间跨层兼容性与语义编码结构。
使用ESBMC-PLC+检测IEC 61131-3 PLC程序中的梯形逻辑炸弹:一种带有触发综合的形式化验证方法
提出ESBMC-LLB形式化验证检测PLC梯形逻辑炸弹,恢复触发条件,检测率99%且无假阳性。
当法官改变,测量也随之改变:审计LLM作为裁判的可靠性
审计LLM裁判可靠性:评估者变更引起评分偏移,升级型号效果不互通,强模型仅减小偏差而未消除,需含偏差探测等审计。