通过可扩展查找的条件记忆:大语言模型稀疏性的新维度
提出条件记忆(Engram)作为稀疏性新轴,实现O(1)查找并发现U形缩放定律,在27B参数上显著提升推理与长上下文检索能力。
基于大语言模型驱动的代码演化的认知Alpha挖掘
提出CogAlpha框架,结合LLM推理与代码进化,扩大搜索空间,在多市场股票数据上实现更优的Alpha发现。
语义感知与敏感性:探究语义回忆对长上下文代码理解的影响
大模型语义回忆能力在长上下文中严重退化,依赖模式匹配捷径,新任务SemTrace显示准确率下降92.73%。
destroR:在保持语义攻击下针对孟加拉语迁移模型的基准测试与对抗训练防御
提出三种语义保持攻击、基准测试和对抗训练,发现词替换攻击更有效,对抗训练提升鲁棒性,多语言模型更鲁棒。
REAL:解读Transformer激活以精确定位语言模型操控模块
REAL框架量化模块行为相关性,精准选择操控模块,平均提升20%效果,且具备零样本泛化能力。
PiCSAR:面向推理链的概率置信度选择与排序
PiCSAR通过联合对数似然评分(分解为推理和答案置信度)选择推理链,无需训练,大幅提升LLM/LRM推理准确性。
BiasLab: 面向LLM偏差测量的多语言双框架框架,应用于职场与HR场景
BiasLab提出多语言双框架,量化LLM输出偏差,发现模型普遍存在不对称方向偏好。
DEER:评估深度研究智能体生成专家报告的基准
DEER基准通过101项评分和声明验证,系统化评估深度研究报告,揭示现有系统结构合理但难满足专家级需求与逻辑完备性。
用大语言模型增强基本面分析:基于RAG的投资者简报生成系统
本研究使用LLM和RAG系统,从公司报告及宏观数据自动生成投资者简报,并通过个人投资者评估其有用性。
让数据说话:用AI从众包集合中提取关键词
评估多种NLP方法自动提取众包关键词,无完美方案,模型选择影响大;开源抽取模型更负责任,生成AI需谨慎。
HALO:面向语言模型的混合自适应潜在推理
HALO通过混合自适应潜在精炼选择性二次处理部分token,以更少计算超越固定精炼方法。
一个突现的海市蜃楼:突现失调与重新对齐是否确实是一个稳健现象?
突现失调对数据集表面特征高度敏感,控制响应长度后快速重对齐消失,证据不稳健。
AgentKGV:面向知识图谱事实验证的智能LLM-RAG框架与两阶段训练方法
提出AgentKGV框架,采用蒸馏SFT与轨迹GRPO两阶段训练,在知识图谱事实验证中宏F1提升14.9%,搜索调用减少近半。
PRecG:基于图神经网络与修辞角色分割的法律判例检索
提出PRecG方法,通过修辞角色分段和图神经网络分层学习文档表示,提升法律判例检索准确性。
复杂性引导的逐组件初始化用于语言模型预训练
分析预训练模型谱结构,构造模仿组件幅度与谱分布的初始化,但评估无性能优势,粗粒度谱匹配不可靠。
字母词形还原:使用一对一和带状RNN逆转中世纪文本中的字符集简化和缩写
自监督一对一RNN恢复字符简化,带状RNN扩展缩写,引入字符语义相似性度量,实现字母词形还原。
小规模双曲语言模型中涌现的创造力、诚实与设计遗忘
三个小语言模型在双曲空间上实现行为审计、创意框架和设计遗忘,为可信赖伴侣AI提供小模型路径。
大型文学语料库的自动主题标引:伏尔泰全集的机器学习方法
本研究利用机器学习在伏尔泰全集中实现自动主题标引,最佳模型F1达0.67,验证了方法的有效性及标引主观性下限。
WILDTRACE:长上下文推理中自然证据线索的基准测试
WILDTRACE基准通过214篇自然长文档中的481个任务,评估模型对源内因果、时序、叙事证据链的整合推理。
跨语言习语表达的概念网络:基于特征的图方法
提出跨语言习语概念网络,基于特征图揭示概念图式聚类,提升检测与翻译,提供可解释稳定表示。
检测端到端生成任务型对话中的不一致性
提出基于约束满足问题的流水线,自动检测任务型对话中LLM生成的不一致性,实现高精度求解。
DKCD:领域知识增强的非结构化数据因果发现
DKCD框架通过领域知识挖掘和因果推理,提升非结构化数据中因果发现准确性和完整性。
欺骗性归因:临床检索增强生成中的实体归属失败
发现检索增强生成中“欺骗性归因”现象,用错误实体的证据回答,现有检测失效,部署系统发生率7.8%。
面向长上下文LLMs的自引导测试时训练
提出S-TTT方法,让模型自选证据跨度训练,避免噪声干扰,在长上下文推理中提升准确率最高达15%。
面向德语和英语的主权开源基础模型
Soofi S 30B-A3B主权开源MoE混合模型,30B参数激活3B,性能领先,权重数据完全开源。
多语言视觉多项选择题中针对小型视觉语言模型的测试时缩放
TTS在小VLM上有效依赖解析能力与解码预算,最优配置达84.1%准确率,排行榜第一。
基于归一化的法医作者验证似然比估计
提出平方根校正与Hapax校正,无需校准模型即可从LambdaG推导似然比,性能媲美逻辑回归校准,提升法医文本比较实用性。
Freya-TTS技术报告
Freya-TTS是183.2M参数的无分词器土耳其语TTS模型,采用非自回归扩散Transformer,在连续潜在空间高效合成,WER 8.0%,实时因子0.11。
面向实时的句子级手语翻译
提出硬件感知流式手语翻译系统,采用QLoRA微调模型,在树莓派上实现实时处理,延迟降低27%以上。
分词器移植:缓解边缘高效孟加拉语音识别中的自回归崩溃
词汇移植解决孟加拉语音识别的自回归崩溃,序列长度降85.8%,词错误率21.54%。
Neural Collapse Is Forbidden: Information Floors in Language Models
基于置信度校准和增量推理的任务特定多模态问答代理:面向QANTA 2026
提出双代理架构,通过置信度校准与增量推理在QANTA 2026挑战中获最高分0.402。
敏感性感知阈值设置与令牌路由:面向大型语言模型的激活稀疏化
提出SATS阈值校准法及令牌路由,动态减少计算,提升大模型推理效率与质量-吞吐量权衡。
通过音系激活映射的音子分割与识别
提出基于自监督语音模型的音系激活映射,用两个轻量预测头实现音子分割与识别,仅需少量标注。
VTaMo:用于手语翻译的视频-文本对齐模型
VTaMo通过显式多粒度对齐(局部、全局、位置对齐)实现手语翻译最先进性能
Git-Assistant:基于规划的Git仓库更新支持
提出Git-Assistant,结合LLM与自动规划支持Git操作,实验表明混合方法提升可靠性、减少错误。
超级调优:从激活感知剪枝到稀疏微调
提出基于激活加权幅度的稀疏微调方法Super及结合LoRA的Supra,实验表明剪枝信号可有效用于参数高效微调。
Mach-Mind-4-Flash 技术报告
35B MoE仅3B激活,后训练优化达100B级性能,多专家强化学习融合加推理链压缩,多项基准领先。
在LLM生成中解耦任务求解与输出格式化
Deco-G框架通过分离格式遵循与问题求解,提升LLM推理性能,实验证明有效。
超越大语言模型:基于语言学的叙事文本因果图生成方法
结合语言学特征与LLM,提出因果图生成框架,优于纯LLM方法,准确捕捉叙事因果链。
GrAInS:基于梯度归因的大语言模型与视觉语言模型推理时引导方法
GrAInS通过对比梯度归因识别关键token并构建方向向量,在推理时调整激活,提升事实准确性与对齐,减少幻觉。
通过针对性干预实现语言模型的多属性引导
提出MAT-Steer框架,利用稀疏正交引导向量处理多属性冲突,在QA和生成任务上超越现有方法。
REAL:基于检索推理与逻辑构建的注意力行为方法用于长上下文KV缓存压缩
提出基于多行为分析的KV缓存压缩方法REAL,兼顾成功与失败案例,精度相当但空间节省32倍。
评估检索增强生成与长上下文输入在电子健康记录临床推理中的对比
RAG在EHR临床推理中比长上下文更高效,尤其成像提取和抗生素时间线任务表现优异,诊断生成受限于文档变异性。
基于图卷积网络与信息融合的科技专利实体对齐方法
提出图卷积网络与BERT融合的科技专利实体对齐方法,利用结构与属性信息提升对齐性能,优于现有方法。
基于语义增强机制的关系抽取模型
提出CasAug模型,结合语义增强机制缓解三元组重叠问题,提升关系抽取效果。
自监督早期退出加速LLM推理
提出自监督早期退出头,达到置信阈值提前停止,降低推理成本,动态自推测解码提升令牌接受率。
基于共现词网络的不均衡短文本主题模型
提出CWUTM模型,利用共现词网络增强稀缺主题识别,通过吉布斯采样有效检测不均衡短文本中的低频主题。
SLIDERS:通过自动化证据综合与调和进行系统综述
SLIDERS用LLM自动合成证据并解决矛盾,在百万级语料上准确率近90%,支持后续问答。
程序问题:面向数据驱动公民审议的行动感知LLM人格建模
提出将Zoom录音转为带动作标签文本的流水线,微调LLM人格,显著提升模拟审议的真实性,人类难辨真假。