何必纠结连续潜在变量?通过渲染压缩实现可解释的离散潜在推理
提出离散潜在推理(DLR),将连续状态转为离散token,实现可解释高效推理,压缩20倍。
SEVA:面向事实归因的自我进化验证智能体(过程奖励)
提出SEVA结构化验证代理,用过程奖励解决RL训练优势崩溃,实现自我进化,在事实归因上媲美GPT-4o-mini且输出可审计。
本地部署开源大模型在Text-to-SQL上的表现如何?——基于BIRD的跨模型家族规模与技术的边界研究
本地开源LLM的Text-to-SQL:代际强于规模,自我纠错免费提效,模式链接无用,自一致性性价比低。
快数字,慢语言:连接定量与定性盈利信号
定量惊喜公告即释,定性情绪次日显现,EarningsInOne语料桥接两信号分析。
两阶段提示优化用于少样本关系抽取:从推理引导搜索到梯度引导精炼
提出推理与梯度优化结合的提示框架,在少样本关系抽取任务上取得领先性能。
人类是进化出的指令遵循者吗?一种潜在的归纳偏置使得快速指令任务学习成为可能
主张人类拥有进化形成的指令遵循偏置,能通过语言指令快速泛化行为,类似LLM零样本学习,是先天认知特征。
KbSD:面向智能体搜索中行为校准的知识边界感知自蒸馏
KbSD通过知识边界自蒸馏和象限自适应优化,提供密集监督,提升搜索准确率并缓解幻觉。
MATCH:通过上下文检索调制注意力以支持长上下文Transformer
MATCH框架将稀疏注意力与动态上下文检索结合,显著提升长距离任务性能且保持高效。
揭示自然语言处理的技术发展:一个以科学实体为中心的视角
本文从实体角度分析NLP技术趋势,发现预训练语言模型成主流,新技术涌现和接受速度加快。
Fund2Persona:基于基金披露数据构建与优化金融顾问画像的框架
提出Fund2Persona,利用基金披露数据构建并优化金融顾问画像,生成更具体有用的投资建议。
不用GPU能走多远?面向问答、对话与摘要的轻量级幻觉检测系统基准测试
轻量级幻觉检测在QA和对话任务中有效,但在摘要任务中接近随机,性能高度依赖任务。
SrDetection:一种用于代码大语言模型数据泄漏检测的自引用框架
提出自引用框架SrDetection,通过对比原样本与变体检测代码模型数据泄漏,F1显著提升。
平滑缩放定律隐藏逐步词元学习
缩放定律由词元学习时间分布主导,可据此优化训练加速11%损失下降。
中文标题:探索自然语言处理领域中算法提及的动机:一种深度学习方法
中文摘要:提出NLP论文中算法提及动机分类框架,发现使用动机占主导,改进最少,动机多样性增长,使用逐渐取代描述。
神经程序记忆:通过隐式激活引导赋能LLM智能体
NPM通过隐式激活引导,从历史经验中提炼技能向量,直接激活神经机制,无需训练即可引导任务,效果与显式指令相当
ARKD: Adaptive Reinforcement Learning-Guided Bidirectional KL Divergence Distillation for Text Generation
临床推理图:LLM诊断推理的结构化评估显示有胜任力但无一致性
LLM诊断准确率尚可,但推理图分析显示其缺乏跨病例一致性,胜任力与推理稳定性脱钩。
MemDelta:智能体记忆评估中的受控基线与隐藏混淆因素
MemDelta揭示记忆评估中嵌入模型等变量易混淆结论,自记忆不如检索,Mem0成本高50倍但仅局部等同云RAG。
IHDec: 基于散度引导的对比解码以保障多轮指令层级
提出IHDec无训练方法,用JSD检测并对比解码纠正多轮指令层级冲突,效果优于训练方法。
LatentRevise:从零命中推理中学习
LatentRevise方法利用失败轨迹优化推理前缀嵌入,引导模型自我反思,提升零命中场景下的数学推理能力。
我们是在衡量策略还是措辞?LLM数学推理中表面与方法层面多样性的鸿沟
引入方法层面多样性,揭示表面与方法层面的系统性偏离,目标导向真正多样的人类式推理。
Mamba的时间步长与人类阅读时间对齐
Mamba模型每词时间步长可显著预测人类阅读时间,且独立于GPT-2惊异度,为实时语言处理提供新视角。
LLM-as-a-Judge在代理场景中能否可靠验证评分标准?
引入RuVerBench评估LLM验证评分标准可靠性,发现先进模型虽强但噪声大,弱模型对提示更敏感,批处理有取舍。
走向对齐动力学的物理直觉:以随机性结晶为例的案例研究
用热力学相变理论解释语言模型对齐:分为高熵液态、成核和沉降三阶段,验证了结晶过程。
LLM智能体是潜在上下文管理者:通过本体感觉仪表盘激发自我管理上下文
提出VISTA,通过运行时仪表盘暴露上下文块状态,无需训练即显著提升长程工具智能体性能。
基于Token共现图的高效检索增强生成
提出TIGRAG,基于token共现图规避昂贵LLM管道,高效实现多跳推理,检索和问答优于现有方法。
Forewarned is Forearmed: When Non-Sequential Embedding Turns Into an Anomaly Detector
节点与邻域语义一致性:面向TAG异常检测的文本-拓扑对齐
提出N2NSC框架,解决文本属性图异常检测中节点与邻域的语义一致性问题,优于现有方法。
小模型,大成就:探索紧凑型语言模型
研究小型语言模型在RAG系统中的表现,无需GPU即可在设备上运行。
参数化技能
提出ParametricSkills,将文本技能转为LoRA参数,避免上下文依赖;在软件工程任务上平均提升6.44分,实现测试时持续学习。
非完全人类品味:LLM调查代理的程式化杂食性
LLM代理品味呈系统正向偏差、结构简化、文化对齐失真。
语言交流的信息动力学
提出信息论框架量化语义定向流动,分解多源贡献,实验验证信息流检测与对话质量区分。
在受控和自然语境下估计上下文嵌入中的语法性别方向
提出首个上下文嵌入语法性别解耦方法,构建平衡数据集与评估指标,发现未加权受控上下文最纯净,质心估计器最优。
CORTEX: 通过本体语料图谱实现网络规模语料库的高质量跨域组织
Cortex通过本体语料图谱将网络语料构建升级为结构化知识组织,支持高质量跨域关联与推理。
DAIN:基于动态智能体的交互网络实现高效协作多模态推理
DAIN动态多智能体协作框架,稀疏调度专家智能体,多项基准达SOTA,提升准确性确保可解释性。
人类与自动识别荷兰构音障碍连续言语的比较:案例研究
重度构音障碍语音识别对人类和ASR均极困难,微调后个性化模型优于人类,但仍有提升空间。
在思考之前,学会决策:主动路由以实现高效的视觉推理
PRP主动路由范式通过双模型能力评估实现早期路由决策,加速推理且不损性能。
CaresAI在CT-DEB26中:使用领域特定Transformer嵌入和分类模型检测临床试验剂量错误
本研究用BioBERT等Transformer嵌入临床试验文本,结合机器学习检测剂量错误,最佳ROC-AUC达0.853。
不完整图证据下的大语言模型推理基础
不完整图证据下,LLM推理无法同时拒绝假轨迹和保留真轨迹,软基础化通过KL正则化变形实现稳定推理。
利用开源大语言模型的多智能体系统以减轻虚假信息威胁
多智能体系统模仿人类标注,结合共识与多样性,优于GPT-4等,利用开源LLM实现多语言虚假信息检测。
字段顺序无关紧要:结构化元数据检索的置换不变嵌入模型微调
提出置换不变微调(PI-FT)消除字段顺序影响,在15语言基准上低成本提升检索性能,优于大模型。
REAR:通过奖励分解实现测试时偏好重对齐
提出REAR框架,通过奖励分解实现测试时偏好重对齐,高效可扩展,适用多种任务。
DialogPII:用于检测个人信息的合成对话转录多语言数据集
多语言合成对话数据集DialogPII覆盖11语言8场景,用于个人信息检测,附基线模型与验证。
MOPD:面向LLM后训练中能力集成的多教师在线策略蒸馏
MOPD通过多教师在线策略蒸馏集成多种能力,消除暴露偏差,优于混合RL等方法,并支持并行开发。
OLIVE:面向语音自监督学习的视图增强潜在预测与波形重建
OLIVE联合优化分析与合成,通过视图增强预测与波形重建,提升生成与说话人任务,保持识别语义性能并改善重建。
SIMAX:一种可扩展且可解释的多保真度带注释医患对话模拟框架
SIMAX框架生成带标注的模拟医患对话,评估显示自然度和保真度良好,支持通信编码系统开发验证。
M3 QuestionIng:多模态多跨度医学问答
提出M3QAFrame多模态多跨度医学问答框架,融合文本图像,生成含图像答案,性能优于现有方法。
TRACE:双人语音中基于时间关系的对话情感同步检测
提出TRACE框架与DyadEE数据集,利用时间关系感知与情感微调Whisper特征,情感同步检测准确率达97.01%。
不确定性感知的生成与模糊情境下的决策
提出基于贝叶斯理论和风险厌恶的不确定性感知决策算法,用于辅导和评审,实验表明贝叶斯方法更优,高模糊性需谨慎实施。
面向异质知识冲突下鲁棒RAG的状态感知同伴专业化
RAPS-DA状态感知同伴专业化框架,通过样本三状态分工与token双重选择器,提升RAG异质冲突鲁棒性,无需标签即超越基线。