DexterSQL:深度模式探索与规则修正的Text-to-SQL生成
深度模式探索+数据库无关规则+多路径生成提升文本到SQL准确率,最优72.2%。
可解释性实践:跨领域可解释NLP综述
综述七领域可解释NLP,对比方法,提出双层评估协议,指出忠实性差距与人类判断作用,展望个性化与机制可解释性。
AVA编码器:迈向智能体原生视频表示学习
提出AVA编码器,以智能体自编码将视频转为知识图谱并重建,实现原生表示,性能提升20.7个百分点。
Marco-Voice 技术报告
提出Marco-Voice统一语音合成框架,融合语音克隆与情感控制,通过解耦与对比学习提升情感表现力,构建CSEMOTIONS数据集,性能领先。
语言模型作为约束满足问题形式化器的现实检验
大模型作形式化器解决约束满足问题,24组合中15种不如直接求解;复杂度越高越差,且易硬编码。
大语言模型会关照同类吗?相似性信号可诱发合作
研究发现不同LLM对相似性信号反应差异大,相似性高可促进合作,但数据集影响小,模型常自评高度相似。
按需常识:为自然语言推理生成并选择性整合常识知识
提出无参考LLM裁判评估生成常识,混合选择性整合高事实常识,NLI准确率提升3.87%-8.5%,克服中性偏见。
大语言模型驱动的小盘股交易:整合财经新闻情绪、宏观经济指标与技术信号
研究发现,将模型预测风险分解为偶然与认知成分并纳入组合协方差,分离纯alpha与纯beta选股策略优于交集,40日持有期下纯beta配合GPT-4o mini情绪达夏普2.33。
测试时AI4AI:通过推理支架实现强模型向弱模型的能力迁移
强模型构建测试时推理支架,无需更新参数即可提升弱模型性能,基准上准确率近翻倍,为传统蒸馏提供补充。
VICBench:用于代码漏洞检测的多语言基准
VICBench含100个VIC,覆盖多语言与48类CWE,现有方法F1仅33%-40%,用于漏洞检测评估。
LLM路由器:利用预填充激活重构路由
利用预填充激活路由,解耦编码器与目标模型,共享网络预测正确率,优于语义基线,节省74%成本。
大型语言模型用于文本标注时再现种族刻板印象
研究19个LLM的400万次标注,发现模型再现种族刻板印象:少数族裔名字和方言触发系统性偏见。
基于大语言模型的危机场景自动翻译与紧迫性
研究发现大模型在危机翻译中质量下降,尤其低资源语言;且其紧迫性判断跨语言不一致,风险高。
大语言模型中的社会意义:结构、量级与语用提示
大语言模型能定性复现人类社会推理结构,但量级校准不一;语用提示可改善,仍不完全。
不确定性作为规划信号:面向目标导向对话的多轮决策
提出CUP框架,以不确定性为规划信号,结合语言模型与结构化规划,提升目标导向对话成功率并减少轮次。
TEMPER:定量推理中的情绪扰动测试
情绪化表述使定量推理准确率下降2-10个百分点,中和情绪可恢复大部分性能。
面向学习者特征的LLM生成教育反馈设计研究
清晰全面的LLM反馈提升修改表现且获好评,但新颖性与情感框架因个性而异,设计应考虑学习者特征。
作为概念场的文本语料:黑盒幻觉与新颖性度量
提出文本语料的概念场,用句间向量差与局部高斯模型的ζ评分,实现黑盒幻觉与新颖性检测,跨域稳定。
面向检索增强生成的查询引导置信感知重排序
CAR提出无需训练的置信感知重排序,利用答案语义稳定性衡量文档贡献,显著提升检索增强生成效果。
DORA探索者:无需训练提升大语言模型的探索能力
无需训练的推理时算法DORA,序列级评分提升LLM探索,优于温度采样,TextWorld表现更佳。
HetRoute:分布式边缘MoE推理的异构成本感知协作路由框架
异构成本感知协作路由框架,统一建模开销,优化专家部署与在线路由,显著降低延迟和跨服务器流量,提升吞吐。
自进化框架:自我改进的框架
提出自进化框架范式:大模型智能体经弱点挖掘、提案生成与回归验证自主改进自身框架,最高提升132%。
基于大语言模型的因果智能体
提出因果智能体框架,为大语言模型配备因果工具处理表格数据,四层因果问答准确率均超八成,优于现有最优。
ReXrank:AI驱动放射报告生成的公开排行榜
ReXrank:用8项指标、1万例及3个公共数据集标准化评估AI放射报告生成,区分仅发现和含印象两种模式。
BLADE:通过对话与解释实现更优语言解答
基于RAG的对话助手BLADE以引文引导学习,实验显示单独使用成绩最高,同时访问直接材料反而降低表现。
视觉语言模型在多大程度上能帮助人类从多模态简答题中推断心理模型的质量?
提出MMGrader,用概念图从多模态回答推断心理模型,测试9个公开模型,最佳准确率约40%,低于人类水平。
TrimMoE:面向分布式边缘推理的通信感知与自适应深度框架
面向分布式边缘推理,提出层跳过与早退结合框架,质量约束下延迟降六成,损失不超2%。
大语言模型在上下文学习中重构表征几何
大语言模型在上下文学习中重构内部表征几何,成功学习伴随表征重组以增强任务可分性,行为符合原型算法。
安全转向:跨安全视角的大语言模型表示转向基准测试
提出安全转向基准,覆盖九安全视角;性能依赖组合且纠缠,社交行为最脆弱,拒绝转向损害常识道德,幻觉转向改变政治观。
面向多模态大语言模型的多语言OCR感知微调与提示引导的思维链推理
提出OCR感知后训练,无需OCR引擎,结合数据微调和思维链提升多语言文本理解,降低幻觉保持通用能力。
LLM智能体工厂:领域特定LLM智能体的检索
提出基于检索的智能体工厂,用超2万预设配置按需构建领域智能体,兼顾精度与低成本,优于非智能体基线,匹敌高成本生成。
相似性门控放行反转:代理系统中嵌入余弦阈值的有效性审计
嵌入余弦相似度门控在代理系统中常误判:放行语义反转,拒绝改写,平衡准确率中位仅0.525,简单修复无效,需匹配对审计。
冲突还是策略?法国新闻标题中不屈法国与国民联盟的不对称角色框架(2022—2025)
法媒标题对左右民粹政党呈现角色不对称:不屈法国多冲突框架,国民联盟多策略选举框架,且跨时间稳定。
审慎考量文化:运用文化共识理论分析单文化与多文化情境下的大语言模型对齐
用文化共识理论分析多国调查,发现大模型常错误表现文化结构,缺乏共识或过度规整;该理论可诊断其反映人类多样性还是算法同质化。
思维链何时有益、何时有害:大语言模型推理中串行深度瓶颈的实证研究
思维链并非普遍提升推理:对高串行深度任务提升显著,对浅层任务冗余,仅起带宽旁路作用。
多语言量化税:边缘端小型语言模型中的结构性崩溃与类型学脆弱性
四比特量化使边缘端小模型多语言任务现结构性崩溃,低资源非拉丁语系尤甚,伴语言悖论与领域遗忘。
Transformer中的位置编码:从绝对与相对方法到旋转位置嵌入及长上下文扩展
综述绝对/相对及RoPE等位置编码,分析长上下文扩展技术,强调需多任务评估验证泛化。
使用模拟响应概率的多模态题目参数估计
微调多模态大语言模型重建MCM和3PL曲线,隐式捕捉学生响应概率,从而准确估计题目难度。
解析器早已知道:约束解码中的轻量级偏差校正
利用解析器状态进行轻量级对数几率校正,恢复掩码扭曲的分布,无需重采样,兼顾质量与效率。
PERCEPT:波斯-英语语码混合的词性标注与分析语料库
首个波斯-英语语码混合语料库PERCEPT,含UD词性标注,分析显示名词为主,平台间词类及触发效应有差异。
MD-ProTector:面向LLM生成文本检测的多数据驱动原型定位
MD-ProTector用多个可训练原型表示文本类别,结合原型定位损失区分类间与类内变异,在多个大型基准上取得最优检测性能。
智能体系统中的协同进化:走向超越人类设计的自主进化
综述智能体系统协同进化,提出三阶段分类(智能体间、与环境、元进化),探讨超越人类设计的自主进化与挑战。
本地可部署的小语言模型用于急诊科决策支持:微调策略的系统基准评估
基准测试8种开源小模型,LoRA微调在分诊和转诊任务上超商业模型,可识别高风险患者。
刻意离轴:Transformer在何处计算概念及其原因
模型分两阶段计算概念:先离轴正交隔离组合与词汇,后加法读出;固定相位旋转即可复现,质量不变。
VisEditBench:视觉语言模型能否根据多模态反馈编辑可视化代码?
提出可视化代码编辑基准VisEditBench,含1395个任务,评测20个VLM发现编辑困难,提出VisEditAgent框架提升编辑成功率。
Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension
大型语言模型对越南方言的鲁棒性如何?
评估LLM对越南六大方言组的鲁棒性,方言输入致平均性能下降2.82%,QA降幅最大,无模型完全方言不变。
从推理深度到推理广度:评估大语言模型的多点联想推理
提出MPAR-Bench双语基准,测试大模型多点联想推理广度;干扰使准确率降5-18个百分点,深度推理不自动带来广度。
TAF-MED:明确自我治疗意图下大语言模型的多轮安全拒答崩溃
提出TAF-MED基准(500个三转场景)评估8个模型,71.6%对话含不安全回复,61.4%初始安全后崩溃,首轮安全不代表多轮安全。
这是你的最终答案吗?跨上下文一致性作为大语言模型可信度的度量
提出跨上下文一致性(C3)作为可信度指标:答案越稳定越正确。经26模型6基准验证,可补充评估并诊断基准饱和。