人工智能、脑死亡检测与伊斯兰法
AI检测隐匿意识挑战伊斯兰法;以证据、确定性与灵魂不可知论应对,并论AI代理决策。
稀疏覆盖:用于专利现有技术检索的语义中心表示
提出Sparse Coverage无监督检索框架,用覆盖k中心将局部嵌入映射为稀疏中心表示,检索性能媲美甚至超越密集编码器。
WIP:LLM Odyssey:基于游戏的大语言模型工程教学平台
开源游戏平台含13款游戏,分三层级教授LLM工程概念,已部署并设计混合评估方案。
EMAN:多任务学习中通过路径涌现的优化驱动容量增长
提出EMAN,从单路径出发,依据优化证据动态生长独立路径,实现容量增长,性能提升且计算成本可控。
立场:生成模型中的公平失效本质是评估问题
公平失效源于评估缺陷,缺乏可比性与可操作性,主张用公平卡实现标准化、可复现的生成模型评估。
用于逐元素评估初等函数和滤波函数的迭代张量网络变换
提出迭代张量网络变换,压缩域计算非线性函数,支持大规模反应流分析及优化求解。
基于小语言模型的结构化驾驶状态叙事用于GNSS欺骗检测
用结构化驾驶叙事,小语言模型检测GNSS欺骗,性能与LLM相当,精度97%,资源低。
从溯因解释到SGC节点分类的全局逻辑规则
用最小溯因解释为SGC节点分类提取全局逻辑规则,规则紧凑且保真度高。
期望自由能作为Bethe拉格朗日量的信息约束
提出Bethe自由能新方案,用信息约束保持认知驱动,特定乘子下恢复期望自由能解,乘子历经非激活、内部和饱和区。
Delta2Gamma:面向阿尔茨海默病检测的脑电频带自适应对比学习
提出自监督框架Delta2Gamma,将脑电分解为五个频带,各自自适应温度对比学习,在ADFTD数据集上实现92.4%准确率,优于监督方法。
通过跨难度优化动力学理解大语言模型中的课程学习
通过跨难度迁移解释课程学习有效性,提出TDCS动态采样,多任务上优于现有方法。
Graphectory Viewer:用于智能体软件轨迹过程中心分析的工具
提出Graphectory Viewer网页工具,将智能体轨迹转为阶段感知图,支持多框架、节点检查、过滤及桑基汇总,开源发布。
PACE:面向去中心化金融安全AI代理的策略认证合约执行
PACE框架在LLM代理与链上执行间加入策略验证,签名绑定审批与执行字节,实测零不安全率,开销约3万gas。
最大Tsallis熵分布用于相关数据鲁棒高效稀疏学习
针对相关异质数据,提出基于Tsallis熵最大化的qGaussian分布替代高斯模型,并设计稳定高效算法,提升稀疏学习鲁棒性。
高维时空输出的自适应代理建模
降维后建代理模型,结合探索利用的自适应采样,高效处理高维时空输出,用于燃气轮机叶片热力分析。
鲁棒非线性输出调节中的非自适应学习
提出结合输入驱动滤波、内模与反步的非自适应设计,实现高相对阶非线性系统全局渐近鲁棒调节,无需参数化回归器。
COMIC:面向多模态大语言模型的参考感知安全门控
提出COMIC参考感知安全门控,针对多模态越狱中操作-目标绑定风险,提升鲁棒性且保持效用。
NeuroAbs:面向属性检查加速的神经符号RTL抽象框架
NeuroAbs用大模型与AST生成RTL抽象,SMT校验可靠性,CEGAR迭代细化,显著加速硬件属性检查。
从基函数视角重新思考不规则时间序列预测
提出去偏神经基函数网络,用重要性采样校正偏差,适配多样模式,结合多尺度分解与融合,提升不规则时序预测。
MoFE:基于傅里叶神经算子的新型混合专家加密货币预测框架
MoFE结合傅里叶神经算子与混合专家,捕捉多频动态,缓解相位滞后,在比特币预测中达SOTA,提升交易收益与夏普比率。
超越MSE:重新思考不规则时间序列预测的评估指标与基准
提出CSE替代MSE,消除采样分布影响,理论证明估计误差更小,实证其更准确评估不规则时间序列预测。
当智能体在Web3上行动:MCP、技能与工具调用的攻击面综述
Web3智能体攻击:区块链不可逆、签名、自主、序列组合放大影响;防护<30%,模型拒答<3%。
公平ASR:在共享目标调用预算下重新评估黑盒越狱
提出Fair-ASR协议,以共享目标调用预算公平评估黑盒越狱,发现攻击排名随预算变化,并推出高效ReCode攻击。
整合新奇与惊喜用于基于图像的强化学习中的经验优先排序与探索
提出NSPER方法,用新奇和惊喜信号优化经验回放与探索,在图像RL任务中提升训练效率和收敛速度。
超越FLOPs:面向可持续LLM的代码相关任务能量感知知识蒸馏
FLOPs不能可靠反映能耗,用能量替代模型指导蒸馏可让LLM推理能耗降90%、内存减86%,精度损失小。
迭代抓取位姿细化:一种用于二维视觉的深度强化学习方法
基于强化学习和DQN,迭代细化抓取候选,将几何法失败抓取转为成功,Dex-Net 300物体上达100%成功率,并验证仿真到现实迁移。
DEPT:面向统一查询扩展与检索的文档嵌入保持调优
单解码器LLM端到端训练统一查询扩展与检索,通过文档嵌入保持调优稳定目标并传递梯度,在BEIR五个数据集上提升检索质量。
利用生成式幻觉与生物物理建模实现统一的生物分子序列-结构协同设计
MCTH利用蒙特卡洛树搜索与生成幻觉,统一生物分子序列-结构设计,无需微调。
DMT-Dens:用于生物数据的密度保持流形可视化
提出DMT-Dens,基于Transformer编码器与秩保持对齐,优化k近邻对数半径相关损失,实现密度保持与标签可分离性。
无需高斯分布:面向JEPA世界模型的对比逆向动力学
用动作对比逆向动力学替代高斯正则化防坍缩,无需高斯假设;多对象任务成功率80%,胜过SIGReg的58%。
FLOPs与实际工作:AI效率评估中复现的重要性
复现发现FLOPs不能直接反映执行时间,新硬件上α-FLOPs公式低估了时间波动,强调完整复现包的必要性。
面向高风险用例的全球AI监管:公平与伦理比较综述
AI治理转向强制风险监管,但司法辖区分歧致合规不确定。比较欧美中规制,提出可机检合规方案。
大型语言模型在医学推理中表现出元认知敏感性
大型语言模型在医学推理中部分具备元认知敏感性,置信度随证据强度变化,但错误案例中校准欠佳,需直接评估置信度而非仅看准确率。
当通信:多智能体强化学习中基于信念分布与KL散度的门控原则
智能体仅在信念分布KL散度超阈值时通信,避免高方差门控,在困难任务中优于基线并显著降低方差。
观点:AI道德推理评估仍遗漏一半问题
现有LLM道德评估偏重价值对齐,忽视规范应用;需补数据、推理与特征识别三缺口,推进规范推理研究。
立场:AI治理需要ISO式互操作性协议,而非仅靠法律
主张AI治理应建立类似ISO的互操作协议,实现标准化风险沟通,而非仅靠法律;建议采用AI营养标签,促进跨境合规并降低中小企业门槛。
OGX:开源、厂商中立的生成式AI应用服务器
OGX是开源AI应用服务器,统一主流API接口,支持多种推理引擎与向量库,用于智能体应用开发与部署。
大语言模型何时适用了错误法律?时间性法律推理中LLM失败的诊断
LLM在时间性法律推理中偏向适用最新法律,因强化学习塑造的推理路径趋同,推理能力越强反而表现越差。
幻觉雪球:多智能体LLM流水线中错误传播的状态转移建模
多智能体LLM流水线中幻觉逐级转化且难检测,边界验证优于末端验证,显著降低存活率。
SKILL:面向逻辑优化的自校正知识引导迭代式大语言模型智能体
自校正SKILL融合多智能体LLM与强化学习优化逻辑综合,PDA提升12.4%,成功率86.3%。
基于规则与LLM的智能体框架:用于描述性文档版式嵌入与标注的植物科学案例
提出模块化智能体流水线,从植物文献中提取性状。三数据集提取55737条标注,LLM增强使75%性状覆盖提升,注释总量增59%,验证稳健可扩展。
ABCD研究中青少年物质使用起始的纵向与图增强预测
纵向模型优于基线;时间梯度提升与图卷积融合预测青少年物质使用最优,AUC逾0.79,图信号有补充价值。
立场:医学AI忽视真实治疗结果
医学AI过度依赖文献和专家意见,忽视真实治疗结果数据,限制潜力;应纳入真实结果训练评估,并以此为最终目标。
面向安全的LLM智能体:规范、验证与执行综述
综述38项研究:规范瓶颈是关键,验证税致安全完成率低,无方法兼备性能与安全。
AI 智能体在科学团队中的角色应作为人机系统研究
现有研究忽略科学团队合作的社会性,主张以人机对为单位研究AI科学家,并通过案例证明人机互补,呼吁新框架促进科学发现中的人机协同。
多模态大语言模型在文本与音频模态下的灾害援助可及性评估
评估多模态大模型在文本与音频下的一致性,发现均不可靠,对特殊需求人群差距更大,需设计公平包容的灾害风险沟通工具。
大型语言模型在化妆品化学与皮肤健康中的准确性与可靠性:一项基准研究
对14个LLM基准测试,总体表现差,尤其在定量推理和结构识别上,存在误导风险,不可靠。
以人为中心的育儿建议大语言模型基准评测方法
用专家多维评分基准评测15个LLM在100个育儿场景中的表现,发现总分掩盖弱点、语言影响建议风格。
面向智能体服务的KV缓存管理:学习智能体执行
在线学习智能体执行语义,优化KV缓存管理,提升命中率,降低延迟,提高吞吐。
当不确定性不足时:代码生成中自我纠正的实证研究
不确定性信号与正确性相关性弱;基于不确定性的自我修正常降准,仅验证性修正可靠提升Pass@1。