#深度学习
共 20 篇相关内容 · 安全漏洞、AI动态、技术文章
技术文章 16
OCOO-T:用最简洁的架构预测细胞对扰动的转录响应
## 一粒药扔进细胞里,基因表达会怎样变化? 设想一个场景:你是一名药物研发人员,手里有一种全新的候选化合物。你把它加到培养皿中的细胞里,想知道哪些基因会因此被激活、哪些会沉默、表达水平会涨到多少、降到多少。传统做法是做实验——把药加进去
scGTN:用孪生图Transformer网络攻克单细胞RNA测序聚类难题
单细胞RNA测序(scRNA-seq)是当今生物信息学领域最具变革性的实验技术之一。它能在单个细胞层面精确刻画基因表达图谱,让研究者得以辨识不同的细胞类型,深入理解细胞群体内部的异质性结构。然而,从海量的测序数据中提取有意义的生物学信息绝非
自回归潜扩散造大环肽:PepALD如何用基础模型重新定义多肽药物设计
## 引言:大环肽——药物开发中"够不着"的宝藏 在现代药物化学的版图上,大环肽(macrocyclic peptides)占据着一个独特而尴尬的位置。它们比小分子大,比抗体小,恰好卡在那个"中间尺寸"——理论上能触及传统小分子难以攻克的
自回归潜扩散造大环肽:PepALD如何用基础模型重新定义多肽药物设计
## 引言:大环肽——药物开发中"够不着"的宝藏 在现代药物化学的版图上,大环肽(macrocyclic peptides)占据着一个独特而尴尬的位置。它们比小分子大,比抗体小,恰好卡在那个"中间尺寸"——理论上能触及传统小分子难以攻克的
MultiMolecule:生物分子序列模型的模块化生态系统,如何重塑RNA、DNA与蛋白质研究的基础设施
<p>2026年6月,来自q-bio.QM、cs.LG、q-bio.BM、q-bio.GN多个交叉领域的研究者Zhiyuan Chen在arXiv上发布了编号为2606.16540的论文,正式提出了MultiMolecule——一个面向生
BrainWorld:用结构先验引导全脑4D fMRI动态生成的新型框架
## 问题的根源:大脑动态影像的生成困境 功能性磁共振成像(fMRI)是当前神经科学研究中最重要的无创脑功能检测手段之一。它通过测量血氧水平依赖(BOLD)信号来间接反映神经活动的空间分布和时间变化。当我们把传统的三维fMRI扫描在时间轴
BrainWorld:用结构先验引导全脑4D fMRI动态生成的新型框架
## 问题的根源:大脑动态影像的生成困境 功能性磁共振成像(fMRI)是当前神经科学研究中最重要的无创脑功能检测手段之一。它通过测量血氧水平依赖(BOLD)信号来间接反映神经活动的空间分布和时间变化。当我们把传统的三维fMRI扫描在时间轴
从网球拍到三维骨架:加州理工学院发布千万级多视角网球数据集CalTennis
## 一、为什么网球是姿态估计的终极试炼场 网球运动对计算机视觉研究者而言,堪称一块天然的磨刀石。与慢速的瑜伽动作或室内表演不同,网球击球涉及全身协调的爆发性运动——运动员在不到一秒的时间内完成蹬地、转体、挥拍的完整链条,脚掌与地面的接触
空间投机解码:让自回归图像生成快13倍的几何直觉
<p><strong>论文标题</strong>:SSD: Spatially Speculative Decoding Accelerates Autoregressive Image Generation</p> <p><strong>
用「方框」思考:让真实照片中的三维编辑变得简单
# 用「方框」思考:让真实照片中的三维编辑变得简单 **论文:Thinking in Boxes: 3D Editing in Real Images Made Easy** **作者:Pradhaan S Bhat, Naveen Ch
不用人工标注就能定位病灶?弗莱堡大学RadGrounder用120万临床数据训练放射科视觉语言模型
德国弗莱堡大学团队提出RefRad2D数据集与RadGrounder模型,首次实现无需人工空间标注即可训练具备空间定位能力的放射科视觉语言模型。该模型基于120万条双语CT/MR图文对,在报告生成、视觉问答和空间定位三项任务上均表现优异,且空间定位监督不会降低语言生成质量。论文已被MICCAI 2026接收。
当注意力不再需要特征:李代数注意力机制的革命性突破
本文解读了一项突破性研究:李代数注意力(Lie-Algebra Attention)。该研究首次将Transformer中的注意力token定义为矩阵李群的群元素,注意力分数由封闭形式的代数范数直接给出,天然满足等变性,首次让仿射群进入注意力机制的适用范围,用50-80倍更少的参数达到与学习核相当甚至更优的性能。
SARLO-80:全球首个厘米级斜距SAR-光学-文本多模态数据集,开启合成孔径雷达基础模型新纪元
法国ONERA团队发布SARLO-80——全球首个公开可用的超高分辨率SAR-光学-文本三模态数据集。基于Umbra卫星SICD格式聚束SAR数据,覆盖72个国家257个地点,含119,566组三元组(复数/幅度斜距SAR、对齐光学图像、自然语言描述)。数据统一至80cm斜距网格,支持跨模态检索与条件生成等基础模型任务。
当MoE遇上分布偏移:专家校准如何拯救混合专家模型的可靠性危机
混合专家模型(MoE)在大模型时代大放异彩,但其预测概率的可靠性在数据分布发生变化时严重退化。本文解读Gina Wong等人发表于arXiv的最新研究,揭示了硬路由MoE与软路由MoE在校准机制上的本质差异——专家层面的校准足以保证硬路由模型的整体校准,但对软路由模型则完全失效。研究者提出对抗性重加权方法,在分布偏移下显著改善了准确性与校准性的权衡。
扩散语言模型的推理透明度:DiffusionGemma能否被真正理解?
扩散语言模型DiffusionGemma的推理透明度看似比自回归模型差28.6倍,但通过token瓶颈映射可降至1.1倍。研究还发现了非时序推理、token涂抹等扩散模型独有的推理现象,为新一代语言模型的安全评估奠定基础。
TimeProVe:先提议再验证,长视频理解成本降低93%同时精度提升7.3%
TimeProVe提出两阶段框架解决长视频问答的效率-精度矛盾:先用轻量级ACE模块从视频中提取动作级候选证据并生成假设,再调用大型VLM精准验证。在ADL场景基准OTB上超越最强基线7.3%,VLM调用减少75%,推理成本降低93%。
情报动态 4
Fast.ai - Practical Deep Learning for Coders (2024版)
业界口碑最好的免费深度学习入门课程,从零开始用PyTorch构建完整DL项目。Jeremy Howard主讲,面向有编程基础的学习者,完全免费无门槛。
fast.ai — Practical Deep Learning for Coders (2026 Edition)
fast.ai 的经典免费深度学习课程,面向有编程基础的学习者,从零开始构建深度学习模型。课程由 Jeremy Howard 主讲,涵盖 CNN、NLP、表格数据等核心主题,完全免费,无需数学背景即可入门。
fast.ai Practical Deep Learning — 完全免费实战深度学习
Jeremy Howard主讲的经典免费深度学习课程,从零开始实战,无需GPU经验。2026版已更新,涵盖最新的transformer和扩散模型内容。