在这里插入图片描述https://www.nature.com/articles/s41588-018-0295-5#Sec13

摘要

深度学习方法是一类机器学习技术,能够识别大型数据集中高度复杂的模式。在这里,我们提供了深度学习在基因组分析中的应用的观点和入门知识。我们讨论了调控基因组学、变异检出和致病性评分领域的成功应用。我们包括有关如何有效使用深度学习方法的一般指南以及工具和资源的实用指南。本入门指南附有交互式在线教程。

主要

深度学习最近在从计算机视觉到自然语言处理的各种应用中取得了令人印象深刻的进步。本入门指南讨论了深度学习方法的主要类别,并就如何在基因组学中有效使用深度学习提供了建议。本入门指南适用于对应用深度学习方法感兴趣的生物信息学家,以及寻求对这一快速发展的领域有深入理解的基因组学家和普通生物医学研究人员。计算机科学家也可以使用该入门书来介绍深度学习在基因组学中令人兴奋的应用。但是,我们没有提供生物医学领域深度学习的调查,这在最近的评论中已广泛涵盖1,2,3,4,5.本文附有一个交互式教程,我们为感兴趣的读者创建了一个交互式教程,以构建卷积神经网络来发现 DNA 结合基序(参见 URL)。

深度学习作为一类机器学习方法

机器学习技术已广泛用于基因组学研究3,6.机器学习任务分为两大类:监督式和无监督式。在监督式学习中,目标是通过使用提供的一组标记训练示例来预测每个数据点的标签(分类)或响应(回归)。在无监督学习中,例如聚类和主成分分析,目标是学习数据本身的固有模式。

许多机器学习任务的最终目标是优化模型性能,而不是根据可用数据(训练性能),而是在独立数据集(泛化性能)上优化模型性能。为了实现这个目标,数据被随机分成至少三个子集:训练集、验证集和测试集。训练集用于学习模型参数(参考文献中有关参数优化的详细讨论。1),验证集用于选择最佳模型,并将测试集放在一边以估计泛化性能(图 D)。1). 机器学习必须在模型灵活性和训练数据量之间取得适当的平衡。过于简单的模型将欠拟合并且无法让数据“说话”。过于灵活的模型会过度拟合训练数据中的虚假模式,并且不会泛化。

网址

构建卷积神经网络以发现 DNA 结合基序的交互式教程,https://colab.research.google.com/drive/17E4h5aAOioh5DiTo7MZg4hpL6Z_0FyWr。

相关教程

https://mp.weixin.qq.com/s/vPqMK6yWRCwDuYyIlKNlpQ

Logo

魔乐社区(Modelers.cn) 是一个中立、公益的人工智能社区,提供人工智能工具、模型、数据的托管、展示与应用协同服务,为人工智能开发及爱好者搭建开放的学习交流平台。社区通过理事会方式运作,由全产业链共同建设、共同运营、共同享有,推动国产AI生态繁荣发展。

更多推荐