生物小卡拉头像
关注
NCBI数据库下载原始数据封面图

NCBI数据库下载原始数据

NCBI下载原始测程序数据

提示:无论GEO还是SRA数据库,最终每个原始数据都会有一个唯一的SRR编号。

  • 下载方式

  • A. 直接官网点击下载:

        单个下载。

        简单粗暴,但是有的文件比较大,官网不支持直接下载,推荐使用sratools进行下载。

  • B. 直接使用ftp或者wget命令下载:

        可以批量下载。

        不建议,不支持断点,下载速度非常慢,有时候速度还不如直接官网下载。

  • C. 使用官方推荐的sratools工具进行下载:

        可以批量下载。

        虽然网上有很多相关方案,但是......,一用一个不吱声。

        下载安装软件后,整理需要下载数据的SRA号,然后使用prefetch命令可批量下载,下载完得到的文件需要进行拆分,才能得到常见的fastq.gz文件。

  • D. 使用Aspera软件进行下载:

        可以批量下载。

        熟悉使用Aspeara的可以优先试一下这个,不行再用后面的FileZilla。

        支持断点,速度快,但是.....,国家网关进出口管得严时候,很可能连接不上数据库;

  • E. 使用FileZilla软件进行下载:

        单个下载。

        支持断点,速度中规中矩,但是目前链接最为稳定,操作也比较简单。小白优选!!!

个人认为最为稳妥的下载方式排序:E>D>A>B>C

下面以FileZilla软件进行下载为例。

  • 下载软件FileZilla

        官网:https://filezilla-project.org/

        下载地址:https://filezilla-project.org/download.php?type=client

        多种操作系统供选择下载,然后按照需要安装在指定位置或者一键ok到底。

  • 连接NCBI服务器

    • FileZilla软件面板简介

    • 链接NCBI服务器

            NCBI原始数据存放主机IP地址是:ftp.sra.ebi.ac.uk

            连接后得到下面类似界面:

      • 整理需下载数据SRR号

              比如文章中给了原始测序数据的项目编号(比如项目编号PRJNA612527;GEO: GSE146970),直接NCBI搜索(两个编号都是,随便用其中一个),示例如下:

              搜索得到下面界面:

              然后点击下面图中位置进入样本界面:

              点击一个你想要下载的样本名进去,以第一个为例,跟着点点点就能得到SRR_ID:

              然后如法炮制,将需要下载原始数据的SRR编号整理成如下示例:

      Sample

      Group

      SRR_ID

      sample_1

      A

      SRR11305685

      sample_2

      A

      SRR11305686

      sample_3

      A

      SRR11305687

      sample_4

      B

      SRR11305688

      sample_5

      B

      SRR11305689

      sample_6

      B

      SRR11305690

              注:第一列是样本名称,第二列是样本分组;第三列是样本原始数据的SRR号。

              将SRR号进行拆分和补齐文件路径,弄成如下样式获得每个原始数据的远程站点:

              /vol1/fastq/SRR113/085/SRR11305685/

              /vol1/fastq/SRR113/086/SRR11305686/

              /vol1/fastq/SRR113/087/SRR11305687/

              /vol1/fastq/SRR113/088/SRR11305688/

              /vol1/fastq/SRR113/089/SRR11305689/

              /vol1/fastq/SRR113/090/SRR11305690/

      注:

      如果示例样本编号为SRR+8位数,拆分方式:SRR+前三位数字/0+最后两位数字/SRR编号/。原始数据所在远程站点位置即:/vol1/fastq/SRR+前三位数字/0+最后两位数字/SRR编号/。

      如果样本编号为SRR+7位数,拆分方式:SRR+前三位数字/00+最后一位数字/SRR编号/。原始数据所在远程站点位置即:/vol1/fastq/SRR+前三位数字/00+最后一位数字/SRR编号/。

      如果样本编号为SRR+6位数,拆分方式:SRR+前三位数字/SRR编号/。原始数据所在远程站点位置即:/vol1/fastq/SRR+前三位数字/SRR编号/。

      下载原始数据

      • 回到FileZilla软件

              你可能会发现下面图中位置显示连接中断:

      • 解决服务器链接断开问题

              连接NCBI数据存放数据服务器后,有一段时间没有进行任何操作(包括没有下载数据在下载等行为),服务器会自动断开链接,这个时候直接点一下快速链接就好了。

      • 进入目标站点

              第3.4章节“3.4远程站点整理”已经获得了每个原始数据的远程站点位置,以样本SRR11305685为例,远程站点是:/vol1/fastq/SRR113/085/SRR11305685/,将该远程站点粘贴到下图位置,然后键盘回车一下:

              然后得到类似下面界面:

      • 数据下载

              用鼠标拖完一个需要下载的样本原始数据后,可以直接将另一个远程站点的信息如法炮制粘贴进去,将需要下载文件拖到想要保存的本地位置,进行同时下载,远程站点之间数据可以同时下载。

              一般只要网络稳定,下载是不会被中断的,即使中断了也可通过下面标记位置进行查看原因,然后继续进行续传:

              好了,到这里就告一段落了,有需要补充的或者有更好方法的小伙伴call me,希望能帮助到更多的科研小伙伴!

      转载自 CSDN-专业IT技术社区

      原文链接:https://blog.csdn.net/weixin_62054183/article/details/151117375

      文章来源转载

      评论

      赞0

      评论列表

      微信小程序
      QQ小程序

      关于作者

      点赞数:0
      关注数:0
      粉丝:0
      文章:0
      关注标签:0
      加入于:--