Amazon发布可持续性数据集,可用于多个领域的数据分析

Amazon Web Services Open Data(AWSOD)和Amazon Sustainability(AS)正在合作,为AWS Simple Storage Service(S3)提供可持续性的数据集,并通过预处理数据集来实现最佳的数据检索,从而消除无差异的繁重工作。可持续性数据集通常来自卫星、地质研究、气象雷达、地图、农业研究、大气研究、政府和很多其他来源。

Amazon Web Services Open Data(AWSOD)和Amazon Sustainability(AS)正在合作,为AWS Simple Storage Service(S3)提供可持续性的数据集,并通过预处理数据集来实现最佳的数据检索,从而消除无差异的繁重工作。可持续性数据集通常来自卫星、地质研究、气象雷达、地图、农业研究、大气研究、政府和很多其他来源。

2018年12月10日,AWSOD和AS团队发布了第一组数据集。这些数据集向现有的AWS Open Data数据集种添加了一种新数据类别。这些可持续性数据集之前已经被公开,AWS现在正在改进数据集的访问便利性,例如,将大型存档文件分成可以独立检索的较小的可寻址块。AWS使用Simple Storage Service(S3)存储数据,并将存储桶设置为公开可访问。Simple Notification Services(SNS)用于向消费者发起新数据通知,并且在少数情况下使用CloudFront通过应用程序编程接口提供数据,以便加快检索速度。

为了进一步促进新数据集的使用,AWS正在与Group on Earth Observations(GEO)合作,拨出150万美元的AWS Cloud Credits,以获得有关地球的见解。

AWS提供了如何使用可持续性开放数据集的文档以及用于搜索数据集的标签。“非洲土壤信息服务(AfSIS)土壤化学”数据集可以用来学习如何将机器学习应用于开放数据。使用开放数据集的社区第三方贡献者发布了一些博文,介绍了如何使用公共数据集:

此外,AWS的一些客户成功地在云端使用可持续性数据:

负责农业数据分析的Sebastian Fritsch参与了AWS有关卫星数据集使用的问答,他被问道:“在你看来有什么亮点吗”?他回答说:“只需要修改几行代码就可以将数据产品从相对较小的试点区域扩展到全局,对我们来说,这是一个亮点”。

在可持续性数据集发布之前,AWS Global Open Data主管Jed Sundwall谈到了如何不断改进AWS传输PB级开放数据的能力。AWS正在向开放数据集中添加各种索引(包括外部索引、文件命名和内部索引),以增加访问便利性。AWS的工作人员正在观察社区的情况,并意识到他们可以通过社区构建的数据集处理机制来衡量数据集的成功程度。最后,AWS提供了一个明确定义的程序,用于支付成本,并让新的贡献者通过AWS提供公共数据集。

查看英文原文:https://www.infoq.com/news/2019/01/amazon-sustainability-datasets

發表評論
所有評論
還沒有人評論,想成為第一個評論的人麼? 請在上方評論欄輸入並且點擊發布.
相關文章