文章详情

短信预约-IT技能 免费直播动态提醒

请输入下面的图形验证码

提交验证

短信预约提醒成功

机器学习面临的三个关键数据挑战

2024-12-11 21:40

关注

 

 

接下来,让我们深入研究其中的每一个,以便大家了解如何克服机器学习的这些挑战:

1. 质量

许多数据科学家希望利用外部来源的数据。然而,通常没有质量控制或保证如何捕获原始数据。

你相信外部数据的准确性吗?

这是一个很好的例子。漂浮在海洋中的浮标上的传感器收集有关海洋温度的数据。但是,当传感器无法收集温度时,它将记录为999。此外,在2000年之前,仅用两个数字记录了年份的数字。但是在2000年之后,记录的数字变为了四个。

因此,我们需要了解数据的质量以及如何准备数据。在这种情况下,分析浮标数据的科学家可以使用平均值、均值、最小值、最大值来可视化原始数据,捕获这些数据库错误并相应地对其进行清理。

2. 稀疏性

在这种情况下,稀疏适用于元数据。通常,元数据字段不完整,有些字段已填写,有些字段留空。如果数据是从单一来源生成的,则可能是由于人类缺乏规范或知识所致。但是,如果数据来自各种来源,而没有元数据的标准定义,则每个数据集可能具有完全不同的字段。因此,将它们组合在一起时,完成的字段可能不对应。

当前,关于捕获哪些元数据没有行业标准。然而,元数据与数据本身一样重要。当您具有填充了不同元数据字段的相同类型的数据时,如何关联和过滤数据?

如果以浮标为例,初始数据传感器每十分钟收集一次水温,而较新的浮标每三分钟收集一次水温。关联数据的唯一方法是通过元数据在捕获时公开。当科学家进行历史分析时,他们需要元数据以便能够相应地调整其模型。

3. 完整性

数据完整性是数据准确性和一致性的保证。数据保管链对于证明数据在流水线和位置中移动时不会受到损害至关重要。当数据的捕获和摄取受到控制时,您可以相对轻松地验证其完整性。但是,与他人合作时,很难进行验证。生成数据时,没有用于外部数据的安全证书。您也不能确保数据记录完全符合预期,也不能确保接收到的数据与原始记录时完全相同。

关于物联网数据和区块链存在一些有趣的概念,但是,在广泛采用这种概念之前,数据完整性取决于安全技术和策略的结合。例如,由于数据在静态或传输过程中可能会受到威胁,因此通过网络传输的数据应使用https,并且在静态时应进行加密。另一方面,访问控制应受策略驱动,以避免人为错误。

如何开始?

数据质量、稀疏性和完整性直接影响最终模型的准确性,并且是当今机器学习面临的一些比较大的挑战。拥有清晰数据定义,政策并探索行业特定数据标准的组织将在短期和长期项目中受益。

如果您还没有,那么您的组织应该首先定义自己的数据收集策略,元数据格式,然后应用标准的安全技术。数据质量和稀疏性齐头并进。下一步,设置元数据策略,并确保可以使用捕获的定性数据来验证数据的有效性。最后,为了确保数据完整性,可以在生成数据时应用数字证书,应该在传输过程中强制使用SSL,并且始终保持启用加密状态。

安全数据协作

如果您所在的行业需要与外部组织不断交换数据,那么最好开放您的数据和元格式的源代码,因为这些标准比许多专有标准更广泛。更好的是,您可以发起一个行业开放标准委员会,让其他人参与和贡献。一个很好的例子是“开放目标”(https://www.opentargets.org/),这是一种“公私合作伙伴关系,利用人类遗传学和基因组学数据进行系统的药物靶点识别和优先排序。”

尤其是研究数据生态系统已经变得高度复杂,组织内部和外部的合作者需要快速访问数据以及简化数据管理的方法。机器学习的挑战很多。第一步是使用正确的数据和基础结构启动项目。

 

来源:千家网内容投诉

免责声明:

① 本站未注明“稿件来源”的信息均来自网络整理。其文字、图片和音视频稿件的所属权归原作者所有。本站收集整理出于非商业性的教育和科研之目的,并不意味着本站赞同其观点或证实其内容的真实性。仅作为临时的测试数据,供内部测试之用。本站并未授权任何人以任何方式主动获取本站任何信息。

② 本站未注明“稿件来源”的临时测试数据将在测试完成后最终做删除处理。有问题或投稿请发送至: 邮箱/279061341@qq.com QQ/279061341

软考中级精品资料免费领

  • 历年真题答案解析
  • 备考技巧名师总结
  • 高频考点精准押题
  • 2024年上半年信息系统项目管理师第二批次真题及答案解析(完整版)

    难度     813人已做
    查看
  • 【考后总结】2024年5月26日信息系统项目管理师第2批次考情分析

    难度     354人已做
    查看
  • 【考后总结】2024年5月25日信息系统项目管理师第1批次考情分析

    难度     318人已做
    查看
  • 2024年上半年软考高项第一、二批次真题考点汇总(完整版)

    难度     435人已做
    查看
  • 2024年上半年系统架构设计师考试综合知识真题

    难度     224人已做
    查看

相关文章

发现更多好内容

猜你喜欢

AI推送时光机
位置:首页-资讯-后端开发
咦!没有更多了?去看看其它编程学习网 内容吧
首页课程
资料下载
问答资讯