HDFS共24篇 第3页
HDFS(Hadoop Distributed File System)‌是Hadoop生态系统中的一个核心组件,旨在运行在分布式环境中,特别适合存储和处理大规模数据集。HDFS是一个高度容错和高度可用的分布式文件系统,设计用于在廉价的硬件上运行,并提供高吞吐量的数据访问能力‌。

通过系统日志采集大数据的实现方法

通过系统日志采集大数据的实现方法-华尔子博-奥夏网
许多公司的平台每天都会产生大量的日志,并且一般为流式数据,如搜索引擎的 pv 和查询等。处理这些日志需要特定的日志系统,这些系统需要具有以下特征。 构建应用系统和分析系统的桥梁,并将它...
天山雪莲的头像-华尔子博-奥夏网天山雪莲4年前
02220

分布式SQL大数据查询引擎的发展,什么是分布式查询引擎

分布式SQL大数据查询引擎的发展,什么是分布式查询引擎-华尔子博-奥夏网
介绍 从高层的角度来看,许多数据和分析解决方案已经以相同的方式构建了许多年。 简而言之,它由各种集成过程组成,可将所有数据加载到一个中央位置,这是即将到来的数据建模和分析用例的唯一事...
南宫世家的头像-华尔子博-奥夏网南宫世家4年前
02250

Hadoop大数据处理框架简介,什么是Hadoop 生态圈?

Hadoop大数据处理框架简介,什么是Hadoop 生态圈?-华尔子博-奥夏网
Hadoop 是一个处理、存储和分析海量的分布式、非结构化数据的开源框架。最初由 Yahoo 的工程师 Doug Cutting 和 Mike Cafarella 在 2005 年合作开发。后来,Hadoop 被贡献给了 Apache 基金会,...
天山雪莲的头像-华尔子博-奥夏网天山雪莲4年前
02030

Hadoop HDFS分布式文件系统简介及特性

Hadoop HDFS分布式文件系统简介及特性-华尔子博-奥夏网
在大数据时代,需要处理分析的数据集的大小已经远远超过了单台计算机的存储能力,因此需要将数据集进行分区并存储到若干台独立的计算机中。但是,分区存储的数据不方便管理和维护,迫切需要一种...
天山雪莲的头像-华尔子博-奥夏网天山雪莲4年前
02530