Spark中加载本地（或者hdfs）文件以及SparkContext实例的textFile使用 - Hdfs - 程序员开发

设为首页加入收藏

编程入门

首页

C语言

C++开发

Python

Java

AI大数据: Hadoop

Hdfs

Spark

Hive

HBase

Flume

Kfaka

操作系统: Win

Linux

OS X

其它

windows编..

linux编程..

网络编程

热门语言: GO

PHP

R语言

.Net

Swift

Ruby

Scala

等级考试: C语言

C++

JAVA

面试

当前位置：

首页 -> 大数据 -> Hdfs

TOP

Spark中加载本地（或者hdfs）文件以及SparkContext实例的textFile使用

2019-05-06 00:21:41 【大中小】浏览:56次

Tags：Spark 加载本地或者 hdfs 文件以及 SparkContext 实例 textFile 使用

　　默认是从hdfs读取文件，也可以指定sc.textFile("路径").在路径前面加上hdfs://表示从hdfs文件系统上读
　　本地文件读取 sc.textFile("路径").在路径前面加上file:// 表示从本地文件系统读，如file:///home/user/spark/README.md

网上很多例子，包括官网的例子，都是用textFile来加载一个文件创建RDD，类似sc.textFile(“hdfs://n1:8020/user/hdfs/input”)

textFile的参数是一个path,这个path可以是：

1. 一个文件路径，这时候只装载指定的文件

2. 一个目录路径，这时候只装载指定目录下面的所有文件（不包括子目录下面的文件）

3. 通过通配符的形式加载多个文件或者加载多个目录下面的所有文件

第三点是一个使用小技巧，现在假设我的数据结构为先按天分区，再按小时分区的，在hdfs上的目录结构类似于：

/user/hdfs/input/dt=20130728/hr=00/

/user/hdfs/input/dt=20130728/hr=01/

…

/user/hdfs/input/dt=20130728/hr=23/

具体的数据都在hr等于某个时间的目录下面，现在我们要分析20130728这一天的数据，我们就必须把这个目录下面的所有hr=*的子目录下面的数据全部装载进RDD，于是我们可以这样写：sc.textFile(“hdfs://n1:8020/user/hdfs/input/dt=20130728/hr=*/”),注意到hr=*,是一个模糊匹配的方式。


【大中小】【打印】【繁体】【投稿】【收藏】【推荐】【举报】【评论】【关闭】【返回顶部】

上一篇：实时计算Flink > 独享模式 >..	下一篇：HDFS实验之二：关于复制因子

最新文章

centos-7 部署hadoop2.5.1 >>..

centos-7 部署hadoop2.5.1 >>..

Hadoop的转载

ganglia安装和配置

java查漏补缺（三）

热门文章

大数据笔试题大全

flink使用BucketingSink将文件写入h..

使用python中的pyhdfs连接HDFS进行..

HDFS高可用（HA）之ZKFC详解

HDFS查看文件的前几行-后几行-行数

Hot 文章

大数据笔试题大全

flink使用BucketingSink将文件写入h..

使用python中的pyhdfs连接HDFS进行..

HDFS高可用（HA）之ZKFC详解

HDFS查看文件的前几行-后几行-行数

Python

819

Django框架系列目录

655

创建Anaconda虚拟Pyt

1254

Python获取主目录的

893

Python中跨越多个文

543

chatgpt使用python写

745

一条爬虫抓取一个小

614

Python教程：sys.std

673

Python教程(13)——P

860

Docker安装配置Jupyt

741

【matplotlib基础】-

C 语言

543

C语言入坑总结

631

C数据结构-线性表之顺序表

1393

Programming abstractions in..

554

C语言内存布局

841

最全的李慧芹APUE-标准IO笔记

751

alog一个日志库

606

1.1.初识STM32及新建工程

808

codeblock安装及汉化教程

624

东方博宜OJ1000 熟悉一下Onli..

1352

关于指针与引用传递的效率问题

C++基础

1224

KMP 字符串匹配学习笔记

903

2.10 PE结构：重建重定位表结..

578

【Qt6】列表模型——抽象基类

702

2.12 PE结构：实现PE字节注入

628

569

2.14 PE结构：地址之间的转换

621

4.1 应用层Hook挂钩原理分析

980

使用Vulkan-Loader将ncnn代码..

644

4.3 IAT Hook 挂钩技术

551

C++ 学习笔记、01 | 开发简单..

大数据基础

1020

多线程：线程的同步

580

vertica-->kafka-

903

657

解决android studio

595

Kafka史上最详细原理

621

Error while fetchin

762

【Kafka】安装与快速

496

659

flume读取日志数据写

650

Authentication plug

linux编程基础

720

如何在Python中过滤字符串列表

728

如何在Python中读写文件

748

初识Lambda表达式

806

深入理解Python中的列表推导..

1028

如何在Python中执行外部命令

1088

设计模式之单例模式理解

601

跟我学Python GUI编程系列 - ..

1366

21道并发编程面试题

615

深入理解 Hadoop 序列化

985

CAS无锁机制深入理解

C/C++面试题目

1224

KMP 字符串匹配学习

578

【Qt6】列表模型——

903

2.10 PE结构：重建重

628

702

2.12 PE结构：实现PE

569

2.14 PE结构：地址之

980

使用Vulkan-Loader将

621

4.1 应用层Hook挂钩

644

4.3 IAT Hook 挂钩技

551

C++ 学习笔记、01 |

Copyright@https://www.cppentry.com all rights reserved 粤ICP备13067022号-3