Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다.
필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

[Elephas] Jena Elephas를 이용하여 Spark에서 rdfTriples의 RDD를 만들고 RDD관련 작업하는 샘플소스

총관리자 2016.08.10 11:17 조회 수 : 98

1. 테스트용 triple rdf 파일인 test.ttl파일을 준비한다.

2. HDFS에 저장한다 : hadoop fs -put test.ttl

3. spark-submit을 이용하여 Spark Application을 실행한다.

: $HOME/spark/bin/spark-submit --master spark://sda1:7077,sda2:7077 --deploy-mode client --class ElephasTestBySpark --jars icbms-assembly-2.0.jar icbms-assembly-2.0.jar test.ttl

---------build.sbt(일부분) -----------

//elephas

("org.apache.jena" % "jena-elephas-common" % "3.1.0"),

("org.apache.jena" % "jena-elephas-io" % "3.1.0"),

("org.apache.jena" % "jena-elephas-mapreduce" % "3.1.0"),

// hadoop

("org.apache.hadoop" % "hadoop-common" % "2.7.2" % "provided"),

("org.apache.hadoop" % "hadoop-mapreduce-client-common" % "2.7.2" % "provided")

-------------------------ElephasTestBySpark.scala---------------------

import org.apache.spark.SparkConf

import org.apache.spark.SparkContext

import org.apache.jena.hadoop.rdf.io.input.TriplesInputFormat

import org.apache.hadoop.io.LongWritable

import org.apache.jena.hadoop.rdf.types.TripleWritable

import org.apache.hadoop.conf.Configuration

object ElephasTestBySpark{

def main(args: Array[String]) = {

val conf = new SparkConf()

.setAppName("ElephasTestBySpark")

val sc = new SparkContext(conf)

val hadoopConf = new Configuration()

val rdfTriples = sc.newAPIHadoopFile(args(0).toString(),

classOf[TriplesInputFormat],

classOf[LongWritable],

classOf[TripleWritable],

hadoopConf)

System.out.println("take 10 start-------------------");

rdfTriples.take(10).foreach(println)

System.out.println("take 10 end-------------------");

System.out.println("countByKey start-------------------");

rdfTriples.countByKey().foreach(println)

System.out.println("countByKey end-------------------");

}

이 게시물을

번호	제목	글쓴이	날짜	조회 수
221	https://github.com/Merck/Halyard프로젝트 컴파일및 배포/테스트	총관리자	2017.01.24	108
220	[SparkR]SparkR 설치 사용기 1 - Installation Guide On Yarn Cluster & Mesos Cluster & Stand Alone Cluster	총관리자	2016.11.04	107
219	kafkaWordCount.scala의 producer와 consumer 클래스를 이용하여 kafka를 이용한 word count 테스트 하기	총관리자	2016.08.02	107
218	TopBraid Composer에서 SPIN 사용법	총관리자	2016.02.25	106
217	[TLS/SSL]Cloudera CDH6.3.4기준 Hue TLS설정 항목	총관리자	2022.05.13	105
216	원격에 있는 git를 받은후 기존repository삭제후 새로운 리포지토리에 연결하여 소스 등록	총관리자	2019.07.13	104
215	kudu rebalance수행 command예시	총관리자	2022.01.17	103
214	RDF storage조합에대한 test결과(4store, Jena+HBase, Hive+HBase, CumulusRDF, Couchbase) 페이지 링크	총관리자	2016.05.26	103
213	우분투 16.04LTS에 Jupyter설치	총관리자	2018.04.17	102
212	php auction 프로그램	총관리자	2017.05.14	102
211	Kudu tablet이 FAILED일때 원인 확인 방법	총관리자	2022.01.17	101
210	참고할만한 spark예제를 설명하는 사이트	총관리자	2016.11.11	101
209	HBase write 성능 튜닝	총관리자	2017.07.18	100
208	It is indirectly referenced from required .class files 오류 발생시 조치방법	총관리자	2017.03.09	100
207	Jena는 기본적으로 multi thread환경을 지원하지 않는다.	총관리자	2016.08.16	100
206	impala session type별 표시되는 정보로 구분하는 방법	총관리자	2021.05.25	99
205	에러 추적(Error Tracking) 및 로그 취합(logging aggregation) 시스템인 Sentry 설치	총관리자	2018.03.14	99
204	MongoDB에 있는 특정컬럼의 값을 casting(string->integer)하여 update하기 java 소스	총관리자	2016.12.19	99
203	collection생성시 -shards와 -replicationFactor값을 잘못지정하면 write.lock for client xxx.xxx.xxx.xxx already exists오류가 발생한다.	총관리자	2016.04.28	99
202	[2.7.2] distribute-exclude.sh사용할때 ssh 포트변경에 따른 오류발생시 조치사항	총관리자	2018.01.02	98

쓰기 태그

첫 페이지 22 23 24 25 26 27 28 29 30 31 끝 페이지

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc.
We are open to the required minutes. Please send inquiries to gooper@gooper.com.

Bigdata, Semantic IoT, Hadoop, NoSQL

Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다.
필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

fuseki/jena/ [Elephas] Jena Elephas를 이용하여 Spark에서 rdfTriples의 RDD를 만들고 RDD관련 작업하는 샘플소스

댓글 0

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc.
We are open to the required minutes. Please send inquiries to gooper@gooper.com.

Bigdata, Semantic IoT, Hadoop, NoSQL

Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다. 필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

fuseki/jena/ [Elephas] Jena Elephas를 이용하여 Spark에서 rdfTriples의 RDD를 만들고 RDD관련 작업하는 샘플소스

댓글 0

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc. We are open to the required minutes. Please send inquiries to gooper@gooper.com.

LOGIN

Bigdata, Hadoop ecosystem, Semantic IoT등의 프로젝트를 진행중에 습득한 내용을 정리하는 곳입니다.
필요한 분을 위해서 공개하고 있습니다. 문의사항은 gooper@gooper.com로 메일을 보내주세요.

A personal place to organize information learned during the development of such Hadoop, Hive, Hbase, Semantic IoT, etc.
We are open to the required minutes. Please send inquiries to gooper@gooper.com.