Cloudera CDH/CDP 및 Hadoop EcoSystem, Semantic IoT등의 개발/운영 기술을 정리합니다. gooper@gooper.com로 문의 주세요.

spark Apache Spark와 Drools를 이용한 CEP구현 테스트

총관리자 2016.07.15 10:20 조회 수 : 2602

* sprue는 Apache Spark와 Drools를 이용한 CEP구현한 예제 소스이다.

(참고 : https://github.com/mganta/sprue)

<<준비/설정>>

1. hbase에 테이블 생성

create 'patientData', {NAME => 'cf1', VERSIONS => 3, REPLICATION_SCOPE => 1, COMPRESSION => 'SNAPPY'}

==> hbase 버전에 따라서 아래의 오류가 발생할 수 있는데 그때는 COMPRESSION => 'SNAPPY'부분을 빼고 실행한다.

* 다음의 사이트에서 로직을 테스트 할 수 있다.

: http://www.mdcalc.com/sirs-sepsis-and-septic-shock-criteria/

2. drools가 사용하는 의사결정테이블 파일은 src/main/resources/sepsis.xls를 사용한다.

3. driver program은 3개의 인자를 받는다.

a. zookeeper info

b. rules xls file

c. open tsdb url

- opentsdb이 설치되지 않았으면 SepsisStream.scala파일의 94(97 ?)라인을 주석처리한다.

- HBase가 설정되지 않았다면 69 & 80(73 & 84 ?) 라인을 주석처리한다.

- local mode로 실행할 경우는 SepsisStream.scala파일의 40 & 41의 주석을 바꾼다.

4. 이 프로그램은 queueRDD를 이용하여 sample data를 생성한다.

<<컴파일/실행하기>>

1. mvn clean package

//2. Create the hbase table. Sample script in src/main/resource/create_hbase_table.rb

//3. Install opentsdb (http://opentsdb.net/docs/build/html/installation.html)

4. Start spark streaming using

spark-submit --driver-java-options

'-Dspark.executor.extraClassPath=/opt/cloudera/parcels/CDH/lib/hbase/lib/htrace-core-3.1.0-incubating.jar'

--master yarn-client

--files sepsis.xls

--class com.cloudera.sprue.SepsisStream

/path_to/sprue-0.0.1-SNAPSHOT-jar-with-dependencies.jar

sepsis.xls zookeeper.host.domain:2181

http://opentsdb.host.domain:4242/api/put

* spark.executor.extraClassPath옵션은 spark에서 실행되는 hbase의 설치위치의 lib에 있는 htrace-core-3.1.0-incubating.jar를 지정한다.

* files옵션은 spark executor들이 사용하는 xls파일을 업로드 한다.

-------------------오류내용------------------------

ERROR: org.apache.hadoop.hbase.DoNotRetryIOException: Compression algorithm 'snappy' previously failed test. Set hbase.table.sanity.checks to false at conf or table descriptor if you want to bypass sanity checks

at org.apache.hadoop.hbase.master.HMaster.warnOrThrowExceptionForFailure(HMaster.java:1603)

at org.apache.hadoop.hbase.master.HMaster.sanityCheckTableDescriptor(HMaster.java:1542)

at org.apache.hadoop.hbase.master.HMaster.createTable(HMaster.java:1452)

at org.apache.hadoop.hbase.master.MasterRpcServices.createTable(MasterRpcServices.java:429)

at org.apache.hadoop.hbase.protobuf.generated.MasterProtos$MasterService$2.callBlockingMethod(MasterProtos.java:52195)

at org.apache.hadoop.hbase.ipc.RpcServer.call(RpcServer.java:2117)

at org.apache.hadoop.hbase.ipc.CallRunner.run(CallRunner.java:104)

at org.apache.hadoop.hbase.ipc.RpcExecutor.consumerLoop(RpcExecutor.java:133)

at org.apache.hadoop.hbase.ipc.RpcExecutor$1.run(RpcExecutor.java:108)

at java.lang.Thread.run(Thread.java:745)

Caused by: org.apache.hadoop.hbase.DoNotRetryIOException: Compression algorithm 'snappy' previously failed test.

at org.apache.hadoop.hbase.util.CompressionTest.testCompression(CompressionTest.java:91)

at org.apache.hadoop.hbase.master.HMaster.checkCompression(HMaster.java:1686)

at org.apache.hadoop.hbase.master.HMaster.checkCompression(HMaster.java:1679)

at org.apache.hadoop.hbase.master.HMaster.sanityCheckTableDescriptor(HMaster.java:1540)

... 8 more

이 게시물을

이 글의 추천인 목록 목록

번호	제목	날짜	조회 수
21	How-to: Tune Your Apache Spark Jobs (Part 2)	2016.10.31	1769
20	VisualVM 1.3.9을 이용한 spark-submit JVM 모니터링을 위한 설정및 spark-submit실행 옵션	2016.10.28	3400
19	java.lang.OutOfMemoryError: unable to create new native thread오류 발생지 조치사항	2016.10.17	2531
18	파일끝에 붙는 ^M 일괄 지우기(linux, unix(AIX)) 혹은 파일내에 있는 ^M지우기	2016.09.24	988
17	start-all.sh로 spark데몬 기동시 "JAVA_HOME is not set"오류 발생시 조치사항	2016.08.01	2452
»	Apache Spark와 Drools를 이용한 CEP구현 테스트	2016.07.15	2602
15	kafka로 부터 메세지를 stream으로 받아 처리하는 spark샘플소스(spark의 producer와 consumer를 sbt로 컴파일 하고 서버에서 spark-submit하는 방법)	2016.07.13	1922
14	spark-sql실행시 ERROR log: Got exception: java.lang.NumberFormatException For input string: "2000ms" 오류발생시 조치사항	2016.06.09	1489
13	spark-sql실행시 Caused by: java.lang.NumberFormatException: For input string: "0s" 오류발생시 조치사항	2016.06.09	5825
12	spark-sql실행시 The specified datastore driver ("com.mysql.jdbc.Driver") was not found in the CLASSPATH오류 발생시 조치사항	2016.06.09	4358
11	./spark-sql 실행시 "java.lang.NumberFormatException: For input string: "1s"오류발생시 조치사항	2016.06.09	1688
10	Scala버젼 변경 혹은 상황에 맞게 Spark소스 컴파일하기	2016.05.31	2193
9	spark client프로그램 기동시 "Error initializing SparkContext"오류 발생할때 조치사항	2016.05.27	2623
8	spark-submit으로 spark application실행하는 다양한 방법	2016.05.25	2514
7	spark 온라인 책자링크 (제목 : mastering-apache-spark)	2016.05.25	2559
6	"Initial job has not accepted any resources; check your cluster UI to ensure that workers are registered and have sufficient resources"오류 발생시 조치사항	2016.05.25	2593
5	spark-env.sh에서 사용할 수있는 항목.	2016.05.24	2585
4	Spark 1.6.1 설치후 HA구성	2016.05.24	2389
3	spark-shell실행시 "A read-only user or a user in a read-only database is not permitted to disable read-only mode on a connection."오류가 발생하는 경우 해결방법	2016.05.20	1460
2	Spark 2.1.1 clustering(5대) 설치(YARN기반)	2016.04.22	3343

쓰기 태그

첫 페이지 1 2 3 끝 페이지

Cloudera, BigData, Semantic IoT, Hadoop, NoSQL

Cloudera CDH/CDP 및 Hadoop EcoSystem, Semantic IoT등의 개발/운영 기술을 정리합니다. gooper@gooper.com로 문의 주세요.

spark Apache Spark와 Drools를 이용한 CEP구현 테스트

댓글 0

Cloudera, BigData, Semantic IoT, Hadoop, NoSQL

Cloudera CDH/CDP 및 Hadoop EcoSystem, Semantic IoT등의 개발/운영 기술을 정리합니다. gooper@gooper.com로 문의 주세요.

spark Apache Spark와 Drools를 이용한 CEP구현 테스트

댓글 0

LOGIN