Cloudera CDH/CDP 및 Hadoop EcoSystem, Semantic IoT등의 개발/운영 기술을 정리합니다. gooper@gooper.com로 문의 주세요.

halyard/rdf4j 9대가 hbase cluster로 구성된 서버에서 테스트 data를 halyard에 적재하고 테스트 하는 방법및 절차

총관리자 2017.07.21 11:11 조회 수 : 2997

0. test데이타는 Fuseki에서 사용중인 데이타를 백업한 파일을 이용한다.(트리플 개수 : 12700751)

(파일이름 : icbms_2017-06-19_16-09-05.nq.gz )

*LUBM93000 : 약 110억(11615964562)건의 triple, 1TB용량, 데이타 생성하는데 약 1일 소요됨, 카운트 시간(Halyard이용) 약 22시간(80069028ms)

*LUBM20000 : 약 22억건의 triple,

*LUBM3000 : 약 33억건의 triple, 33MB용량

*LUBM1000 : 약 20.4G용량

*LUBM100 : 약 2.0G용량

*LUBM10 : 약 195.1M용량

*LUBM1 : 약 1만건의 triple, 15.2M용량

1. HDFS폴더 생성
hdfs dfs -mkdir gooper-test

2. console에서 repo생성
create hbase -> gooperRepo, 타임아웃시간 ->7일(604800초)

3. test owl파일 HDFS적재
hdfs dfs -put icbms_2017-06-19_16-09-05.nq.gz gooper-test

4. Halyard의 임시 저장소 삭제
hdfs dfs -rm -r gooper-test/temp

5. HDFS데이타를 Halyard에 적재
./bulkload gooper-test gooper-test/temp gooperRepo

6. query수행

가. fuseki에서 sparql을 실행하는 결과와 같은 결과가 나옴

나. 카운트등이 포함된 쿼리를 TDB를 이용한 fuseki를 이용하는 경우 1초미만 소요됨

다. 나와 동일한 쿼리를 Halyard의 console을 이용하면 약7.2분 소요됨

라. 카운트

gooperRepo> sparql
enter multi-line SPARQL query (terminate with line containing single '.')
select (count(*) as ?cnt) where {?s ?p ?o}
.
Evaluating SPARQL query...
+-----------------------------------------------------------------------------+
| cnt |
+-----------------------------------------------------------------------------+
| "12700751"^^<http://www.w3.org/2001/XMLSchema#integer> |
+-----------------------------------------------------------------------------+
1 result(s) (143744 ms)

이 게시물을

이 글의 추천인 목록 목록

번호	제목	날짜	조회 수
78	fuseki의 endpoint를 이용한 insert, delete하는 sparql예시	2018.02.14	1115
77	전체 컨택스트 내용	2017.12.19	1272
76	oneM2M Specification(Draft Release 3, 2, 1), Draft Technical Reports	2017.10.25	1536
75	fuseki에서 제공하는 script중 s-post를 사용하는 예문	2017.09.15	2091
74	halyard 1.3의 console을 이용하여 100억건의 데이타에 대한 쿼리수행시 ScannerTimeoutException 발생시 조치사항	2017.09.06	1990
73	RDF4J의 RESTFul API처리 클래스 소스 파악(web module위주)	2017.08.30	1604
72	RDF4J의 rdf4j-server.war가 제공하는 RESTFul API를 이용한 CRUD테스트(트랜잭션처리)	2017.08.30	2040
71	RDF4J의 rdf4j-server.war가 제공하는 RESTFul API를 이용하여 repository에 CRUD테스트	2017.08.30	1953
70	DeviceType이 o:motion-sensor_33 이거나 o:motion-sensor_32 경우의 sparql문장은 다음과 같다.	2017.08.16	2217
69	[oneM2M]Ontologies used for oneM2M	2017.08.02	2070
68	jena/fuseki 3.4.0 설치	2017.07.25	2026
67	LUBM 데이타 생성구문	2017.07.24	6132
»	9대가 hbase cluster로 구성된 서버에서 테스트 data를 halyard에 적재하고 테스트 하는 방법및 절차	2017.07.21	2997
65	halyard의 console스크립트에서 생성한 repository는 RDF4J Web Applications에서 공유가 되지 않는다.	2017.07.05	2170
64	halyard 1.3의 rdf4j-server.war와 rdf4j-workbench.war를 tomcat deploy후 조회시 java.lang.NoClassDefFoundError: org/apache/hadoop/hbase/Cell발생시 조치사항	2017.07.05	1158
63	halyard 1.3을 다른 서버로 이전하는 방법	2017.07.05	2023
62	숭실대 교수님등 강의영상(바이오데이터마이닝, 빅데이터분산컴퓨팅, 컴퓨터 그래픽스, 데이터베이스응용및 프로그램밍, 데이터베이스, 의생명영상처리, 웹그로그래밍, 데이터마이닝, 컴퓨터구조)	2017.06.13	1602
61	시맨틱 관련 논문 모음 사이트	2017.06.13	1072
60	fuseki용 config-examples.ttl 예시 내용	2017.05.17	1664
59	fuseki webUI를 통해서 전체 카운트를 하면 급격하게 메모리를 소모해 버리는 문제가 있음	2017.04.28	1888

쓰기 태그

첫 페이지 1 2 3 4 끝 페이지

Cloudera, BigData, Semantic IoT, Hadoop, NoSQL

Cloudera CDH/CDP 및 Hadoop EcoSystem, Semantic IoT등의 개발/운영 기술을 정리합니다. gooper@gooper.com로 문의 주세요.

halyard/rdf4j 9대가 hbase cluster로 구성된 서버에서 테스트 data를 halyard에 적재하고 테스트 하는 방법및 절차

댓글 0

Cloudera, BigData, Semantic IoT, Hadoop, NoSQL

Cloudera CDH/CDP 및 Hadoop EcoSystem, Semantic IoT등의 개발/운영 기술을 정리합니다. gooper@gooper.com로 문의 주세요.

halyard/rdf4j 9대가 hbase cluster로 구성된 서버에서 테스트 data를 halyard에 적재하고 테스트 하는 방법및 절차

댓글 0

LOGIN