辦了一個Github帳號 未來會把code都放在那
https://github.com/kurthung1224
linux端安裝
yum install git-core
使用指令
辦了一個Github帳號 未來會把code都放在那
https://github.com/kurthung1224
linux端安裝
yum install git-core
使用指令

當初我在安裝CentOS時硬碟使用的是default的8GB 結果在做個Big Data專題時把inode給塞爆
造成不系統沒辦法再創建檔案 紀錄一下解決過程
df -i
發現Inodes滿了
1. 登入系統先刪掉一點log ...不然什麼事都無法做

今天再用logstash把資料pass給Elasticsearch的時候發現 當讀的檔案到一定的數量後就會出現此Error
一開始以為是logstash或elasticsearch的bug 最後才發現是系統設定的允許開啟的檔案數的問題
ulimit -n
可以看到目前系統允許可開啟的檔案數量 default顯示1024
更改方式
這問題會出現在使用logstash讀入同樣檔名的file時出現 但從elasticsearch裡卻完全沒看到我們的資料
使用debug mode只看到logstash不斷的出現
_discover_file_glob: /var/log/test/: glob is: ["/var/log/test/test.json"] {:level=>:debug, :file=>"filewatch/watch.rb", :line=>"117"}
_discover_file_glob: /var/log/test/: glob is: ["/var/log/test/test.json"] {:level=>:debug, :file=>"filewatch/watch.rb", :line=>"117"}
其實這並不是bug 而是logstash是一個輸入流 所以當你舊的資料沒有更動又重讀進去後 logstash自然會從上次的結尾地方 並等待新的data

使用Spark前最好先學Scala 不然很多程式碼都看不懂 雖然他也支援JAVA和Python 但原生的code仍是使用Scala
首先我在spark目錄下建立一個123.txt
內容是
You are my little little apple
You are my little little apple

今天使用mahout時出現以下exception
java.net.ConnectException: Call From master01/192.168.70.101 to master01:10020
檢查mapred-site.xml裡是否有設置 mapreduce.jobhistory.address為master01:10020
不過有出現紅字部分代表我們之前有設定
原因是因為我們沒啟動jobhistory server

目前最新的是0.9版 但是官方0.9的版本超舊 還是用hadoop 1.x編譯的 所以當我們在呼叫mahout的Lib時會有以下error
所以一定要重新下載source code自行編譯 不要用官方提供的版本...
首先假設大家都裝好maven和git了
git clone https://github.com/apache/mahout.git
(我下載到路徑/opt 它會自動在底下建立一個mahout資料夾)

WARN util.NativeCodeLoader: Unable to load native-hadoop library for your platform... using builtin-java classes where applicable
裝了Hadoop 2.6.0後一直會出現這個Warning 本來以為可以忽略 但是Sqoop在啟動的時候會有問題 所以還是要想辦法解決
因為Apache提供的原生Hadoop bin檔是32bit 我的CentOS是64bit 所以lib會有問題
網路上試了幾種辦法都沒用 只好重新compile一版64bit的Hadoop 2.6.0
編譯Hadoop 2.6.0 error請參考註1.2.3

去Spark官網下載要的版本 http://spark.apache.org/downloads.html
目前最新是1.2.1
解壓縮到USB並mount後
cp -r /mnt/spark-1.2.1-bin-hadoop2.4 /opt/spark
設定路徑

無意間發現Hortonworks公司有出了一款Hadoop的Sandbox 可以搭配一些Virtual Machine來玩
這在上班時沒有Hadoop機台可以玩的時候偷玩還滿方便的
可以到這邊下載
http://hortonworks.com/products//hortonworks-sandbox/#install
官網有提供三種相對應的Sandbox: VirtualBox, VMware, Hyper-V

啟動MySQL 啟動Hive shell 上一篇Hive安裝有講到一點Hive指令 這篇繼續測試一些指令
1. 建立兩個table, pokes和invites
CREATE TABLE pokes (foo INT, bar STRING);
CREATE TABLE invites (foo INT, bar STRING) PARTITIONED BY (ds STRING);
2. 查看table描述:DESCRIBE