Skip to main content
Recommended
PDF
PDF
Hadoop conferencejapan2011
PPTX
Gcpug tokyo february 2016
PDF
Aerospike deep dive migration
PDF
【14-B-2】グリーを支えるデータ分析基盤の過去と現在(橋本泰一〔グリー〕)
PPTX
リクルートテクノロジーズ における EMR の活用とコスト圧縮方法
PDF
SparkやBigQueryなどを用いたモバイルゲーム分析環境
PPTX
sparksql-hive-bench-by-nec-hwx-at-hcj16
PDF
PDF
SQL on Hadoop 比較検証 【2014月11日における検証レポート】
PPTX
PDF
スキーマレスカラムナフォーマット「Yosegi」で実現する スキーマの柔軟性と処理性能を両立したログ収集システム / Hadoop / Spark Con...
PDF
Apache Ambari Overview -- Hadoop for Everyone
PDF
PDF
ビッグデータ活用を加速する!分散SQLエンジン Spark SQL のご紹介 20161105 OSC Tokyo Fall
PDF
PDF
Apache Atlasの現状とデータガバナンス事例 #hadoopreading
PDF
[db tech showcase Tokyo 2016] B31: Spark Summit 2016@SFに参加してきたので最新事例などを紹介しつつデ...
PPTX
Case Study: OLAP usability on Spark and Hadoop
PDF
PDF
Hadoop/Spark で Amazon S3 を徹底的に使いこなすワザ (Hadoop / Spark Conference Japan 2019)
PDF
PDF
Apache NiFi の紹介 #streamctjp
PDF
Yahoo! JAPAN の Ambari 活用事例 #ambarimeetup
PDF
PDF
Hadoopエコシステムの最新動向とNTTデータの取り組み (OSC 2016 Tokyo/Spring 講演資料)
PDF
HDFSのスケーラビリティの限界を突破するためのさまざまな取り組み | Hadoop / Spark Conference Japan 2019 #hc...
PDF
Impala データサイエンティストのための 高速大規模分散基盤 #tokyowebmining
PDF
Impalaチューニングポイントベストプラクティス
PDF
Cloudera Impalaをサービスに組み込むときに苦労した話
More Related Content
PDF
PDF
Hadoop conferencejapan2011
PPTX
Gcpug tokyo february 2016
PDF
Aerospike deep dive migration
PDF
【14-B-2】グリーを支えるデータ分析基盤の過去と現在(橋本泰一〔グリー〕)
PPTX
リクルートテクノロジーズ における EMR の活用とコスト圧縮方法
PDF
SparkやBigQueryなどを用いたモバイルゲーム分析環境
PPTX
sparksql-hive-bench-by-nec-hwx-at-hcj16
What's hot
PDF
PDF
SQL on Hadoop 比較検証 【2014月11日における検証レポート】
PPTX
PDF
スキーマレスカラムナフォーマット「Yosegi」で実現する スキーマの柔軟性と処理性能を両立したログ収集システム / Hadoop / Spark Con...
PDF
Apache Ambari Overview -- Hadoop for Everyone
PDF
PDF
ビッグデータ活用を加速する!分散SQLエンジン Spark SQL のご紹介 20161105 OSC Tokyo Fall
PDF
PDF
Apache Atlasの現状とデータガバナンス事例 #hadoopreading
PDF
[db tech showcase Tokyo 2016] B31: Spark Summit 2016@SFに参加してきたので最新事例などを紹介しつつデ...
PPTX
Case Study: OLAP usability on Spark and Hadoop
PDF
PDF
Hadoop/Spark で Amazon S3 を徹底的に使いこなすワザ (Hadoop / Spark Conference Japan 2019)
PDF
PDF
Apache NiFi の紹介 #streamctjp
PDF
Yahoo! JAPAN の Ambari 活用事例 #ambarimeetup
PDF
PDF
Hadoopエコシステムの最新動向とNTTデータの取り組み (OSC 2016 Tokyo/Spring 講演資料)
PDF
HDFSのスケーラビリティの限界を突破するためのさまざまな取り組み | Hadoop / Spark Conference Japan 2019 #hc...
PDF
Impala データサイエンティストのための 高速大規模分散基盤 #tokyowebmining
Viewers also liked
PDF
Impalaチューニングポイントベストプラクティス
PDF
Cloudera Impalaをサービスに組み込むときに苦労した話
KEY
PDF
Cloudera impalaの性能評価(Hiveとの比較)
PDF
20140708 オンラインゲームソリューション
PPT
Hadoop ~Yahoo! JAPANの活用について~
PPT
Hadoop Conference Japan 2009 #1
PDF
基礎から学ぶ超並列SQLエンジンImpala #cwt2015
PDF
PPTX
お見合いで趣味を聞かれたときに 「IoTとビッグデータを少々」と答えたいSEが読む資料
PDF
Business Innovation cases driven by AI and BigData technologies
PDF
Investment in Yahoo! JAPAN's dataplatform and business growth by big data
PDF
PDF
PDF
1000台規模のHadoopクラスタをHive/Tezアプリケーションにあわせてパフォーマンスチューニングした話
PDF
NetflixにおけるPresto/Spark活用事例
PPTX
SEGA : Growth hacking by Spark ML for Mobile games
PDF
Amebaにおけるレコメンデーションシステムの紹介
PDF
Yahoo! JAPANのデータ基盤とHadoop #dbts2016
PDF
Hadoop’s Impact on Recruit Company
Similar to Webdb2011 hadoop
PDF
PDF
PPTX
ATN No.1 MapReduceだけでない!? Hadoopとその仲間たち
PPTX
1,000,000 foot view of Hadoop-like parallel data processing systems
PDF
20141106_cwt-zenmyo-naito
PPTX
Flumeを活用したAmebaにおける大規模ログ収集システム
PDF
PDF
PDF
【17-E-3】Hadoop:黄色い象使いへの道 ~「Hadoop徹底入門」より~
PPTX
PDF
PPTX
PPT
Hadoop~Yahoo!Japanの活用について
PDF
アメーバピグにおける自作サーバ運用それからどうなった
PDF
Hadoop上の多種多様な処理でPigの活きる道 (Hadoop Conferecne Japan 2013 Winter)
PDF
PDF
PDF
並列分散処理基盤Hadoopの紹介と、開発者が語るHadoopの使いどころ (Silicon Valley x 日本 / Tech x Business ...
PDF
40分でわかるHadoop徹底入門 (Cloudera World Tokyo 2014 講演資料)
PDF
Amazon Elastic MapReduceやSparkを中心とした社内の分析環境事例とTips
Webdb2011 hadoop 1. 2. 2
株式会社サイバーエージェント
名前 : 福田一郎 (フクダ イチロー)
所属 : 株式会社サイバーエージェント
アメーバ事業本部
Ameba Technology Laboratory(新卒4年目)
• Ameba Pigg運用,開発
• ログ解析基盤 「Patriot」設計,開発,運用
• Ameba Technology Laboratory 研究室長
【Twitter】 @toutou 【はてなID】 id:ICHIRO
自己紹介
過 去
現 在
3. 4. 5. 6. 7. 8. 9. 10. 11. 12. 13. 14. 15. 16. 17. 18. 19. 20. 20
株式会社サイバーエージェント
HiveQL
CREATE TABLE pigg_login
( time STRING, ameba_id STRING, ip STRING)
partitioned by(dt STRING)
ROW FORMAT DELIMITED FIELDS TERMINATED BY ‘¥t’
STORED AS SEQUENCEFILE;
SELECT p.age, count(distinct l.ameba_id)
FROM pigg_login l
JOIN profile p on (l.ameba_id=p.ameba_id)
WHERE l.dt= ‘2011-11-04‘ GROUP BY p.age;
• SQLライクに記述できるので便利
• Map/Reduceを直接書いた場合と同等の実行速度
21. 22. 23. 24. 25. 26. 27. 28. 29. 30. 31. 32. 33. 34. 34
株式会社サイバーエージェント
RowKeyの設計
Row Key Column Key Value
“1,FOLLOW,OUTGOING” g:2 date=2011/1/12
g:3 date=2011/4/20
“2,FOLLOW,INCOMING” g:1 date=2011/1/12
“2,FOLLOW,OUTGOING” g:3 date=2011/2/9
“3,FOLLOW,INCOMING” g:1 date=2011/4/20
g:2 date=2011/2/9
1 2
3
datedatedatedate 2011/01/122011/01/122011/01/122011/01/12
Follow
Follow Follow
35. 36. 36
株式会社サイバーエージェント
• 定型集計,解析
• 非定型集計,解析
• リアルタイム集計,解析
• オンライン処理向けデータストア
Hadoop関連プロダクト適用範囲の拡大
• Hive,HBase,Zookeeper
• Flume
• Flume NG:大きめの改修か?
• Hadoop0.23
• Map/Reduce以外のアルゴリズムサポート(BSP,MPIなど?)
• NameNode,JobTrackerの大幅な変更
• Hadoopディストリビューション:CDHなど
Hadoop関連プロダクトの充実
37. 38.