0.MBD-Seq에서 insert size를 어떻게 넣을 것인지. MEDIPS를 이용한다고 가정햇을때 single end 라면 insert size를 어떻게 판단할 것인지(spike in sample을 넣는등의 방법 고려), paired-end 라면 left read에다가 right read의 end position을 넣어서 마치 single end 데이터처럼 만들어서 extend 인자를 사용하지 않는식의 방법 고려.
1.MBD-Seq 할때 MEDIPS로 calibration curve를 그려서 CpG density dependency 체크해서 normalization 할지 결정.
2.MEDIPS 이용시 ROI 들을 정해서 biomart나 아니면 ucsc 에서 받아서 ROI 별 methylation level를 측정한다.
2.genome 상의 repeat region 을 어떻게 처리 할지 고려 : YH 논문에서는 local copy number 개념으로 접근해서 repeat region을 제거했고, 또 다른 논문에서는 아예 RepeatMasker로 genome 상의 repeat 부분을 mask 했다.
3.read duplication 제거
4.sampling curves for confirm read sufficiency
Friday, July 8, 2011
Thursday, July 7, 2011
Bismark manual 정리
음.. 이 포스팅 역시 보건원 과제에 의한 것으로.. BS-Seq 데이터를 reference에 mapping 할때 쓰는 프로그램인 Bismark의 manual을 정리한 것이다. 일반적으로 BS-Seq 한 논문들 보면 딱히 published 된 프로그램 말고 그냥 reference C->T로 바꾸고 read도 바꾸고 해서 그냥 각종 mapping 프로그램 사용하는데.. 어짜피 내가 짜는 것보단 published 된게 더 나을거 같다 싶어서 가장 최신으로 보이는 Bismark를 사용하기로 한다. 근데 뭐 잘 안맞으면 새로 만들어야 하니까..
사이트는 여기. 음 manual 보니까 Quick reference가 있다.
사이트는 여기. 음 manual 보니까 Quick reference가 있다.
Monday, July 4, 2011
SRA 데이터 변환 toolkit
안타깝게도..
오늘 GMI에서는 네이쳐에 십수명의 사람들의 RNA-Seq 분석해서 보니까 보전적인 RNA-modification 있다는 식으로 논문이 났다는데(아직 논문의 abstract 조차 보지 않았다. 금선생한테 들은거.. 내 조만간 얼마전 science에 나온 RNA-editing 조사한 논문이랑 이 논문이랑 비교해서 포스팅 하리라)..
본사 마크로젠에서는 RNA-Seq 데이터 조차 찾을 수 없어서.. cufflinks를 이용해 보려 했다만.. 데이터가 없는 관계로 논문의 SRA 데이터 다운 받아서 쓰려는데..
뭐 여튼 한없이 안타까운 맘은 뒤로 하고 SRA 데이터 변환 프로그램이 NCBI에서 제공한다. 혹시나 잊어버리지 않을까 하는 맘에 링크를 남긴다.
http://www.ncbi.nlm.nih.gov/books/NBK47540/#SRA_Download_Guid_B.5_Converting_SRA_for
오늘 GMI에서는 네이쳐에 십수명의 사람들의 RNA-Seq 분석해서 보니까 보전적인 RNA-modification 있다는 식으로 논문이 났다는데(아직 논문의 abstract 조차 보지 않았다. 금선생한테 들은거.. 내 조만간 얼마전 science에 나온 RNA-editing 조사한 논문이랑 이 논문이랑 비교해서 포스팅 하리라)..
본사 마크로젠에서는 RNA-Seq 데이터 조차 찾을 수 없어서.. cufflinks를 이용해 보려 했다만.. 데이터가 없는 관계로 논문의 SRA 데이터 다운 받아서 쓰려는데..
뭐 여튼 한없이 안타까운 맘은 뒤로 하고 SRA 데이터 변환 프로그램이 NCBI에서 제공한다. 혹시나 잊어버리지 않을까 하는 맘에 링크를 남긴다.
http://www.ncbi.nlm.nih.gov/books/NBK47540/#SRA_Download_Guid_B.5_Converting_SRA_for
Sunday, July 3, 2011
리눅스 커널 내부구조
이것 역시 부서 예산으로 샀다. 워낙에 평들이 좋아서 특히나 쉽게 써져 있다길래 샀는데.. 난 이정도도 이해 못하는 수준인 갑다. 메모리부분이랑 파일시스템은 그럭저럭 어떻게든 보겠는데 태스크 관리는 전혀 뭔소린지 모르겠다.. (아 그래도 인터럽트이니 트랩이니 시그널이니 뭐 이런 구분이 좀 모호 했는데 책을 보고 나면 개념이 선다.) 저자가 엄청 쉽게 쓸려고 노력했음에도 내 수준이 아직 많이 부족한지라.. 이 정도도 이해 못하고.. 좌절한다.. 아.. 뭔책을 봐도 이해 못할거 같은 겁이 나면서.. 뭐 리눅스는 내 평생 안고 가야 하는건데.. 이거 원 언제 한번 속시원함을 느껴 볼려나.. 여튼 내가 본 리눅스 책 중 가장 쉬운 책. 하지만 여전히 이해 안가는 책.
Friday, July 1, 2011
RNA-Seq mapping-first 방식 procedure
cufflinks의 사용법(단순 command 및 약간의 tip) 을 정리한다.
다음은 단지 cufflinks의 manual을 정리한 것이다.
설명 format은
숫자.명령어 (예: 1.tophat -r 50 ref read1.fastq read2.fastq) 다음 output 및 그 밖의 사항 설명
1.bowtie-build ref_seq.fa ref_seq
이는 tophat이 mapping을 할때 bowtie를 사용하는데 bowtie의 reference에 대한 index 파일을 생성한다. bowtie manual에 따르면 4개의 파일이 생성되야 하는데 실제론 6개의 파일이 생성된다(정확한 이유는 모르겠음).
2.tophat -r 50 -o tophat_result ref_seq read1.fq read2.fq
이를 실행하면 tophat_result 폴더에 tophat의 결과파일이 생성된다. accepted_hits.bam 파일이 read를 mapping 한 결과 파일이며 이것들을 정리한 것이 deletions.bed, insertion.bed, junction.bed. junction.bed 파일을 보자면 마지막 두 column이 junction의 size와 시작점을 나타낸다. junction의 시작점은 island의 시작점(그러니까 read가 overlap된 bundle)이 아니라 junction을 포함한 read의 시작점이다.
2.1.samtools index accepted_hits.bam
read가 align된 것을 samtools의 tview로 보기 위해서는 bam 파일을 indexing 해야 한다.
2.2.samtools tview accepted_hit.bam ref_seq
tview 통해 read의 alignment를 확인할 수 있다.
3.cufflinks -o cufflink_result tophat_result/accepted_hits.bam
결과는 cufflink_result 폴더 안에 transcripts.gtf 라는 파일이 생성. gtf1 파일 포멧은 다음 링크에 설명되어 있다.
3.1.cuffmerge -s ref_seq.fa assemblies.txt
위 명령어를 실행하면 merged_asm/merged.gtf 생성. 원래 cufflinks manual에 보면 human의 여러 tissue의 샘플로 위의 3번까지 진행하는데 각 tissue 별로 3번까지 진행해서 나온결과를 merge 한다.
3.2.cuffcompare -s ref_seq.fa -r known_annotation.gtf merged_asm/merged.gtf
이는 이미 알려진 annotation 데이터(여기서는 known_annotation.gtf) 파일과 비교해서 novel한 gene이나 isoform을 찾는다.
위에까지는 그냥 그냥 하는거고 differentially expressed and regulated gene을 찾는 방법 2가지를 workflow를 설명한다. 하나는 novel 한 gene을 안찾고 그냥 기존의 annotation file로다가 찾겠다는 거고, 다른 하나는 novel한 gene까지 찾아가겠다는걸로 후자 역시 기존의 annotation file 이용가능하다. 이건 그냥 cufflinks manual 보자
---------------------------reference-----------------------------
1.gff 파일 : gff 파일은 general feature format의 약자로 여러가지 버젼이 있는데 그중 cufflnks에서는 gtf2(general trascfer format)랑 gff3 만 인식한단다.
-gtf2 : column은 tab으로 분리 되어야 함
다음은 단지 cufflinks의 manual을 정리한 것이다.
설명 format은
숫자.명령어 (예: 1.tophat -r 50 ref read1.fastq read2.fastq) 다음 output 및 그 밖의 사항 설명
1.bowtie-build ref_seq.fa ref_seq
이는 tophat이 mapping을 할때 bowtie를 사용하는데 bowtie의 reference에 대한 index 파일을 생성한다. bowtie manual에 따르면 4개의 파일이 생성되야 하는데 실제론 6개의 파일이 생성된다(정확한 이유는 모르겠음).
2.tophat -r 50 -o tophat_result ref_seq read1.fq read2.fq
이를 실행하면 tophat_result 폴더에 tophat의 결과파일이 생성된다. accepted_hits.bam 파일이 read를 mapping 한 결과 파일이며 이것들을 정리한 것이 deletions.bed, insertion.bed, junction.bed. junction.bed 파일을 보자면 마지막 두 column이 junction의 size와 시작점을 나타낸다. junction의 시작점은 island의 시작점(그러니까 read가 overlap된 bundle)이 아니라 junction을 포함한 read의 시작점이다.
2.1.samtools index accepted_hits.bam
read가 align된 것을 samtools의 tview로 보기 위해서는 bam 파일을 indexing 해야 한다.
2.2.samtools tview accepted_hit.bam ref_seq
tview 통해 read의 alignment를 확인할 수 있다.
3.cufflinks -o cufflink_result tophat_result/accepted_hits.bam
결과는 cufflink_result 폴더 안에 transcripts.gtf 라는 파일이 생성. gtf1 파일 포멧은 다음 링크에 설명되어 있다.
3.1.cuffmerge -s ref_seq.fa assemblies.txt
위 명령어를 실행하면 merged_asm/merged.gtf 생성. 원래 cufflinks manual에 보면 human의 여러 tissue의 샘플로 위의 3번까지 진행하는데 각 tissue 별로 3번까지 진행해서 나온결과를 merge 한다.
3.2.cuffcompare -s ref_seq.fa -r known_annotation.gtf merged_asm/merged.gtf
이는 이미 알려진 annotation 데이터(여기서는 known_annotation.gtf) 파일과 비교해서 novel한 gene이나 isoform을 찾는다.
위에까지는 그냥 그냥 하는거고 differentially expressed and regulated gene을 찾는 방법 2가지를 workflow를 설명한다. 하나는 novel 한 gene을 안찾고 그냥 기존의 annotation file로다가 찾겠다는 거고, 다른 하나는 novel한 gene까지 찾아가겠다는걸로 후자 역시 기존의 annotation file 이용가능하다. 이건 그냥 cufflinks manual 보자
---------------------------reference-----------------------------
1.gff 파일 : gff 파일은 general feature format의 약자로 여러가지 버젼이 있는데 그중 cufflnks에서는 gtf2(general trascfer format)랑 gff3 만 인식한단다.
-gtf2 : column은 tab으로 분리 되어야 함
Sunday, June 26, 2011
클라우드 충격
얼마전에 행운씨랑 싸바싸바 해서 부서 예산으로 산 책 중의 하나. 출퇴근에 오가며 보고 있는데.. 어.. 재밌다.
예전부터 클라우드 컴퓨터라는게 그리드 컴퓨터랑 비슷한거 아닌가란 생각이 있었는데.. 그런 애매모호한 클라우드 컴퓨터의 정의에서 부터 그 클라우드 컴퓨터 내부 구축의 핵심이 무엇인지(물론 기술적으로 자세하게 나오진 않는다) 그리고 이 클라우드 사업을 리드하는 구글, 아마존, 세일즈포스닷컴에서는 어떤 식으로 클라우드 사업을 활용하는지, 그렇다면 이러한 인터넷 서비스 회사가 아닌 기존의 하드웨어 내지는 소프트웨어 회사들이 어떤식으로 대처를 하지는 그리고 우리(?)는 그러한 시대를 어떻게 이용해야 하는지를 간략하지만 명료하게 설명하고 있다.
특히나 재미있었던 것은 구글. 아마존이야 어짜피 HaaS이니까 좀 느낌이 일차원적이였는데.. 구글의 전략이 참으로 영특하다. 구글이 하는 서비스는 SaaS와 PaaS 로 구글 앱은 SaaS, 구글 앱 앤진은 PaaS. 그들이 크롬 브라우져를 만들고 안드로이드 os를 만들고 또 웹 호스팅 업체처럼 웹 서버 관리까지 해주는 이유가 명백하게 드러나게 된다. 생각해보면 안드로이드 os는 현재 pc의 윈도우 격이 되는거고 크롬 브라우져야 말로 자기네 사이트를 많이 이용하는 창을 만든거고 구글 앱 앤진은 계약금 없이 훌륭한 컨탠츠 제작자들을 끌어 모으는 효과니 결론 적으로 자기네 사이트로의 집중, 곧 이는 자신의 주 수입원인 구글 애드의 매출 증대로의 역할을 할것이라는 기대.
여기서 나오는 에코시스템이라는 용어가 맘에 든다(물론 아직 정확한 용어 이해는 아닌거 같지만). 이런 서비스는 누구하나 밑질게 없다. 오히려 서로 윈윈. 물론 나의 얕의 지식과 생각의 잘못된 판단일 지 모르지만 다른 한편으로는 내가 그렇게 생각한다는건 나 정도 아는 사람 내지는 나보다 덜 아는 사람은 나와 같이 생각할 수 있다는 것. 결코 이들의 회사 이윤 추구 방식은 그들을 좋은 사람으로 보이게 끔한다. 영특해. 이게 사업이다. 진짜 사업.
예전부터 클라우드 컴퓨터라는게 그리드 컴퓨터랑 비슷한거 아닌가란 생각이 있었는데.. 그런 애매모호한 클라우드 컴퓨터의 정의에서 부터 그 클라우드 컴퓨터 내부 구축의 핵심이 무엇인지(물론 기술적으로 자세하게 나오진 않는다) 그리고 이 클라우드 사업을 리드하는 구글, 아마존, 세일즈포스닷컴에서는 어떤 식으로 클라우드 사업을 활용하는지, 그렇다면 이러한 인터넷 서비스 회사가 아닌 기존의 하드웨어 내지는 소프트웨어 회사들이 어떤식으로 대처를 하지는 그리고 우리(?)는 그러한 시대를 어떻게 이용해야 하는지를 간략하지만 명료하게 설명하고 있다.
특히나 재미있었던 것은 구글. 아마존이야 어짜피 HaaS이니까 좀 느낌이 일차원적이였는데.. 구글의 전략이 참으로 영특하다. 구글이 하는 서비스는 SaaS와 PaaS 로 구글 앱은 SaaS, 구글 앱 앤진은 PaaS. 그들이 크롬 브라우져를 만들고 안드로이드 os를 만들고 또 웹 호스팅 업체처럼 웹 서버 관리까지 해주는 이유가 명백하게 드러나게 된다. 생각해보면 안드로이드 os는 현재 pc의 윈도우 격이 되는거고 크롬 브라우져야 말로 자기네 사이트를 많이 이용하는 창을 만든거고 구글 앱 앤진은 계약금 없이 훌륭한 컨탠츠 제작자들을 끌어 모으는 효과니 결론 적으로 자기네 사이트로의 집중, 곧 이는 자신의 주 수입원인 구글 애드의 매출 증대로의 역할을 할것이라는 기대.
여기서 나오는 에코시스템이라는 용어가 맘에 든다(물론 아직 정확한 용어 이해는 아닌거 같지만). 이런 서비스는 누구하나 밑질게 없다. 오히려 서로 윈윈. 물론 나의 얕의 지식과 생각의 잘못된 판단일 지 모르지만 다른 한편으로는 내가 그렇게 생각한다는건 나 정도 아는 사람 내지는 나보다 덜 아는 사람은 나와 같이 생각할 수 있다는 것. 결코 이들의 회사 이윤 추구 방식은 그들을 좋은 사람으로 보이게 끔한다. 영특해. 이게 사업이다. 진짜 사업.
Thursday, June 23, 2011
MBD-Seq, MeDIP-Seq 분석 파이프 라인 구축시 고려 사항 및 참고 논문 등등
이제 ChIP-Seq도 한다. metagenome 하다가 RNA-Seq 하고 다시 De Novo assembly 좀 손대다가 과제가 있어서 ChIP-Seq도 하게 되었다. 좋긴 하다. 많이 보고 이것 저것 해보니. 지루해질 틈도 없다. 다만.. 하나를 깊게 해놓고 끝내지 못하는게 많이 아쉽다. 겉핧기로 논문 보는거 같기도 하고.. 여튼 일에 대한 건 내 결정권 밖이니.. 하는데까지 해보는 수밖에.
일단은 MBD-Seq, MeDIP-Seq 파이프 라인 갖춰야 하고 BS-Seq 도 해야 하는데. 생각이 많다. 뭐를 role model로 해야 하는지.
일단 MBD-,MeDIP-Seq에서는 Bayesian deconvolution 개념은 확실히 들어가야 할거 같고
MeDIP-Seq 잘 표현한 사이트(여기서도 methylation 분석 파이프 라인 만드는거 같네. 서너명에서 하는거 같은데. 음 좋겠다)
일단은 MBD-Seq, MeDIP-Seq 파이프 라인 갖춰야 하고 BS-Seq 도 해야 하는데. 생각이 많다. 뭐를 role model로 해야 하는지.
일단 MBD-,MeDIP-Seq에서는 Bayesian deconvolution 개념은 확실히 들어가야 할거 같고
MeDIP-Seq 잘 표현한 사이트(여기서도 methylation 분석 파이프 라인 만드는거 같네. 서너명에서 하는거 같은데. 음 좋겠다)
Subscribe to:
Posts (Atom)

