Mostrando postagens com marcador EST. Mostrar todas as postagens
Mostrando postagens com marcador EST. Mostrar todas as postagens

20 de outubro de 2009

Telefone sem fio


Um problema crescente que acontece quando tentamos identificar a função de um gene me lembrou uma brincadeira de criança: o telefone sem fio! Aquela brincadeira onde as crianças sentam-se uma do lado da outra e a primeira da fila diz uma mensagem (bem baixinho) no ouvido da segunda que deve repetí-la para a terceira até chegar a última que tem que dizer a mensagem em voz alta, que geralmente já está bem diferente da original! É a velha história do "quem conta um conto, aumenta um ponto"! O mesmo tem acontecido com a anotação funcional de genes, o processo de identificação das funções associadas a um gene.


Atualmente, uma quantidade enorme de sequências de DNA está sendo produzida e depositadas nos bancos de dados, que já contém um número absurdo de sequências . Vários genomas já foram concluídos, outros tantos estão em andamento, assim como muitos projetos de sequenciamento de mRNA (cDNA). Isso tudo é muito bom, é claro! Mas um dos principais problemas atuais é lidar com esta quantidade imensa de informação e identificar onde estão os genes e quais as suas funções, como já discuti um pouco aqui.

Quando o sequenciamento de DNA não era ainda um "lugar-comum" e, consequemente, a velocidade com que novas sequências surgiam não era tão grande como hoje, muitos dos genes tinham sua função estudada experimentalmente,de maneira mais minuciosa. Mas em um mundo onde milhares de sequências podem ser produzidas por dia, não é mais possível fazer isso para todas as sequências geradas. 

Como a sequência de DNA determina a sequência de aminoácidos das proteínas e a função destas, em geral, depende da sua sequência, proteínas que tenham a mesma função, também devem ter a mesma sequência! Ou, ao menos, devem ser bem parecidas! E surge a era do "comparar para identificar", pois similaridade pode indicar homologia!Assim, hoje em dia ,quando identificamos uma nova sequência gênica, tentamos achar nos bancos de dados se já existe alguma outra sequência similar com uma função conhecida. O passo crucial é decidir se esta similaridade basta para dizermos que a nossa sequência até então desconhecida deve ter realmente as mesmas funções daquela com que é parecida. Para isso existem critérios, mas nem todos usam os mesmos critérios. Uns são extremamente rígidos enquanto outros deixam a coisa "correr solta". 


E assim começa o problema que chamei de "telefone sem fio":


Um primeiro pesquisador deposita no banco de dados uma sequência X, à qual atribuiu a função Y através de experimentos.

Um segundo pesquisador, com uma nova sequência em mãos (Z), descobre que ela é extremamente similar ao gene X e, então, inclui a nova sequência Z no banco de dados, como um gene de função Y também. 


Um terceiro pesquisador, com mais uma sequência nova (W), descobre que ela tem alguma similaridade com a sequência Z, mas esta similaridade não é tão grande assim, mas se encaixa nos "critérios" frouxos que ele estabeleceu. E ele também atribui à sua sequência W, a função Y, uma anotação possivelmente errada.


Um quarto pesquisador, por tabela, atribui à sua sequência N, extremamente similar a W, a função Y. Apesar de a similaridade ser verdadeira neste caso e de as sequências W e N serem provavelmente de fato homólogas, a função associada à elas é errada. 



 
 Cada cor representa um  nucleotídeo. Notem que os genes X e Z são bem semelhantes, enquanto que os genes Z e W, não, mas mesmo assim foram designados como homólogos e como tendo a mesma função. Os genes W e N são bastante semelhantes e, provavelmente, homólogos, mas não são homólogos de Z e X e, por isso, foram erroneamente identificados com a função Y (a função original de X). Pode parecer complicado, mas é apenas uma cadeia de comparações para ver quem é parecido com quem.


E esse erro vai ser passado para frente. E novos erros podem ser introduzidos nesta cadeia. Quanto mais perto da última "criança da fila", maior a chance de estar inferindo uma função errada.

Este problema tem sido agravado por ferramentas de "anotação eletrônica", usadas para identificar a função de novas sequências através de resultados de similaridade com sequências conhecidas, sem nenhuma avaliação manual feita por um pesquisador que poderia identificar casos onde a associação feita não é verdadeira.


Isso não quer dizer que não devemos lançar mão destas ferramentas. Elas são a única saída quando se tem 100, 1000 e até centenas de milhares de sequências em mãos. Mas temos que ser cuidadosos, não relaxar nossos critérios.

O Blast2GO sobre o qual já tanto falei aqui, mas nunca expliquei bem, é uma ferramenta para a anotação funcional de genes, principalmente de organismos modelo não tradicionais, como a ostra e a vieira que estudo. Como não há projetos genoma para estas espécies e outras  próximas é ainda mais difícil identificar suas sequências e os resutados das buscas por similaridades geralmente indicam sequências de organismos distantes filogeneticamente. Então, o cuidado tem que ser redobrado!

Através do Blast2GO é possível submeter as novas sequências a buscas por similaridade usando o algoritmo BLAST. O programa então identifica quais são as funções associadas às sequências similares, resultantes do BLAST, em diversos bancos de dados: os de termos de ontologia gênica (uma iniciativa bem legal, sobre a qual  um dia, ainda escreverei aqui), o de domínios conservados - regiões das proteínas que são particularmente importantes para alguma função - o banco de dados de enzimas, de vias metabólicas e por aí vai...

E a última etapa do Blast2GO é anotação funcional. Anotar ou não anotar, eis a questão. E neste momento, o blast2go é inovador, com a sua "regra de anotação". Para decidir se cada sequência deve ser associada a uma ou mais funções, o programa usa uma fórmula para determinar a anotação mais específica. Esta fórmula considera não apenas a percentagem de similaridade entre as sequências, como também o código de evidência, que indica de que forma aquela função foi atribuída a sequência similar ("a criança que estava antes na fila") penalizando anotações eletrônicas e dando pontos extras a anotações experimentais. Existindo ainda outras possibilidades de evidência para as quais se pode atribuir diferentes pesos na regra de anotação.


Assim, o Blast2GO nos ajuda a lidar com o problema do telefone sem fio, permitindo que se pese as evidências antes de bater o martelo e concluir a anotação. E é claro, sem perder a praticidade, milhares de sequências podem ser processadas por vez. Mas a regra de anotação é aberta e o pesquisador pode modifica-la de acordo com seus critérios. Então, o bom senso é e sempre será essencial.


--------------------------------------
Para saber mais sobre o Blast2GO: http://www.blast2go.org

Papers:


Stefan Götz, Juan Miguel García-Gómez, Javier Terol, Tim D. Williams, María José Nueda, Montserrat Robles, Manuel Talón, Joaquín Dopazo and Ana Conesa. High-throughput functional annotation and data mining with the Blast2GO suite.Nucleic Acids Res. 2008 June; 36(10): 3420–3435.

Ana Conesa, Stefan Götz, Juan Miguel García-Gómez, Javier Terol, Manuel Talón and Montserrat Robles. Blast2GO: A universal tool for annotation, visualization and analysis in functional genomics research.Bioinformatics 2005 21: 3674-3676


4 de outubro de 2009

Bioinformática: season finale


Como está evidente nos últimos posts, tenho suado um pouco com a bioinformática. Mas finalmente achei uma ferramenta bem legal e simples de usar para análise de sequências: ESTpiper.

O ESTpiper é uma ferramenta de web para analisar sequências de DNA desde a primeira etapa,  base calling, quando se extrai a sequência de nucleotídeos (e valores - scores - de qualidade do sequenciamento) a partir dos cromatogramas, passando pela etapa de trimming (que eles chamam de clearing) e que inclui remoção de trechos de baixa qualidade, de sequências do plasmídio, adaptadores e cauda poli A, indo adiante para a etapa de assembly, anotação e desenho de sondas para microarranjos.

É bem fácil: você envia seus arquivos pelo site (com atenção para os formatos compatíveis), ajusta os parâmetros conforme suas necessidades e você recebe um e-mail com o link para download dos resultados. O mais legal é que é possível submeter várias sequências de uma só vez, bastando compactá-las em formato ZIP, o que já salvou muitas horas de trabalho! Além disso, o ESTpiper usa programas como o Phred (basecalling), Lucy (trimming) e CAP3 (assembly) já amplamente utilizados para estes fins. Enfim, é um meio de usar o que há de melhor mas de um jeito bem "mamão com açúcar".

Eu estou usando o ESTpiper apenas até a etapa de assembly. Para anotação funcional, ainda fico com o Blast2GO, que tem muito mais recursos.

Referência:
Tang Z, Choi J, Hemmerich C, Sarangi A, Colbourne JK, Dong, Q (2009) ESTPiper – a web-based analysis pipeline for expressed sequence tags. BMC Genomics, 10:174.



Bookmark and Share

19 de setembro de 2009

Bioinformatics can be that cool

Ainda não aprendi a fazer todas as análises de bioinformática como eu queria, leia-se da forma mais prática, mas estou voltando as boas com a área. É muito bonito depois do trabalhão que dá chegar até um simples arquivo FASTA, ver que aquela simples sequência de nucleotídeos codifica uma proteína interessante, tem um domínio altamente conservado (como na foto abaixo) e vai ajudar a entender um pouco mais sobre o organismo que estudamos.

Domínio FRED (NCBI)

A quantidade de informação que podemos extrair de uma sequência de DNA ou proteína usando ferramentas de bioinformática e graças a internet (a 8ª maravilha do mundo) é absurda! Dois exemplos:

O NCBI tem um banco de dados de domínios conservados onde é possível buscar na sequência de uma dada proteína a existência de algum domínio conservado. Em se tratando de uma sequência de nucleotídeos, basta traduzi-la usando por exemplo a ferramenta de tradução do expasy  ou mesmo o Bioedit. Mas existem 6 possíveis traduções: 3 frames em dois sentidos. Se biblioteca de cDNA é direcional (as sequencias foram clonadas no sentido 5'3'), 3 possibilidades já podem ser eliminadas, pois conhecemos o sentido da sequencia. Entre as 3 possibilidades remanescentes, a mais provável é aquela sem um STOP codon, ou com um maior trecho sem STOP codon, mas na dúvida, não custa nada testar as três.

Como resultado, tem-se um relatório detalhado dos possíveis domínios conservados presentes na proteína. Além de informações como o valor e o score para avaliar a relevância da similaridade encontrada, é exibido um esquema indicando onde na sua sequencia está o domínio, o alinhamento de maior similaridade com um dos membros deste grupo de domínios, além de um link para a página do mesmo com várias outras informações interessantes, como estutura tridimensional, uma descrição funcional e citações na literatura. Para ver um exemplo, veja a página do domínio FRED, que achei em um dos meus clones. Muito maneiro.

Ainda vou ficar devendo um post dedicado ao Blast2GO. Eu sou fã do Blast2GO! É realmente user-friendly. Agora eles estão no twitter, pena que eu não estou mais neste miniblog irritante. Mas a segunda ferramenta interessante e que só fui usar recentemente via Blast2GO é o banco de dados Kegg Pathways que agrupa vias de reações e interações moleculares anotadas manualmente. O BlastGO identifica o código Kegg das enzimas presentes entre as sequencias anotadas e com isso é possível baixar os mapas das vias de referência das quais a enzima participa. Muito, muito maneiro também.

Update 20/09/2009:
O banco de dados de proteínas do NCBI oferece vários formatos para acessar uma dada proteína, um deles é chamado de "graphics" e é praticamente o google earth das proteínas. Mas muito mais interativo, você pode passear pelas ruas que quiser, abrir e fechar portas, olhar pela fechadura, etc, uma realidade bioquímica virtual!  


Bookmark and Share

13 de junho de 2009

EST analysis: o começo! (*)

Bom, este post não tem o objetivo de ser um passo-a-passo de como usar os softwares para analisar ESTs, até por que eu ainda estou aprendendo e seria um livro, não um post. A idéia é descrever teoricamente a principais etapas, que podem ser feitas por diferentes softwares. É claro, este não é um processo rígido, depende de uma série de fatores como de com que espécie se trabalha e principalmente de quais são os objetivos do trabalho.

1) Trimming

O primeiro passo é fazer uma "limpeza" (trimming) das seqüências. O sequenciamento frequentemente gera alguns trechos de má qualidade, em geral, no ínicio e no final do fragmento, ou seja, onde algumas bases não puderam ser determinadas ou não o foram com muita precisão. Estes trechos devem ser removidos para não interferir nas etapas seguintes. Além disso, frequentemente, flanqueando a sequência do inserto, ou seja, do cDNA que é o que de fato interessa, há sequências de adaptadores e do vetor utilizados. Estes trechos também devem ser removidos para que no final desta etapa haja apenas a sequência do inserto com um nível de qualidade aceitável.

De fato, a presença de sequências contaminantes (vetores e adaptadores) nas sequências depositadas nos bancos de dados tem se tornado um problema crescente, gerando uma série de problemas muito bem discutidos aqui. Diante disso, a NCBI criou um software online chamado VecScreen que detecta contaminação de sequencias exógenas submetendo a sequência de inetresse a um BLAST contra um banco de dados de contaminantes (UniVec)

No entanto, apenas uma sequência pode ser analisada por vez e o programa apenas indica onde começa e termina as sequencias contaminantes. Ou seja, não serve para identificar e remover estes contaminantes de um grande número de sequências. Para isso, existem alguns softwares disponíveis: SeqClean (Free, só roda em Linux), LUCY2 (Free, roda em windows), DNA Baser (pago, 60 dias grátis para testes), entre outros. Estes mesmos softwares também pode ser utilizados para remover os trechos de baixa qualidade.

Update 19/09/2009. Antes se seguir para a próxima etapa, é importante também "mascarar"(masking) regiões de baixa complexidade e de repetições que poderiam interferir no agrupamento, assim como nas etapas seguintes. O "masking" consiste em substituir estas regiões por N (base não determinada) e assim elas não serão consideradas no clustering, assembly, BLAST, etc. Um dos meios de se fazer isso é pelo site RepeatMasker.

2) Clustering e contigs assembly

"Clustering" consiste em dentro do grupo de sequências, agrupar aquelas que se sobrepõe e que portanto são derivadas de um mesmo fragmento maior. Em uma segunda etapa, com base nestas sobreposições, estas sequências são agrupadas em contigs (sequencia contínua consenso que representa o fragmento maior de onde as diferentes sequencias são derivadas).Vários softwares fazem este trabalho: TGI Clustering tools (TGICL) e DNA baser, por exemplo.

3) Gene onthology: BLAST2GO

Agora que temos as sequencias "limpinhas" e organizadas, o que fazer com elas? Bom, isso depende do objetivo do trabalho! No meu caso, devo fazer um BLAST para anotar o máximo de sequencias possível. Para tanto, devo utilizar a plataforma Blast2GO que além de fazer este trabalho ainda tem várias outras ferramentas interessantes! Como eu tive uma aula com uma das criadoras deste software, Dra Ana Conesa, embora ainda não o domine, tenho um pouco a mais a dizer sobre e fica pro próximo post!


*Post sujeito a atualizações!


12 de junho de 2009

EST sequence analysis: e agora?

Um projeto de transcriptoma começa tradicionalmente com a geração de bibliotecas de cDNA, como já discuti extensivamente por aqui. Agora que superei esta etapa, começa o que para mim é um desafio um pouco maior: a análise das seqüências obtidas. Um desafio por que (1) eu nunca fiz isso antes (2) por que por mais que se leia livros, artigos e tutoriais dos softwares, isso só se aprende mesmo com a prática e (3) por que são centenas de sequencias e por tanto uma grande quantidade de dados são gerados. Este último fator é um "problema" crescente na biologia. Com técnicas cada vez mais modernas e rápidas, uma grande quantidade de dados tem sido gerada e para lidar com eles, ou seja, para extrair informação deles, somente os bioinformatas podem nos ajudar! E de fato, o tem feito. Tanto, que uma das minhas dificuldades tem sido: que programa usar? E a resposta esta geralmente associada a "free download", uma vez que os bioinformatas sabem valorizar bem seu trabalho. No entanto, não é fácil para os "não-bioinformatas" aprenderem a usar os vários softwares de que precisam de forma crítica, entendendo de fato o que estão fazendo, o que significa cada parâmetro dentro do processo em questão e não apenas reproduzindo uma série de comandos pré-estabelecidos por alguém.

Embora eu não tenha experiência com isso, sempre tive interesse e se aparecer qualquer curso , disciplina ou conversa fiada sobre o assunto, eu estou dentro! No entanto, estou conformada com a idéia de que vou ter que ser um pouco autodidata para aprender tudo isso, como muitas vezes temos que ser na vida acadêmica, o que não é realmente um problema. Assim, após um jejum de posts, resolvi escrever este, mais uma vez, para me ajudar a ordernar minhas idéias.

Bom, os dados que eu tenho em mãos são um grupo de sequências obtidas de clones selecionados aleatoriamente das bibliotecas de cDNA. Estas sequencias foram obtidas através de reações de sequenciamento a partir de amostras de DNA plasmidial usando um primer universal específico para o plasmidio no qual as bibliotecas foram construídas. E como resultado, tem-se um grupo de (na ordem de centenas) sequencias de nucleotídeos e os respectivos cromatogramas, mostrando o sinal para cada base.

Como saber o que estas sequencias significam? Que genes codificam? Em que processos estão envolvidos? Todas as sequências são de genes diferentes? Existem sequencias de regiões diferentes de um mesmo gene? Qual a redundância das sequências? Qual padrão de códons usado pelo organismo? É possível identificar microsatélites, SNPs ou outros polimorfismos?


Todas estas perguntas somente podem ser respondidas através de ferramentas computacionais! E, por isso, ao invés de ter medo desses programas, temos mais é que agradecer que eles existem! E com isso em mente, respirar fundo e aprender a usá-los, pois eles estão aí para nos ajudar.

No próximo post, vou descrever as principais etapas do processo de análise e identificação de EST (Expressed Sequence Tags) geradas a partir de bibliotecas de cDNA. Até lá!