COCA · um bilhão de palavras

As palavras mais comuns do inglês

Um ranking construído a partir de um corpus de um bilhão de palavras de inglês americano real. Aprenda as palavras no topo desta página e você vai reconhecer boa parte de quase qualquer texto em inglês — antes mesmo de estudar uma única lista temática de vocabulário.

As palavras mais comuns do inglês são palavras gramaticais ou de função: the, be, and, a, of, to, in, I, you e it. Elas carregam estrutura gramatical, não significado — por isso o topo de qualquer lista de frequência não se parece nada com um livro de vocabulário.

5,000

words ranked

top of the corpus frequency list

14

word classes

tagged in the source data

1bn

words of corpus

COCA, 1990–2019

Top 100 palavras por frequência bruta

Direto do ranking do corpus, sem remover nada. Use o alternador para esconder as palavras gramaticais e ver as palavras de conteúdo mais comuns que realmente carregam significado.

  1. 1theart.
  2. 2beverb
  3. 3andconj.
  4. 4aart.
  5. 5ofprep.
  6. 6toinf.
  7. 7inprep.
  8. 8Ipron.
  9. 9youpron.
  10. 10itpron.
  11. 11haveverb
  12. 12toprep.
  13. 13thatconj.
  14. 14forprep.
  15. 15doverb
  16. 16hepron.
  17. 17withprep.
  18. 18onprep.
  19. 19thisdet.
  20. 20n'tneg.
Mostrar todas as 100 palavras
  1. 21wepron.
  2. 22thatdet.
  3. 23notneg.
  4. 24butconj.
  5. 25theypron.
  6. 26sayverb
  7. 27atprep.
  8. 28whatdet.
  9. 29hisart.
  10. 30fromprep.
  11. 31goverb
  12. 32orconj.
  13. 33byprep.
  14. 34getverb
  15. 35shepron.
  16. 36myart.
  17. 37canverb
  18. 38asconj.
  19. 39knowverb
  20. 40ifconj.
  21. 41mepron.
  22. 42yourart.
  23. 43alldet.
  24. 44whopron.
  25. 45aboutprep.
  26. 46theirart.
  27. 47willverb
  28. 48soadv.
  29. 49wouldverb
  30. 50makeverb
  31. 51justadv.
  32. 52upadv.
  33. 53thinkverb
  34. 54timenoun
  35. 55therethere
  36. 56seeverb
  37. 57herart.
  38. 58asprep.
  39. 59outadv.
  40. 60onenum.
  41. 61comeverb
  42. 62peoplenoun
  43. 63takeverb
  44. 64yearnoun
  45. 65himpron.
  46. 66thempron.
  47. 67somedet.
  48. 68wantverb
  49. 69howadv.
  50. 70whenconj.
  51. 71whichdet.
  52. 72nowadv.
  53. 73likeprep.
  54. 74otheradj.
  55. 75couldverb
  56. 76ourart.
  57. 77intoprep.
  58. 78hereadv.
  59. 79thenadv.
  60. 80thanconj.
  61. 81lookverb
  62. 82waynoun
  63. 83moreadv.
  64. 84thesedet.
  65. 85noart.
  66. 86thingnoun
  67. 87welladv.
  68. 88becauseconj.
  69. 89alsoadv.
  70. 90twonum.
  71. 91useverb
  72. 92tellverb
  73. 93goodadj.
  74. 94firstnum.
  75. 95mannoun
  76. 96daynoun
  77. 97findverb
  78. 98giveverb
  79. 99moredet.
  80. 100newadj.

Por que o topo da lista parece tão estranho

Quase toda palavra entre as cinquenta primeiras é uma palavra gramatical — um artigo, preposição, pronome, conjunção ou auxiliar. Palavras gramaticais formam um conjunto fechado: o inglês tem algumas centenas delas e praticamente não ganha novas. Como toda frase precisa delas, se repetem sem parar e dominam qualquer contagem de frequência.

Palavras de conteúdo — substantivos, verbos, adjetivos e advérbios — formam um conjunto aberto que chega a centenas de milhares de entradas, então cada uma delas aparece bem menos. É por isso que 'the' supera 'time', o substantivo mais comum, numa proporção de aproximadamente vinte e cinco para um.

As duas metades importam, mas se aprendem de formas diferentes. Palavras gramaticais são uma lista curta para dominar de uma vez por todas; palavras de conteúdo são a cauda longa que você continua construindo por anos. Os rankings por categoria abaixo cobrem a metade das palavras de conteúdo.

Ranking por classe gramatical

Os mesmos dados do corpus, filtrados por uma classe gramatical de cada vez. As barras são relativas à palavra mais frequente dentro de cada categoria.

  1. 1be32,623
  2. 2have10,588
  3. 3do8,245
  4. 4say4,125
  5. 5go3,572

Explore por classe de palavra

Aprofunde-se em uma classe gramatical de cada vez.

Comece aqui

be

O verbo mais frequente que você ainda não marcou — aparece cerca de 32,623 vezes por milhão de palavras.

Abrir o ranking de verbos →

Metodologia

Os rankings são calculados a partir do Corpus of Contemporary American English (COCA), um corpus de um bilhão de palavras de inglês americano cobrindo 1990 a 2019, com transcrições de fala, ficção, revistas, jornais, textos acadêmicos, blogs, outros textos da web e legendas de TV/filmes. Os dados de frequência são publicados em www.wordfrequency.info, que é a fonte de todo número nesta página.

As contagens brutas são normalizadas para uma taxa por milhão de palavras, para que as palavras possam ser comparadas de forma justa entre gêneros de tamanhos muito diferentes. O número ao lado de cada palavra é essa taxa: 'the' ocorre cerca de 50.385 vezes por milhão de palavras, 'be' cerca de 32.623.

As entradas são lemas, não formas flexionadas. Formas flexionadas são agrupadas sob sua entrada de dicionário — runs, ran e running contam todas para run —, o que reflete como falantes organizam o vocabulário mentalmente e evita que um único verbo ocupe seis posições num top 100.

A classificação gramatical vem do próprio corpus. Palavras que funcionam como mais de uma classe são contadas separadamente em cada uma, então uma palavra pode aparecer em mais de um ranking de categoria com números diferentes. Note que verbos modais são classificados como verbos, e não como uma classe separada — por isso can, will e would aparecem no ranking de verbos.

Os níveis do QECR ao lado de cada palavra são nossa estimativa editorial de quando um estudante costuma encontrar e usar aquela palavra, na escala A1–C2. São um recurso de estudo adicionado sobre os dados, não parte do corpus — e deixamos isso claro em vez de sugerir que o corpus os atribui.

Como a frequência das palavras deveria mudar a forma como você estuda

A maioria dos estudantes estuda vocabulário em conjuntos temáticos — comida, viagens, o escritório — porque é assim que os livros didáticos são organizados. Os dados de frequência sugerem outra prioridade. As palavras não são igualmente úteis, e a diferença entre as mais úteis e as apenas úteis é enorme. Uma palavra na posição 100 aparece muitas vezes mais do que uma na posição 3.000, o que significa que uma hora dedicada às primeiras cem vale muito mais do que várias horas dedicadas mais adiante na lista.

Isso tem uma consequência prática: antes de aprender uma lista temática, garanta que você domina o núcleo. Se você consegue ler o topo desta página e realmente conhece cada palavra — não só reconhecê-la, mas produzi-la corretamente numa frase — você tem uma base sobre a qual o vocabulário temático pode se apoiar. Se não consegue, as listas temáticas vão continuar desmoronando, porque as frases em que aparecem são sustentadas por palavras que você ainda não domina.

A frequência também diz quando parar. Depois de alguns milhares de palavras, os retornos caem drasticamente e a leitura com base em contexto se torna uma professora melhor do que qualquer lista. Rankings são uma ferramenta para o primeiro trecho da jornada, não para a jornada inteira.

Por fim, trate essas listas como um diagnóstico. Marque o que você já sabe, olhe o que sobrou, e deixe as lacunas escolherem seu próximo tema. Isso é um guia mais honesto sobre o que estudar em seguida do que qualquer programa de curso.

Perguntas frequentes

O que é um corpus, e por que ele importa?

Um corpus é uma coleção muito grande e estruturada de textos e transcrições reais, usada para medir como um idioma é realmente usado. Ele importa porque a intuição sobre quais palavras são comuns não é confiável — contá-las em um bilhão de palavras de inglês real é.

Qual é a diferença entre palavras gramaticais e palavras de conteúdo?

Palavras gramaticais (the, of, and, to, a) carregam estrutura gramatical e pertencem a um conjunto pequeno e fechado. Palavras de conteúdo (time, make, good, quickly) carregam significado e pertencem a um conjunto enorme e aberto. Palavras gramaticais dominam o topo de qualquer lista de frequência porque toda frase precisa delas.

Quantas dessas palavras eu preciso saber?

As primeiras cem palavras de uma lista de frequência representam uma grande parte das palavras num texto típico em inglês, mas são principalmente gramática. A compreensão de verdade vem de combiná-las com as palavras de conteúdo dos rankings por categoria.

Como minha pontuação pessoal é calculada?

Ela conta as palavras que você marcou como conhecidas nos rankings por categoria, dividido pelo total de palavras classificadas nessas listas. Suas marcações ficam salvas no seu navegador, e sincronizadas com sua conta caso você tenha uma. Elas são sempre privadas — nada é compartilhado ou comparado com outros usuários.

De onde vêm os dados, e com que frequência são atualizados?

De www.wordfrequency.info, que publica listas de frequência derivadas do COCA. O corpus subjacente cobre 1990 a 2019. Nós reimportamos quando as listas publicadas são atualizadas; a data no topo da página mostra a última atualização.

Frequency data from www.wordfrequency.info, derived from the Corpus of Contemporary American English (COCA). wordfrequency.info