FGV — Analista Legislativo - Informática Legislativa — Tokenização — 2023

Enunciado

Considere o código em Python que utiliza a biblioteca NLTK (Natural Language Toolkit) a seguir. import nltk from nltk.tokenize import word_tokenize nltk.download('punkt') texto = "Processamento de Linguagem Natural é uma área da inteligência artificial que lida com a interação entre computadores e linguagem humana." tokens = word_tokenize(texto) print(tokens) Assinale a opção que corresponde ao propósito do código apresentado.

Alternativas

  1. A)

    Realizar a tradução automática de um texto de um idioma para outro.

  2. B)

    Analisar a estrutura gramatical de um texto.

  3. C)

    Extrair informações relevantes de um texto, como entidades nomeadas.

  4. D)

    Sintetizar um texto a partir de um conjunto de palavras-chave.

  5. E)

    Realizar a tokenização do texto, ou seja, dividir o texto em palavras ou unidades significativas.

Gabarito e comentário

Resposta correta: E

Word_tokenize segmenta o texto em tokens, como palavras e sinais de pontuação. O código não realiza tradução nem classificação de sentimentos.

Questões relacionadas