Por que eu devo ler este artigo:O uso de mineração de texto é importante para o processo de extração de conhecimento em bases textuais. Contudo, é importante avaliar se o conhecimento extraído ou gerado é relevante ou não para o usuário. Neste artigo avaliamos a performance de algoritmos de mineração de texto da ferramenta TextMining. A discussão apresentada neste artigo é útil pois é cada vez mais comum a necessidade de descobrirmos informação útil a partir de dados textuais. Através do estudo de caso apresentado será possível entender o impacto que diferentes algoritmos de mineração de texto trazem a esta atividade. Esta informação poderá apoiar a tomada de decisão sobre qual estratégia de mineração utilizar.

Grandes massas de dados são geradas diariamente pelos sistemas que apoiam as atividades rotineiras das organizações, dificultando a tarefa analítica dos gestores. Diante dessa necessidade, surgiram os Sistemas de Apoio à Decisão (SADs) que permitem apoiar, contribuir e influenciar no processo de tomada de decisão. Os SADs permitem, a partir dos dados transacionais da organização, gerar informações gerenciais que facilitam o referido processo.

Como grande parte dos dados manipulados pelas organizações está em formato textual, torna-se fundamental o uso da técnica de mineração de texto (também conhecido por Knowledge Discovery in Texts, KDT) para identificar padrões e conhecimentos para auxiliar nas decisões.

O conhecimento gerado pode ser avaliado para determinar se o mesmo é relevante ou não para o usuário, ou seja, avaliar o desempenho do processo de mineração para a geração do conhecimento. Existem várias métricas, sendo as principais relacionadas ao desempenho, à acurácia, precisão e cobertura.

Neste artigo iremos apresentar um estudo de caso realizado em uma organização ABC. A ACB lida com um imenso volume de informações, sendo necessária a utilização de mecanismos que tornem efetivas as atividades de auditoria. Auditoria é a atividade que realiza a validação das informações, verificação da obediência às normas e recomendações e avaliações dos controles em busca dos resultados da gestão. Objetivando atender as necessidades da ABC, desenvolvemos uma aplicação que realiza a mineração de texto em qualquer campo descritivo de um sistema, a ferramenta TextMining.

A aplicação permite determinar se uma descrição é ou não evidência de irregularidade, tornando efetivo o trabalho do auditor na identificação de irregularidades. Para classificar uma descrição, a ferramenta dispõe de um algoritmo, Naïve Bayes, de forma parametrizada, especificando um limiar mínimo para auxiliar no processo classificatório. É importante destacar que existem três métodos para o Naïve Bayes: “Híbrido” (utilização da frequência do termo da amostra com tf, term frequency, da sentença), “Frequência Inversa” (tfidf, term frequency – inverse document frequency, da amostra com tf da sentença) e “Frequência” (frequência da amostra com frequência da sentença).

Este trabalho introduziu um segundo algoritmo, Similaridade, na ferramenta citada e foram avaliadas as métricas de qualidade e desempenho para as duas abordagens. A avaliação se deu por meio da coleta de métricas de tempo médio, acurácia, cobertura, medida F e precisão de cada algoritmo.

Assim, este artigo objetiva comparar o desempenho e qualidade de dois algoritmos de mineração de texto aplicados a históricos de contas públicas custodiadas pela organização ABC. A análise comparativa determinará o melhor algoritmo da ferramenta TextMining e, consequentemente, o conhecimento gerado por essa abordagem será efetivo e relevante para os auditores na descoberta de irregularidades como a identificação de uma descrição de motivo de viagem para a qual não é permitida o pagamento de diárias.

Descoberta de Conhecimento em Bases de Dados

KDD (Knowledge Discovery in Databases) é o processo não-trivial de identificar padrões válidos, novos, potencialmente úteis em dados, ou seja, é o processo de descoberta de conhecimento ou padrões úteis e desconhecidos em grandes massas de dados.

O processo de KDD consiste de várias etapas, as quais envolvem preparação dos dados, busca por padrões, avaliação do conhecimento e refinamento, todos repetidos em múltiplas iterações. Esse processo é composto por cinco passos bem definidos: seleção, pré-processamento, transformação, mineração de dados, análise / assimilação, conforme é mostrado na Figura 1.


abrir imagem em ...
Fim do trecho gratuito • continue abaixo