sábado, septiembre 19, 2026
  • Home
  • Redes Sociales
  • Marketing Digital
  • SEO
  • Relaciones Pùblicas
  • Mundo Cripto
    • NFTs
    • Bitcoin
    • Etherum
    • Altcoins
Presencia Digital
  • Home
  • Relaciones Públicas
  • Mundo Cripto
  • SEO
  • Redes Sociales
  • Marketing Digital
No Result
View All Result
Presencia Digital
  • Home
  • Relaciones Públicas
  • Mundo Cripto
  • SEO
  • Redes Sociales
  • Marketing Digital
No Result
View All Result
Presencia Digital
No Result
View All Result
Home Redes Sociales

Twittea temas y sentimientos relacionados con el enseñanza a distancia entre los usuarios italianos de Twitter

PD Curador by PD Curador
junio 2, 2022
in Redes Sociales
0
585
SHARES
3.2k
VIEWS
Share on FacebookShare on TwitterShare on WhatsappShare on Telegram

Los datos

Twitter fue preferido como la fuente de datos. Es una de las principales plataformas de redes sociales del mundo, con 199 millones de usuarios activos en abril de 2021.4y asimismo es una fuente global de texto para investigación de sentimiento.23,24,25.

Para compilar tweets relacionados con el enseñanza a distancia, usamos TrackMyHashtag https://www.trackmyhashtag.com/, una aparejo de rastreo para monitorear hashtags en tiempo auténtico. A diferencia de la API de Twitter, que no proporciona tweets con más de tres semanas de pasado, TrackMyHashtag asimismo proporciona datos históricos y selecciones de filtros por idioma y geolocalización.

Para nuestro estudio, elegimos las palabras italianas para «enseñanza a distancia» como término de búsqueda y seleccionamos del 3 de marzo de 2020 al 23 de noviembre de 2021 como el período de interés. Finalmente, elegimos solo tweets italianos. Para este estudio se recogieron un total de 25.100 tuits.

Preprocesamiento de datos

Para afanar los datos y prepararlos para el investigación de opiniones, aplicamos los siguientes pasos de preprocesamiento utilizando técnicas de NLP implementadas con Python:

  1. 1.

    eliminado menciones, URL y hashtags,

  2. 2.

    reemplazó los caracteres HTML con el equivalente de Unicode (como reemplazar ‘&’ con ‘&’),

  3. 3.

    etiquetas HTML eliminadas (como (< div>), (< pag>)etc.),

    You might also like

    Para un empleado municipal, las publicaciones en Facebook conducen a un proceso inverosímil

    EE.UU. desmantela bots rusos que difunden propaganda en Twitter

    YouTube Music podría tener su propia función de radiodifusión impulsada por IA

  4. 4.

    eliminado saltos de tendencia innecesarios,

  5. 5.

    caracteres especiales eliminados y puntuación,

  6. 6.

    palabras eliminadas que son números,

  7. 7.

    convirtió el texto de los tweets en italiano al inglés usando la aparejo ‘googletrans’.

En la segunda parte, se requiere un conjunto de datos de decano calidad para el maniquí de tema. Se eliminaron los tweets duplicados y solo se conservaron los tweets únicos. Encima de los métodos generales de agilidad de datos, la tokenización y la lematización podrían permitir que el maniquí logre un mejor rendimiento. Las diferentes formas de una palabra provocan una clasificación errónea de los modelos. En consecuencia, la biblioteca WorldNet de NLTK26 se utilizó para conquistar la lematización. Los algoritmos de lematización que reducen agresivamente las palabras a una almohadilla global, incluso si estas palabras tienen significados diferentes, no se consideran aquí. Finalmente, redujimos todo el texto a minúsculas para asegurarnos de que cada palabra apareciera en un formato consistente y recortamos el vocabulario, eliminando las palabras vacías y los términos no relacionados con el tema, como ‘como’, ‘de’ y ‘sería’.

Disección de sentimientos y emociones.

Entre los principales algoritmos que se utilizarán para la minería de texto y específicamente para el investigación de sentimientos, aplicamos el Valence Aware Dictionary for Sentiment Reasoning (VADER) propuesto por Hutto et al.27 para determinar la polaridad e intensidad de los tuits. VADER es un jerga de sentimientos y una aparejo de investigación de sentimientos basada en reglas obtenida a través del enfoque de la seso de la multitud. A través de un extenso trabajo humano, esta aparejo permite que el investigación de sentimientos de las redes sociales se complete rápidamente y tiene una precisión muy entrada similar a la de los seres humanos. Usamos VADER para obtener puntajes de sentimiento para los datos de texto preprocesados ​​de un tweet. A su vez, según el método de clasificación recomendado por sus autores, mapeamos la puntuación emocional en tres categorías: positiva, negativa y neutra (fig. 1 paso 1).

Figura 1
Figura 1

Pasos del investigación de sentimientos y emociones.

Luego, para descubrir las emociones que subyacen en las categorías, aplicamos el nrc28 cálculo, que es uno de los métodos incluidos en el paquete de la biblioteca R argumento29 para el investigación de emociones. En particular, el nrc El cálculo aplica un diccionario de emociones para encuadrar cada tweet en función de dos sentimientos (positivos o negativos) y ocho emociones (ira, miedo, anticipación, confianza, sorpresa, tristeza, alegría y disgusto). El examen emocional tiene como objetivo identificar las emociones que lleva un tweet. Si un tweet se asoció con una emoción o sentimiento en particular, obtiene puntos que reflejan el categoría de valencia con respecto a esa categoría. De lo contrario, no tendría puntaje para esa categoría. Por lo tanto, si un tuit contiene dos palabras enumeradas en la inventario de palabras para la emoción de «alegría», la puntuación de esa oración en la categoría de alegría será 2.

Al usar el nrc jerga, en área de percibir la puntuación algebraica por palabras positivas y negativas, cada tuit obtiene una puntuación para cada categoría de emoción. Sin secuestro, este cálculo no tiene en cuenta adecuadamente a los negadores. Encima, adopta el enfoque de bolsa de palabras, donde el sentimiento se zócalo en las palabras individuales que aparecen en el texto, descuidando el papel de la sintaxis y la gramática. Por lo tanto, el VADER y nrc los métodos no son comparables en términos de número de tweets y categorías de polaridad. Por lo tanto, la idea es utilizar VADER para el investigación de sentimientos y después aplicar nrc solo para descubrir emociones positivas y negativas. El diagrama de flujo de la Fig. 1 representa el investigación de sentimiento de dos pasos. Los tuits neutrales de VADER son muy enseres en la clasificación pero no interesantes para el investigación de emociones; por lo tanto, nos enfocamos en tweets con sentimientos positivos y negativos. El desempeño de VADER en el campo del texto de las redes sociales es excelente. Basándose en sus reglas completas, VADER puede sufrir a lugar un investigación de sentimiento en varias características léxicas: puntuación, uso de mayúsculas, modificadores de categoría, la conjunción contrastiva ‘pero’ y trigramas de inversión de oposición.

El maniquí de tema

El maniquí de tema es un método de enseñanza necesario no supervisado; es aseverar, es un procedimiento de minería de texto con el que se pueden identificar los tópicos o temas de los documentos a partir de un gran corpus documental30. El maniquí de asignación de Dirichlet recóndito (LDA) es uno de los métodos de modelado de temas más populares; es un maniquí probabilístico para expresar un corpus basado en un maniquí bayesiano jerárquico de tres niveles. La idea básica de LDA es que cada documento tiene un tema, y ​​un tema se puede especificar como una distribución de palabras.31. Particularmente en los modelos LDA, la gestación de documentos en el interior de un corpus sigue el ulterior proceso:

  1. 1.

    Una mezcla de k temas, (theta)se muestrea a partir de un Dirichlet previo, que se parametriza mediante (alfa);

  2. 2.

    un tema (z_n) se muestrea de la distribución multinomial, (p(theta mid alpha )) esa es la distribución del tema del documento que modela (p(z_{n}=imid theta)) ;

  3. 3.

    Se corrigió el número de temas. (k=1 ldots,K)la distribución de palabras para k temas se denota por (fi) que asimismo es una distribución multinomial cuyo hiperparámetro (beta) sigue la distribución de Dirichlet;

  4. 4.

    entregado el tema (z_n)una palabra, (w_n)luego se muestrea a través de la distribución multinomial (p(w mid z_{n};beta )).

En genérico, la probabilidad de un documento (o tweet, en nuestro caso) “(mathbf {w})” que contienen palabras se pueden describir como:

$$begin{adscrito} p(mathbf{w})=int _theta {p(theta mid alpha )left( {prod limits _{n = 1}^N {sum limits _{z_n = 1}^k {p(w_n mid z_n ;beta )p(z_n mid theta )} } } right) } mathrm{}dtheta end{adscrito}$$

(1)

Finalmente, la probabilidad del corpus de METRO documentos (D={mathbf{w}_mathbf{1},ldots,mathbf{w}_mathbf{M}}) puede expresarse como el producto de las probabilidades marginales de cada documento individual (D_m)como se muestra en (2).

$$begin{adscrito} p(D) = prod limits _{m = 1}^M {int _theta {p(theta _m mid alpha )left( {prod limits _ {n = 1}^{N_m} {sum limits _{z_n = 1}^k {p(w_{m,n} mid z_{m,n} ;beta)p(z_{m,n } mid theta _m )} } } right) } } mathrm{}dtheta _m end{adscrito}$$

(2)

En nuestro investigación que incluye tweets durante un período de 2 abriles, encontramos que el contenido del tweet cambia con el tiempo y, por lo tanto, el contenido del tema no es un corpus pasmado. El maniquí LDA dinámico (DLDA) se adopta y utiliza en temas agregados en épocas de tiempo, y un maniquí de espacio de estado maneja las transiciones de los temas de una época a otra. Se agrega como una dimensión adicional un maniquí probabilístico gaussiano para obtener las probabilidades posteriores sobre los temas en desarrollo a lo dadivoso de la tendencia de tiempo.

Figura 2
Figura 2

Maniquí de tema dinámico (para tres segmentos de tiempo). Un conjunto de temas en el conjunto de datos se desarrolla a partir del conjunto del segmento antedicho. El maniquí para cada intervalo de tiempo corresponde al proceso LDA diferente. Encima, los parámetros de cada tema evolucionan con el tiempo.

Figura 2 muestra una representación gráfica del maniquí de tema dinámico (DTM)32. Como parte de la clase de maniquí de tema probabilístico, el maniquí dinámico puede explicar cómo evolucionan varios temas de tweet. El corpus del conjunto de datos de tweets utilizado aquí (3 de marzo de 2020-23 de noviembre de 2021) contiene 630 días, que son exactamente siete trimestres de un año. En consecuencia, el maniquí de tema dinámico se aplica a siete pasos de tiempo correspondientes a los siete trimestres del conjunto de datos. Estos intervalos de tiempo se colocan en el maniquí proporcionado por saburía33.

Un desafío esencial en DLDA (como LDA) es determinar un número apropiado de temas. roder et al. puntajes de coherencia propuestos para evaluar la calidad de cada maniquí de tema. En particular, la coherencia del tema es la medida utilizada para evaluar la coherencia entre los temas inferidos por un maniquí. Como medidas de coherencia, utilizamos (CV) y (C_{mass}). La primera es una medida basada en una ventana deslizante que utiliza información mutua normalizada por puntos (NPMI) y similitud de coseno. En cambio, (C_{mass}) se zócalo en recuentos de coocurrencia de documentos, una segmentación antedicho y una probabilidad condicional logarítmica como medida de confirmación. Estos títulos pretenden pugnar la puntuación relativa que es probable que un humano asigne a un tema e indicar cuánto «tienen sentido» las palabras del tema. Estos puntajes infieren la cohesión entre las palabras «principales» en el interior de un tema determinado. Además se considera la distribución en el investigación de componentes primarios (PCA), que puede visualizar los modelos de temas en una distribución espacial de palabras con dos dimensiones. Se prefiere una distribución uniforme, lo que da un parada categoría de independencia a cada tema. El sensatez para un buen maniquí es una decano coherencia y una distribución promedio en el investigación de imprimación que muestra pyLDAvis.34.

Directo a la fuente

Tags: Personal Branding y PRPR DigitalRelaciones Públicas
Previous Post

SOLANA de Pepper Money restablecimiento los volúmenes comerciales en un 70 % con la plataforma Low-Code de Appian

Next Post

Horóscopo de Himen para junio de 2022

PD Curador

PD Curador

Related Posts

Redes Sociales

Para un empleado municipal, las publicaciones en Facebook conducen a un proceso inverosímil

by PD Curador
julio 10, 2024
Redes Sociales

EE.UU. desmantela bots rusos que difunden propaganda en Twitter

by PD Curador
julio 9, 2024
Redes Sociales

YouTube Music podría tener su propia función de radiodifusión impulsada por IA

by PD Curador
julio 9, 2024
Redes Sociales

La novia de Taylor Fritz, Morgan Riddle, poso publicaciones de Instagram luego del partido

by PD Curador
julio 9, 2024
Redes Sociales

¿El cálculo de Meta está silenciando las voces pro israelíes?

by PD Curador
julio 8, 2024
Next Post

Horóscopo de Himen para junio de 2022

Categorías

  • Altcoins
  • Bitcoin
  • Marketing Digital
  • NFTs
  • Privada
  • Productos
  • Redes Sociales
  • Relaciones Pùblicas
  • SEO
  • Uncategorized

Categories

  • Altcoins
  • Bitcoin
  • Marketing Digital
  • NFTs
  • Privada
  • Productos
  • Redes Sociales
  • Relaciones Pùblicas
  • SEO
  • Uncategorized

QR Code

  • Política de Privacidad
  • Cookies policy
  • Legal notice

© 2022 PD - Notas en Inglés al español Presencia Digital.

No Result
View All Result
  • Home
  • Redes Sociales
  • Marketing Digital
  • SEO
  • Relaciones Pùblicas
  • Mundo Cripto
    • NFTs
    • Bitcoin
    • Etherum
    • Altcoins

© 2022 PD - Notas en Inglés al español Presencia Digital.

This website uses cookies. By continuing to use this website you are giving consent to cookies being used. Visit our Privacy and Cookie Policy.