Wikiwand AI

Segmentación del habla

From Wikipedia, the free encyclopedia

La segmentación del habla es el proceso de identificar los límites entre palabras, sílabas o fonemas en las lenguas naturales habladas. El término es aplicable tanto a los procesos mentales utilizados por los humanos como a los procesos artificiales del procesamiento del lenguaje natural.

Este problema se superpone en cierta medida con el problema de la segmentación de texto que se produce en algunos idiomas que son tradicionalmente escrito sin espacios entre palabras, como el chino y el japonés, comparado con los sistemas de escritura que indican la segmentación del habla entre palabras por un separador de palabras, como el espacio. Sin embargo, incluso para esos idiomas, la segmentación del texto es a menudo mucho más fácil que la segmentación del habla, porque la lengua escrita generalmente tiene poca interferencia entre las palabras adyacentes y, a menudo, contiene pistas adicionales que no están presentes en el habla (como el uso de caracteres chinos para los vástagos de palabras Japonés). La identificación de límites de palabras se puede superar mediante enfoques NLU como la teoría de Patom integrada con la función y la gramática de referencia (RRG) para idiomas

En las lenguas naturales, el significado de una oración hablada compleja se puede entender descomponiéndola en segmentos léxicos más pequeños (más o menos, las palabras de la lengua), asociando un significado a cada segmento y combinando esos significados de acuerdo con las reglas gramaticales de la lengua.

Aunque no se cree que los bebés utilicen el reconocimiento léxico en su primer año, debido a su vocabulario muy limitado, es uno de los principales procesos involucrados en la segmentación del habla para adultos. Existen tres modelos principales de reconocimiento léxico en la investigación actual: primero, acceso de palabra completa, que sostiene que las palabras tienen una representación de palabra completa en el léxico; segundo, la descomposición, que argumenta que las palabras morfológicamente complejas se descomponen en sus morfemas (raíces, tallos, inflexiones, etc.) y luego interpretados y; tercero, la opinión de que se usan los modelos de palabra completa y descomposición, pero que el modelo de palabra completa proporciona algunas ventajas computacionales y, por lo tanto, es dominante en el reconocimiento léxico.[1]

Para dar un ejemplo, en un modelo de palabra completa, la palabra "gatos" se puede almacenar y buscar por letra, primero "g", luego "ga", "gato" y finalmente "gatos". La misma palabra, en un modelo de descomposición, probablemente se almacenaría bajo la palabra raíz "gato" y se podría buscar después de eliminar el sufijo "s". "Falling", (cayendo) de manera similar, se almacenaría como "fall" (caer) y con el sufijo de la inflexión "ing".[2]

Aunque los defensores del modelo de descomposición reconocen que un análisis morfema por morfema puede requerir un cálculo significativamente mayor, argumentan que el desempaque de la información morfológica es necesario para otros procesos (como la estructura sintáctica) que pueden ocurrir paralelamente a las búsquedas léxicas.

En general, la investigación en sistemas de reconocimiento léxico humano está limitada debido a la poca evidencia experimental que discrimina completamente entre los tres modelos principales.[1]

En cualquier caso, el reconocimiento léxico probablemente contribuye significativamente a la segmentación del habla a través de las pistas contextuales que proporciona, dado que es un sistema altamente probabilístico, basado en la probabilidad estadística de que ciertas palabras o constituyentes aparezcan juntos. Por ejemplo, uno puede imaginar una situación en la que una persona podría decir "compre mi perro en una ____ tienda" y la vocal de la palabra que falta se pronuncia como "net", "sweat" o "pet". Si bien la probabilidad de "netshop" es extremadamente baja, ya que "netshop" no es actualmente un compuesto o frase en inglés, y "sweatshop" también parece improbable en el contexto, "tienda de mascotas" es una buena opción porque es una frase común y También está relacionado con la palabra "perro".[3]

Además, una expresión puede tener diferentes significados dependiendo de cómo se divide en palabras. Un ejemplo popular en inglés, a menudo citado en el campo, es la frase "How to wreck a nice beach", que suena muy similar a "How to recognize speech". Como muestra este ejemplo, la segmentación léxica adecuada depende del contexto y la semántica, que se basan en la experiencia y el conocimiento humanos, y, por lo tanto, requerirían tecnologías avanzadas de reconocimiento de patrones e inteligencia artificial para ser implementadas en una computadora.

El reconocimiento léxico es de particular valor en el campo del reconocimiento de voz por computadora, ya que la capacidad de construir y buscar una red de ideas conectadas semánticamente aumentaría en gran medida la efectividad del software de reconocimiento de voz. Los modelos estadísticos se pueden usar para segmentar y alinear el habla grabada con palabras o teléfonos. Las aplicaciones incluyen la sincronización automática de la sincronización de labios para la animación de caricaturas, la subtitulación de videos de la pelota de seguimiento y la investigación lingüística.

Señales fonotácticas

Segmentación del habla en lactantes y no nativos

Referencias

Related Articles

Timelines

Top Qs

Fact Checks