Skip to content

Commit f686d6b

Browse files
Actualizo enunciado TP
1 parent 80b516d commit f686d6b

2 files changed

Lines changed: 79 additions & 8 deletions

File tree

docs/tp_smaart.md

Lines changed: 4 additions & 8 deletions
Original file line numberDiff line numberDiff line change
@@ -8,11 +8,11 @@ en donde $Y(\omega)$ es la transformada de Fourier de la señal de salida, $y[n]
88

99
Si nuestro sistema se puede considerar lineal e invariante en el tiempo, conocer su respuesta en frecuencia implica que lo tenemos completamente caracterizado, ya que su antitransformada corresponde a su respuesta al impulso. A través de esta caracterización es muy simple conocer el efecto que el sistema tendrá mediante la convolución entre la señal de entrada y la respuesta al impulso $h[n]$:
1010

11-
$$y[n] = \sum_{k=-\infty}^{\infty}x[n]*h[n-k]$$
11+
$$y[n] = \sum_{k=-\infty}^{\infty}x[k]*h[n-k]$$
1212

1313
o, en frecuencia:
1414

15-
$$Y(\omega) = X(\omega)Y(\omega)$$
15+
$$Y(\omega) = X(\omega)H(\omega)$$
1616

1717
El trabajo práctico se divide en dos partes. La primera consiste en el desarrollo mediante código de un sistema que permita realizar las siguientes tareas:
1818

@@ -35,7 +35,7 @@ El trabajo práctico se divide en dos partes. La primera consiste en el desarrol
3535
* Generar las siguientes señales temporales:
3636

3737
- Suma de tonos puros + ruido blanco de distintas amplitudes.
38-
- Señal musical elegida por el grupo + ruido blanco de distintas amplitudes.
38+
- Señal musical + ruido blanco de distintas amplitudes.
3939

4040
* Filtrar las señales con los filtros diseñados y analizar los resultados. Hacerlo mediante convolución en el dominio del tiempo y mediante convolución circular en frecuencia (usar propiedades).
4141

@@ -45,11 +45,7 @@ La segunda parte consiste en la identificación de sistemas desconocidos usando
4545

4646
$$\gamma_{xy}^2(\omega)=\frac{|G_{xy}(\omega)|^2}{G_{xx}(\omega)\,G_{yy}(\omega)}$$
4747

48-
donde $\gamma_{xy}^2(\omega)$ es la coherencia cuadrática, $G_{xy}(\omega)$ es la densidad espectral de potencia cruzada entre las señales de entrada y salida, $G_{xx}(\omega)$ es la densidad espectral de potencia de la señal de entrada y $G_{yy}(\omega)$ es la densidad espectral de potencia de la señal de salida. Las densidades espectrales de potencia se calculan, de forma genérica, según la siguiente ecuación:
49-
50-
$$G_{uv}(\omega) = \left\langle U(\omega)V^*(\omega) \right\rangle$$
51-
52-
en donde $\langle\dot\rangle$ corresponde al promedio temporal de varios bloques de transformadas. Esto último consiste en tomar ventanas (solapadas o no) de las señales temporales, calcular las transformadas de cada bloque y promediar los sucesivos espectros. ¿Qué se ganaría trabajando así?
48+
donde $\gamma_{xy}^2(\omega)$ es la coherencia cuadrática, $G_{xy}(\omega)$ es la densidad espectral de potencia cruzada entre las señales de entrada y salida, $G_{xx}(\omega)$ es la densidad espectral de potencia de la señal de entrada y $G_{yy}(\omega)$ es la densidad espectral de potencia de la señal de salida. Las densidades espectrales de potencia se calculan corresponden a las transformadas de Fourier de las correlaciones cruzadas o autocorrelaciones, dependiendo del caso.
5349

5450
La coherencia toma valores entre 0 y 1. Si la coherencia vale 1 para alguna frecuencia en particular, la relación entre las señales de entrada y salida a esa frecuencia es perfectamente lineal. En cambio, si este parámetro vale 0 para alguna frecuencia en particular, significa que no existe relación lineal en esa parte del espectro. ¿Por qué consideran que se cumplen esas relaciones dada la forma en la que se calcula la coherencia? Para el caso de los pares de señales que deben analizar, ¿cómo es la linealidad del sistema en distintas partes del espectro? ¿Qué tipos de sistemas reales podrían dar lugar a ese tipo de comportamientos?
5551

docs/tps/tp_filtros.md

Lines changed: 75 additions & 0 deletions
Original file line numberDiff line numberDiff line change
@@ -0,0 +1,75 @@
1+
# Estimación de dirección de arribo de fuentes sonoras
2+
3+
## Perspectiva histórica
4+
5+
Imagínense que son franceses combatiendo en la primera guerra mundial. El Archiduque Ferdinando fue asesinado, intensificando el desequilibrio entre las relaciones diplomáticas de las grandes potencias de la época: los imperios Austro-Húngaro, Alemán, Británico y Ruso, además de Francia. En el medio de la feroz guerra de trincheras había surgido una nueva amenaza para la supervivencia, el ataque aéreo por parte de los zeppelines alemanes. En una situación así solo cabía razonar qué herramientas había disponibles para poder predecir de dónde podía provenir el siguiente ataque. Esperar a una identificación visual de la amenaza no era una opción válida, sería demasiado tarde. La alternativa que quedaba tenía que ver con otro de nuestros sentidos, la audición. Si estuviéramos en una habitación con los ojos cerrados y alguien hablara podríamos intuir de dónde viene la fuente a partir de las diferencias espectrales y de tiempo de arribo de la señal sonora a cada una de nuestros oídos. Extrapolando de forma algo irresponsable uno podría pensar que si puedo identificar la dirección de arribo de una fuente "chica" con sensores "chicos", podría lograr algo análogo para una fuente de porte mucho mayor usando sensores más grandes. Efectivamente es lo que pasó, llegando a sistemas como el que se ven a continuación:
6+
7+
![Tubas de guerra, primera guerra mundial](./imgs/doa_tubas.jpg "Tubas de guerra, primera guerra mundial")
8+
9+
El desarrollo de este campo de estudio no se detuvo aquí, y a lo largo de los años surgieron varios algoritmos que permiten determinar de forma precisa localizaciones espaciales de fuentes a partir de un número reducido de sensores (bastante) más convencionales que los mencionados anteriormente.
10+
11+
## El TP
12+
13+
Las técnicas de estimación de arribo apuntan a, justamente, estimar la dirección de arribo de la señal sonora a los distintos sensores. Esto es sutilmente distinto a estimar la localización de la fuente, en donde buscamos determinar de forma precisa la posición (x,y,z) de la fuente en el espacio. Si la fuente sonora está localizada en el campo cercano, además de la dirección de arribo será posible determinar la distancia entre esta y los sensores. Esto es lo que buscaremos en este trabajo práctico, en donde estimaremos el ángulo azimutal de la fuente en cuestión y su distancia a los distintos sensores. Suponiendo que contamos con, por ejemplo, 3 micrófonos equiespaciados, el experimento queda representado por el siguiente diagrama:
14+
15+
![Esquema DOA, N sensores equiespaciados](./imgs/doa_sensores.png "Esquema DOA, 3 sensores equiespaciados")
16+
17+
en donde $s(t)$ representa la fuente cuya dirección se busca estimar en función del tiempo, $y_n(t)$ es la señal grabada por el enésimo sensor, $r_n$ la distancia entre la fuente y el sensor $n$, $\phi_n$ es el ángulo incidente y $d$ es la distancia entre micrófonos.
18+
19+
Obviamente, las distancias y los ángulos entre los sensores y la fuente son desconocidos, sino no habría mucho que discutir. Como casi siempre, hay una solución para este problema. Si conocemos las diferencias en los tiempos de arribo (TDOA, por las siglas en inglés) de las señales a cada micrófono, podemos estimar todas las variables que nos faltan. La TDOA entre los sensores 1 y 2 de nuestro ejemplo viene dada por:
20+
21+
$$ \tau_{1,2} = \frac{r_2-r_1}{c} $$
22+
23+
en donde $c$ corresponde a la velocidad de propagación del sonido en aire.
24+
25+
Por otro lado, la TDOA entre los sensores 1 y 3 es:
26+
27+
$$ \tau_{1,3} = \frac{r_3-r_1}{c} $$
28+
29+
Por otro lado, usando trigonometría sabemos que:
30+
31+
$$ r_2^2 = r_1^2 + d^2 + 2r_1\;\cos(\phi_1) $$
32+
33+
Análogamente:
34+
35+
$$ r_3^2 = r_1^2 + 4d^2 + 4r_1\;\cos(\phi_1) $$
36+
37+
Ahora bien, los sensores son colocados por el usuario, así que una vez que se define la geometría del arreglo de micrófonos $d$ es un dato medible. Si podemos estimar de alguna forma $\tau_{1,2}$ y $\tau_{1,3}$, usando las ecuaciones que acabamos de presentar podemos calcular las incógnitas $r_1$, $r_2$, $r_3$ y $\phi_1$. Aplicando nuevamente trigonometría podemos estimar $\phi_2$ y $\phi_3$, y, como se imaginarán este esquema de trabajo es extrapolable a un número arbitrario de sensores. Todo es calculable si conocemos, o estimamos, los TDOA. Es en este punto en donde nos vamos a centrar en el trabajo práctico.
38+
39+
La propuesta es que estimen las diferencias en tiempos de arribo mediante distintas técnicas: correlación cruzada clásica y su versión generalizada (con las distintas variantes que recaen dentro de esta versión). Como referencias, recomendamos el capítulo 9 de [1] y el trabajo de Knapp y CLifford [2], pero pueden extender esto si lo consideran pertinente. El array de sensores que deben proponer es de 4 micrófonos dispuestos linealmente con una separación de 10 cm entre ellos.
40+
41+
La implementación de los algoritmos propuestos es muy sencilla, por lo que la parte más interesante del trabajo recaerá en el análsis que hagan de los resultados que obtengan. Algunas preguntas interesantes que deberían hacerse son:
42+
43+
- ¿Da lo mismo usar un micrófono solo o un arreglo?
44+
- ¿Es lo mismo hacer el experimento en una sala anecoica que en una normal? ¿Qué parámetros acústicos sería interesante estudiar en este último caso?
45+
- ¿Hay diferencias en cuanto a tiempo de cómputo entre trabajar con la correlación cruzada en el dominio temporal y usar la versión generalizada de la correlacion cruzada?
46+
- ¿En qué tipo de sistemas de coordenadas conviene trabajar, cartesianas, esféricas?
47+
48+
En cuanto a la evaluación de los algoritmos, deberían tener en cuenta los siguientes aspectos:
49+
50+
- Error en función del ángulo de elevación de la fuente.
51+
- Error en función de la distancia entre la fuente y los sensores.
52+
- Error en función de la separación entre micrófonos.
53+
- Error en función de la cantidad de micrófonos del arreglo.
54+
- Error en función de parámetros acústicos del recinto real.
55+
- Error en función de parámetros elegidos al hacer la medición, como la frecuencia de muestreo.
56+
- Otros tipos de análsis que se les ocurran.
57+
58+
En líneas generales, el desarrollo del trabajo tiene tres etapas:
59+
- Simulación de recintos, arrays de micrófonos y fuente con pyroomacoustics, EASE, o el software que prefieran. Acá se deberían contemplar variaciones de los parámetros que les permitirán evaluar sus algoritmos sobre las distintas situaciones propuestas.
60+
- Desarrollo de los algoritmos de TDAO y DAO.
61+
- Evaluación de los algoritmos sobre las simulaciones generadas.
62+
63+
El desarrollo de su trabajo tiene que verse reflejado en un informe que siga el formato propuesto (en [Word](https://docs.google.com/document/d/1XwUWKWTRPKlJPzpGfd20riz-uNmUvYBx/edit?usp=drive_link&ouid=109118869525257004528&rtpof=true&sd=true) o en [LaTex](https://drive.google.com/file/d/12xZTOi8-OQKFwEuPdAjPenD1G1w3OghP/view?usp=drive_link)), cumpliendo con todas las secciones que en él se detallan.
64+
65+
## Condiciones para la entrega
66+
67+
El trabajo puede realizarse en grupos de hasta 4 personas. Además de la entrega del trabajo completo se les pide una pre-entrega, que corresponde a una versión parcial del trabajo (secciones de Introducción, Marco teórico y Desarrollo experimental). También deben entregar el código correspondiente a las simulaciones acústicas y a los algoritmos de estimación de DOA y TDOA.
68+
69+
La fecha de la pre-entrega es el **11 de junio**, mientras que la fecha de la entrega final es el **30 de junio**. No se aceptarán entregas finales fuera de esta fecha (recuerden que el trabajo práctico es condición de aprobación de la cursada)
70+
71+
## Referencias
72+
73+
[1] Microphone Array Signal Processing. (2008). En Springer Topics in Signal Processing. Springer Berlin Heidelberg. https://doi.org/10.1007/978-3-540-78612-2 [LINK](https://drive.google.com/file/d/1zdFp_y5iELllENNXtSrRlrsap6-taXVE/view?usp=sharing)
74+
75+
[2] Knapp, C., & Carter, G. (1976). The generalized correlation method for estimation of time delay. IEEE Transactions on Acoustics, Speech, and Signal Processing, 24(4), 320–327. https://doi.org/10.1109/tassp.1976.1162830 [LINK](https://drive.google.com/file/d/1Y8QgWWNszJjTPhN6HyyN7iHceYvJpyRc/view?usp=sharing)

0 commit comments

Comments
 (0)