1 00:00:08,000 --> 00:00:11,970 [Orador 1]: Hola, en esta parte teórica hablaremos del marco conceptual de los modelos de 2 00:00:11,970 --> 00:00:15,679 distribución de especies, de sus componentes y de cómo se van a llevar a 3 00:00:15,679 --> 00:00:16,603 cabo. 4 00:00:16,803 --> 00:00:20,700 Empezaremos definiendo qué son los modelos de distribución de especies, que como 5 00:00:20,700 --> 00:00:23,365 cualquier modelo son una simplificación de la realidad. 6 00:00:23,565 --> 00:00:27,682 En este caso son una herramienta que permite estimar la distribución geográfica 7 00:00:27,682 --> 00:00:30,903 de las especies mediante la caracterización de las condiciones 8 00:00:30,903 --> 00:00:34,229 ambientales que son adecuadas para su existencia y persistencia. 9 00:00:34,429 --> 00:00:37,010 Se fundamentan en la teoría de nicho ecológico. 10 00:00:37,210 --> 00:00:41,557 El nicho ecológico es el conjunto de condiciones ambientales en las que una 11 00:00:41,557 --> 00:00:44,672 especie puede persistir, denominado espacio ambiental. 12 00:00:44,872 --> 00:00:49,376 Los modelos de hábitat se basan, por lo tanto, en la comparación del espacio 13 00:00:49,376 --> 00:00:54,362 geográfico, es decir, las áreas en las que se da una especie y el espacio ambiental, 14 00:00:54,362 --> 00:00:56,825 que son las condiciones en las que se da. 15 00:00:57,025 --> 00:01:01,577 Los modelos de distribución de especies han experimentado un gran auge en los 16 00:01:01,577 --> 00:01:06,070 últimos años y están en pleno desarrollo y expansión, usándose con múltiples 17 00:01:06,070 --> 00:01:07,040 propósitos. 18 00:01:07,240 --> 00:01:10,732 En la actualidad son considerados piezas muy importantes en la gestión y 19 00:01:10,732 --> 00:01:11,962 conservación de especies. 20 00:01:12,162 --> 00:01:16,668 Algunos de sus usos más habituales son la restauración ecológica en aspectos de 21 00:01:16,668 --> 00:01:21,175 traslocación y restauración de especies, la identificación de riesgos debidos a 22 00:01:21,175 --> 00:01:25,913 especies invasoras, precisamente este será el objetivo del caso práctico propuesto, 23 00:01:25,913 --> 00:01:30,246 también se usan para valorar el riesgo por cambio climático y para diseñar y 24 00:01:30,246 --> 00:01:32,673 planificar espacios protegidos entre otras. 25 00:01:32,873 --> 00:01:36,513 Los modelos más habituales son los correlativos, que consisten en relacionar 26 00:01:36,513 --> 00:01:40,299 los puntos de ocurrencia de una especie con una serie de variables ambientales. 27 00:01:40,499 --> 00:01:44,400 Esto permite identificar aquellos lugares en los que se puede dar la existencia de 28 00:01:44,400 --> 00:01:46,664 la especie y los requerimientos para que exista. 29 00:01:46,864 --> 00:01:49,846 En otras palabras, cómo tienen que ser esas variables. 30 00:01:50,046 --> 00:01:53,972 La distribución obtenida puede ser potencial, es decir, todos los lugares 31 00:01:53,972 --> 00:01:58,171 donde puede darse, o actual, si se tienen en cuenta posibles limitaciones a su 32 00:01:58,171 --> 00:02:01,934 distribución, que la hacen no estar presente en lugares potencialmente 33 00:02:01,934 --> 00:02:02,894 idúneos. 34 00:02:03,094 --> 00:02:08,530 Por ejemplo, la capacidad dispersiva, posibles barreras, relaciones bióticas con 35 00:02:08,530 --> 00:02:12,700 otras especies, como competencia o molestias antrópicas, etc. 36 00:02:12,900 --> 00:02:18,423 Dependiendo de nuestro objetivo será más interesante usar una u otra. 37 00:02:18,911 --> 00:02:22,923 La modificación de la distribución de especies lleva aparejada por tanto un 38 00:02:22,923 --> 00:02:26,014 proceso que se fundamenta en un marco conceptual complejo. 39 00:02:26,214 --> 00:02:31,058 Este proceso consta de tres componentes muy bien diferenciadas, los datos, el 40 00:02:31,058 --> 00:02:32,716 algoritmo y la predicción. 41 00:02:32,916 --> 00:02:36,847 Cada componente presenta múltiples opciones o alternativas como veremos más 42 00:02:36,847 --> 00:02:37,758 adelante. 43 00:02:37,958 --> 00:02:43,014 El proceso general consiste en asociar matemática o estadísticamente los datos 44 00:02:43,014 --> 00:02:48,465 biológicos, en este caso ocurrencia de la especie que es la variable dependiente con 45 00:02:48,465 --> 00:02:53,391 diferentes variables independientes que describen las condiciones del medio. 46 00:02:53,591 --> 00:02:57,731 Esta relación se proyecta a todo el área de estudio y se obtiene una predicción 47 00:02:57,731 --> 00:03:01,977 para cada lugar que suele representar la probabilidad de existencia de la especie 48 00:03:01,977 --> 00:03:02,953 en este punto. 49 00:03:03,153 --> 00:03:09,418 entendida como su similitud ambiental con los puntos donde existe la especie. 50 00:03:09,618 --> 00:03:14,357 Una parte de los datos de ocurrencia se reserva para la validación del modelo, es 51 00:03:14,357 --> 00:03:17,083 decir, ver cómo de buenas son sus predicciones. 52 00:03:17,283 --> 00:03:21,558 Tanto en la parte de datos como en la parte de obtención final del modelo son de 53 00:03:21,558 --> 00:03:25,726 crucial importancia los sistemas de información geográfica, ya que representan 54 00:03:25,726 --> 00:03:29,947 una herramienta indispensable tanto para el tratamiento y gestión de datos como 55 00:03:29,947 --> 00:03:31,734 para su análisis y visualización. 56 00:03:31,934 --> 00:03:36,300 Vamos a ir viendo cada uno de estos componentes de los modelos así como las 57 00:03:36,300 --> 00:03:41,139 diferentes alternativas existentes y sus implicaciones en el desarrollo del modelo. 58 00:03:41,841 --> 00:03:45,804 La primera componente y de vital importancia son los datos. 59 00:03:46,004 --> 00:03:50,159 Los modelos de distribución de especies precisan de dos tipos de datos, los 60 00:03:50,159 --> 00:03:54,314 biológicos que describen la ocurrencia de la especie y los ambientales para 61 00:03:54,314 --> 00:03:56,505 caracterizar las condiciones del medio. 62 00:03:56,705 --> 00:04:00,370 Nos centraremos primero en los datos biológicos y en los aspectos y diferentes 63 00:04:00,370 --> 00:04:02,132 opciones que debemos tener en cuenta. 64 00:04:02,332 --> 00:04:06,918 La primera pregunta que surge es cuántos datos precisamos para formular un modelo. 65 00:04:07,118 --> 00:04:10,636 Los datos tienen que ser suficientes ya que van a tener una implicación directa en 66 00:04:10,636 --> 00:04:12,505 el número de variables que podemos utilizar. 67 00:04:12,705 --> 00:04:16,502 En términos generales se precisan como mínimo entre 10 y 50 observaciones 68 00:04:16,502 --> 00:04:20,670 totales, aunque hay autores que hablan de al menos 5 observaciones por variable. 69 00:04:20,870 --> 00:04:25,083 Además, la muestra debe ser representativa de todo el rango en el que está presente 70 00:04:25,083 --> 00:04:29,245 la especie y es necesario tener en cuenta la hipótesis de equilibrio, es decir, si 71 00:04:29,245 --> 00:04:33,150 la especie está presente en todas las zonas adecuadas y no presente en las no 72 00:04:33,150 --> 00:04:34,116 adecuadas. 73 00:04:34,316 --> 00:04:38,384 Otro aspecto importante es la fiabilidad de los datos y esto está relacionado con 74 00:04:38,384 --> 00:04:39,302 su origen. 75 00:04:39,502 --> 00:04:44,171 Normalmente provienen de colecciones de museos o recursos online, por lo que están 76 00:04:44,171 --> 00:04:48,091 sujetos a posibles errores de georreferenciación, de identificación y 77 00:04:48,091 --> 00:04:52,357 tampoco sabemos de qué manera se han tomado y por tanto el sesgo que pueden 78 00:04:52,357 --> 00:04:53,313 tener. 79 00:04:53,513 --> 00:04:58,934 Por último los datos de ocurrencia pueden ser de dos tipos, solo presencias, este es 80 00:04:58,934 --> 00:05:03,702 el tipo de información que se dispone en la mayoría de los casos, datos de 81 00:05:03,702 --> 00:05:08,863 presencia y ausencias y una tipología intermedia que son los datos de presencias 82 00:05:08,863 --> 00:05:13,305 y pseudo ausencias generadas aleatoriamente y denominadas background. 83 00:05:14,425 --> 00:05:17,826 Si nos centramos en las variables ambientales, igualmente una de las 84 00:05:17,826 --> 00:05:21,432 primeras preguntas que nos hacemos es el número de variables necesarias. 85 00:05:21,632 --> 00:05:26,573 Aquí tenemos que tener en cuenta el número de puntos de ocurrencia de los que 86 00:05:26,573 --> 00:05:30,669 disponemos, como hemos visto anteriormente, porque las variables 87 00:05:30,669 --> 00:05:32,490 consumen grados de libertad. 88 00:05:32,690 --> 00:05:36,525 Es también muy importante evitar la casualidad y la colinearidad de las 89 00:05:36,525 --> 00:05:40,909 variables que introducimos en el modelo, por lo que es recomendable aplicar algún 90 00:05:40,909 --> 00:05:44,745 método de selección de variables entre todas las variables candidatas o 91 00:05:44,745 --> 00:05:46,992 potencialmente explicativas que tengamos. 92 00:05:47,192 --> 00:05:51,053 Otro aspecto es la extensión espacial y la resolución de las variables. 93 00:05:51,253 --> 00:05:55,954 No es igual la resolución que necesitamos para unas especies que para otras. 94 00:05:56,154 --> 00:06:00,927 Por ejemplo, un insecto y un carnívoro de gran tamaño precisan de resoluciones muy 95 00:06:00,927 --> 00:06:01,875 diferentes. 96 00:06:02,075 --> 00:06:06,814 También hay que tener en cuenta el tamaño del área de estudio, normalmente a mayor 97 00:06:06,814 --> 00:06:10,208 extensión menor resolución tendrán las variables empleadas. 98 00:06:10,408 --> 00:06:13,630 Es importante resaltar que existen muchos tipos de variables. 99 00:06:13,830 --> 00:06:18,279 Por lo que describen pueden ser climáticas, topográficas, de cobertura del 100 00:06:18,279 --> 00:06:20,595 suelo, de interacciones bióticas, etc. 101 00:06:20,795 --> 00:06:24,157 Las variables además pueden ser directas o indirectas. 102 00:06:24,357 --> 00:06:27,940 Debemos evitar estas últimas sobre todo si queremos extrapolar un modelo. 103 00:06:28,140 --> 00:06:31,402 Por ejemplo, la altitud es una variable indirecta. 104 00:06:31,602 --> 00:06:35,688 Las condiciones ligadas a la altitud en un lugar no tienen por qué ser las mismas en 105 00:06:35,688 --> 00:06:36,612 otro lugar. 106 00:06:36,812 --> 00:06:41,512 Y por último las variables pueden ser continuas, por ejemplo la temperatura, o 107 00:06:41,512 --> 00:06:44,137 categóricas, por ejemplo los usos del suelo. 108 00:06:44,337 --> 00:06:49,295 En este caso debemos tener en cuenta que cada categoría de la variable consume un 109 00:06:49,295 --> 00:06:52,581 grado de libertad, es decir, cuenta como una variable. 110 00:06:53,005 --> 00:06:55,486 La segunda componente de los modelos son los algoritmos. 111 00:06:55,706 --> 00:06:59,847 Estos son los encargados de identificar las relaciones complejas de la ocurrencia 112 00:06:59,847 --> 00:07:03,730 de una especie en el espacio ambiental multidimensional, para posteriormente 113 00:07:03,730 --> 00:07:07,819 utilizar esta relación para predecir la idoneidad del territorio para albergar a 114 00:07:07,819 --> 00:07:08,819 una especie. 115 00:07:08,833 --> 00:07:13,086 Es importante conocer la gran variedad de algoritmos existentes y cómo abordarlos 116 00:07:13,086 --> 00:07:17,233 para usar el más adecuado para nuestros objetivos y para el tipo de información 117 00:07:17,233 --> 00:07:18,297 con la que contamos. 118 00:07:18,497 --> 00:07:21,579 A grosso modo, necesitamos saber en qué se basan. 119 00:07:21,779 --> 00:07:26,110 Existen algoritmos basados en métodos estadísticos como los modelos lineales 120 00:07:26,110 --> 00:07:30,847 generalizados, otros basados en técnicas de Machine Learning como Maxen y las redes 121 00:07:30,847 --> 00:07:34,948 neuronales artificiales y otros en la integración de distintas técnicas. 122 00:07:35,148 --> 00:07:39,276 Dependiendo de los métodos en los que se basen estos algoritmos ofrecerán 123 00:07:39,276 --> 00:07:41,398 explicación o simplemente predicción. 124 00:07:41,598 --> 00:07:46,001 Otro aspecto importante es conocer qué tipos de datos necesitan los algoritmos. 125 00:07:46,201 --> 00:07:51,310 Algunos solo presencias, por ejemplo BioClimb, otros presencias e ausencias, 126 00:07:51,310 --> 00:07:55,953 por ejemplo los modelos aditivos generalizados y los modelos lineales 127 00:07:55,953 --> 00:07:58,530 generalizados y las redes neuronales. 128 00:07:58,730 --> 00:08:04,222 Y otros que admiten presencias y pseudoausencias o background, como Maxen. 129 00:08:04,422 --> 00:08:10,422 Así también es necesario conocer qué tipos de variables usan, si admiten todo tipo de 130 00:08:10,422 --> 00:08:14,391 variables, continuas y categóricas o solo continuas. 131 00:08:14,591 --> 00:08:18,968 Si es así, se precisará transformar la variable categórica en una variable 132 00:08:18,968 --> 00:08:19,895 continua. 133 00:08:20,095 --> 00:08:25,203 Y por último, hay algoritmos que proporcionan predicciones continuas, por 134 00:08:25,203 --> 00:08:30,711 ejemplo la probabilidad de existencia, Maxen, y otros que originan predicciones 135 00:08:30,711 --> 00:08:34,086 binarias, es decir, si es hábitat o no hábitat. 136 00:08:36,093 --> 00:08:39,708 Una vez desarrollado el modelo, como se indicó con anterioridad, debemos saber 137 00:08:39,708 --> 00:08:42,714 cómo funciona realmente, es decir, qué pasa con sus predicciones. 138 00:08:42,914 --> 00:08:47,676 Para ello se suele evaluar la proporción de puntos clasificados correctamente, es 139 00:08:47,676 --> 00:08:50,195 decir, los aciertos y los errores que produce. 140 00:08:50,395 --> 00:08:52,196 Esto se conoce como matriz de confusión. 141 00:08:52,396 --> 00:08:56,742 Se pueden cometer dos tipos de errores, de comisión, que es clasificar una ausencia 142 00:08:56,742 --> 00:09:00,717 como presencia, y de omisión, que es clasificar una presencia como ausencia. 143 00:09:00,917 --> 00:09:04,898 A partir de esto se pueden derivar diferentes estadísticos. 144 00:09:05,098 --> 00:09:08,380 para evaluar la fiabilidad o capacidad discriminativa del modelo. 145 00:09:08,580 --> 00:09:13,109 Algunos de estos estadísticos sirven también para definir los valores umbral 146 00:09:13,109 --> 00:09:17,879 para convertir una predicción continua en una binaria, hábitat por encima de ese 147 00:09:17,879 --> 00:09:19,752 umbral y no hábitat por debajo. 148 00:09:19,952 --> 00:09:23,809 Uno de los estadísticos más utilizados para validar los modelos de distribución 149 00:09:23,809 --> 00:09:25,936 de especies es el Area Under the Road Curve. 150 00:09:26,136 --> 00:09:29,118 A mayor valor de AUC, mayor capacidad discriminativa. 151 00:09:29,318 --> 00:09:34,816 Se considera discriminación aceptable si el valor del AUC es mayor de 0.7 y muy 152 00:09:34,816 --> 00:09:36,782 buena si es mayor de 0.9. 153 00:09:39,520 --> 00:09:43,164 Una vez conocemos los componentes de los modelos, el siguiente paso es llevarlos a 154 00:09:43,164 --> 00:09:44,064 la práctica. 155 00:09:44,264 --> 00:09:47,864 Para ello se precisan de herramientas software asistidas por sistemas de 156 00:09:47,864 --> 00:09:51,971 información geográfica que lleven a cabo los procesos matemáticos de calibración y 157 00:09:51,971 --> 00:09:53,391 validación de estos modelos. 158 00:09:53,591 --> 00:09:55,773 Existen muchos y muy variados softwares. 159 00:09:55,973 --> 00:10:01,406 Algunos ejemplos son Biomod, Modeco, R y en el que nos vamos a centrar para el 160 00:10:01,406 --> 00:10:04,439 ejercicio práctico de este módulo, Maxen. 161 00:10:05,687 --> 00:10:09,756 Maxen es un programa de uso general muy utilizado en los últimos años que se 162 00:10:09,756 --> 00:10:13,879 descarga de manera gratuita en el link proporcionado y tiene una interfaz muy 163 00:10:13,879 --> 00:10:14,829 sencilla. 164 00:10:15,029 --> 00:10:19,104 Maxen calcula la probabilidad de ocurrencia de una especie de acuerdo al 165 00:10:19,104 --> 00:10:23,466 principio de máxima entropía, precisa de datos de presencia y el mismo define 166 00:10:23,466 --> 00:10:25,131 pseudoausencias o background. 167 00:10:25,331 --> 00:10:29,367 Funciona con variables tanto continuas como categóricas y la correlación de 168 00:10:29,367 --> 00:10:32,095 variables no supone un grave problema en este caso. 169 00:10:32,295 --> 00:10:36,969 Maxen proporciona una predicción continua con valores de 0 a 100, refiriéndose a la 170 00:10:36,969 --> 00:10:39,307 probabilidad de ocurrencia de la especie. 171 00:10:39,507 --> 00:10:44,733 Es un algoritmo que ha mostrado muy buenos resultados con respecto a otros métodos. 172 00:10:46,117 --> 00:10:49,633 Para concluir la parte conceptual del módulo y antes de pasar a poner en 173 00:10:49,633 --> 00:10:53,249 práctica un modelo de distribución de especies, me gustaría incidir en las 174 00:10:53,249 --> 00:10:55,280 fortalezas y limitaciones de los modelos. 175 00:10:55,480 --> 00:11:00,304 En los últimos años, y debido a su gran utilidad, han sido usados de manera 176 00:11:00,304 --> 00:11:02,782 extensiva, muchas veces hasta abusiva. 177 00:11:02,982 --> 00:11:07,646 Es necesario comprender que no se trata de meter una serie de datos y obtener un mapa 178 00:11:07,646 --> 00:11:11,645 de colores, sino de ser capaces de interpretar lo que significa ese mapa. 179 00:11:11,845 --> 00:11:15,801 Es imprescindible ser muy cautos y tener siempre en cuenta que la calidad del 180 00:11:15,801 --> 00:11:19,758 modelo está estrechamente ligada a la calidad de los datos de partida y la de 181 00:11:19,758 --> 00:11:21,529 las premisas con las que operamos. 182 00:11:21,729 --> 00:11:25,828 Hay que tener mucha precaución cuando los modelos se extrapolan, es decir, se 183 00:11:25,828 --> 00:11:30,197 proyectan fuera del rango de valores donde han sido calibrados, por ejemplo si los 184 00:11:30,197 --> 00:11:34,620 proyectamos en otro continente, debido a la gran incertidumbre que puede existir en 185 00:11:34,620 --> 00:11:35,615 las predicciones. 186 00:11:35,815 --> 00:11:40,396 Y también hay que tener muy claro que el mero hecho de usar técnicas complejas no 187 00:11:40,396 --> 00:11:42,802 es garantía de que el modelo sea correcto. 188 00:11:43,002 --> 00:11:46,871 Por lo tanto, es sumamente importante tener en cuenta las asunciones y 189 00:11:46,871 --> 00:11:51,021 decisiones que se han tomado a lo largo de todos los pasos que conllevan la 190 00:11:51,021 --> 00:11:53,489 modelización para interpretar los resultados. 191 00:11:53,770 --> 00:11:57,921 Todos estos conceptos los aplicaremos en la segunda parte del módulo, con un caso 192 00:11:57,921 --> 00:11:58,834 práctico. 193 00:11:59,034 --> 00:12:03,695 El caso práctico propuesto será precisamente identificar el riesgo 194 00:12:03,695 --> 00:12:09,222 potencial de colonización en España de una especie exótica invasora, Cortaderia 195 00:12:09,222 --> 00:12:13,284 selleana o hierba de la pampa, proveniente de Sudamérica. 196 00:12:14,382 --> 00:12:18,544 Finalmente, podéis encontrar las referencias citadas en las explicaciones. 197 00:12:18,744 --> 00:12:22,699 Como el propósito de este módulo no es profundizar en conceptos teóricos 198 00:12:22,699 --> 00:12:26,989 tremendamente complejos y de los que existe una amplia literatura, os dejo dos 199 00:12:26,989 --> 00:12:31,446 lecturas recomendadas que sintetizan los aspectos conceptuales más importantes de 200 00:12:31,446 --> 00:12:35,625 la modelización de distribución de especies, como documentos bases sobre los 201 00:12:35,625 --> 00:12:37,575 cuales podréis ampliar información.