[Orador 1]: Hola, en esta parte teórica hablaremos del distribución de especies, de sus componentes y de cómo se van a llevar a cabo. Empezaremos definiendo qué son los modelos de distribución de especies, que como cualquier modelo son una simplificación de la realidad. En este caso son una herramienta que permite estimar la distribución geográfica de las especies mediante la caracterización de las condiciones ambientales que son adecuadas para su existencia y persistencia. Se fundamentan en la teoría de nicho ecológico. El nicho ecológico es el conjunto de condiciones ambientales en las que una especie puede persistir, denominado espacio ambiental. Los modelos de hábitat se basan, por lo tanto, en la comparación del espacio geográfico, es decir, las áreas en las que se da una especie y el espacio ambiental, que son las condiciones en las que se da. Los modelos de distribución de especies han experimentado un gran auge en los últimos años y están en pleno desarrollo y expansión, usándose con múltiples propósitos. En la actualidad son considerados piezas muy importantes en la gestión y conservación de especies. Algunos de sus usos más habituales son la restauración ecológica en aspectos de traslocación y restauración de especies, la identificación de riesgos debidos a especies invasoras, precisamente este será el objetivo del caso práctico propuesto, también se usan para valorar el riesgo por cambio climático y para diseñar y planificar espacios protegidos entre otras. Los modelos más habituales son los correlativos, que consisten en relacionar los puntos de ocurrencia de una especie con una serie de variables ambientales. Esto permite identificar aquellos lugares en los que se puede dar la existencia de la especie y los requerimientos para que exista. En otras palabras, cómo tienen que ser esas variables. La distribución obtenida puede ser potencial, es decir, todos los lugares donde puede darse, o actual, si se tienen en cuenta posibles limitaciones a su distribución, que la hacen no estar presente en lugares potencialmente idúneos. Por ejemplo, la capacidad dispersiva, posibles barreras, relaciones bióticas con otras especies, como competencia o molestias antrópicas, etc. Dependiendo de nuestro objetivo será más interesante usar una u otra. La modificación de la distribución de especies lleva aparejada por tanto un proceso que se fundamenta en un marco conceptual complejo. Este proceso consta de tres componentes muy bien diferenciadas, los datos, el algoritmo y la predicción. Cada componente presenta múltiples opciones o alternativas como veremos más adelante. El proceso general consiste en asociar matemática o estadísticamente los datos biológicos, en este caso ocurrencia de la especie que es la variable dependiente con diferentes variables independientes que describen las condiciones del medio. Esta relación se proyecta a todo el área de estudio y se obtiene una predicción para cada lugar que suele representar la probabilidad de existencia de la especie en este punto. entendida como su similitud ambiental con los puntos donde existe la especie. Una parte de los datos de ocurrencia se reserva para la validación del modelo, es decir, ver cómo de buenas son sus predicciones. Tanto en la parte de datos como en la parte de obtención final del modelo son de crucial importancia los sistemas de información geográfica, ya que representan una herramienta indispensable tanto para el tratamiento y gestión de datos como para su análisis y visualización. Vamos a ir viendo cada uno de estos componentes de los modelos así como las diferentes alternativas existentes y sus implicaciones en el desarrollo del modelo. La primera componente y de vital importancia son los datos. Los modelos de distribución de especies precisan de dos tipos de datos, los biológicos que describen la ocurrencia de la especie y los ambientales para caracterizar las condiciones del medio. Nos centraremos primero en los datos biológicos y en los aspectos y diferentes opciones que debemos tener en cuenta. La primera pregunta que surge es cuántos datos precisamos para formular un modelo. Los datos tienen que ser suficientes ya que van a tener una implicación directa en el número de variables que podemos utilizar. En términos generales se precisan como mínimo entre 10 y 50 observaciones totales, aunque hay autores que hablan de al menos 5 observaciones por variable. Además, la muestra debe ser representativa de todo el rango en el que está presente la especie y es necesario tener en cuenta la hipótesis de equilibrio, es decir, si la especie está presente en todas las zonas adecuadas y no presente en las no adecuadas. Otro aspecto importante es la fiabilidad de los datos y esto está relacionado con su origen. Normalmente provienen de colecciones de museos o recursos online, por lo que están sujetos a posibles errores de georreferenciación, de identificación y tampoco sabemos de qué manera se han tomado y por tanto el sesgo que pueden tener. Por último los datos de ocurrencia pueden ser de dos tipos, solo presencias, este es el tipo de información que se dispone en la mayoría de los casos, datos de presencia y ausencias y una tipología intermedia que son los datos de presencias y pseudo ausencias generadas aleatoriamente y denominadas background. Si nos centramos en las variables ambientales, igualmente una de las primeras preguntas que nos hacemos es el número de variables necesarias. Aquí tenemos que tener en cuenta el número de puntos de ocurrencia de los que disponemos, como hemos visto anteriormente, porque las variables consumen grados de libertad. Es también muy importante evitar la casualidad y la colinearidad de las variables que introducimos en el modelo, por lo que es recomendable aplicar algún método de selección de variables entre todas las variables candidatas o potencialmente explicativas que tengamos. Otro aspecto es la extensión espacial y la resolución de las variables. No es igual la resolución que necesitamos para unas especies que para otras. Por ejemplo, un insecto y un carnívoro de gran tamaño precisan de resoluciones muy diferentes. También hay que tener en cuenta el tamaño del área de estudio, normalmente a mayor extensión menor resolución tendrán las variables empleadas. Es importante resaltar que existen muchos tipos de variables. Por lo que describen pueden ser climáticas, topográficas, de cobertura del suelo, de interacciones bióticas, etc. Las variables además pueden ser directas o indirectas. Debemos evitar estas últimas sobre todo si queremos extrapolar un modelo. Por ejemplo, la altitud es una variable indirecta. Las condiciones ligadas a la altitud en un lugar no tienen por qué ser las mismas en otro lugar. Y por último las variables pueden ser continuas, por ejemplo la temperatura, o categóricas, por ejemplo los usos del suelo. En este caso debemos tener en cuenta que cada categoría de la variable consume un grado de libertad, es decir, cuenta como una variable. La segunda componente de los modelos son los algoritmos. Estos son los encargados de identificar las relaciones complejas de la ocurrencia de una especie en el espacio ambiental multidimensional, para posteriormente utilizar esta relación para predecir la idoneidad del territorio para albergar a una especie. Es importante conocer la gran variedad de algoritmos existentes y cómo abordarlos para usar el más adecuado para nuestros objetivos y para el tipo de información con la que contamos. A grosso modo, necesitamos saber en qué se basan. Existen algoritmos basados en métodos estadísticos como los modelos lineales generalizados, otros basados en técnicas de Machine Learning como Maxen y las redes neuronales artificiales y otros en la integración de distintas técnicas. Dependiendo de los métodos en los que se basen estos algoritmos ofrecerán explicación o simplemente predicción. Otro aspecto importante es conocer qué tipos de datos necesitan los algoritmos. Algunos solo presencias, por ejemplo BioClimb, otros presencias e ausencias, por ejemplo los modelos aditivos generalizados y los modelos lineales generalizados y las redes neuronales. Y otros que admiten presencias y pseudoausencias o background, como Maxen. Así también es necesario conocer qué tipos de variables usan, si admiten todo tipo de variables, continuas y categóricas o solo continuas. Si es así, se precisará transformar la variable categórica en una variable continua. Y por último, hay algoritmos que proporcionan predicciones continuas, por ejemplo la probabilidad de existencia, Maxen, y otros que originan predicciones binarias, es decir, si es hábitat o no hábitat. Una vez desarrollado el modelo, como se indicó con anterioridad, debemos saber cómo funciona realmente, es decir, qué pasa con sus predicciones. Para ello se suele evaluar la proporción de puntos clasificados correctamente, es decir, los aciertos y los errores que produce. Esto se conoce como matriz de confusión. Se pueden cometer dos tipos de errores, de comisión, que es clasificar una ausencia como presencia, y de omisión, que es clasificar una presencia como ausencia. A partir de esto se pueden derivar diferentes estadísticos. para evaluar la fiabilidad o capacidad discriminativa del modelo. Algunos de estos estadísticos sirven también para definir los valores umbral para convertir una predicción continua en una binaria, hábitat por encima de ese umbral y no hábitat por debajo. Uno de los estadísticos más utilizados para validar los modelos de distribución de especies es el Area Under the Road Curve. A mayor valor de AUC, mayor capacidad discriminativa. Se considera discriminación aceptable si el valor del AUC es mayor de 0.7 y muy buena si es mayor de 0.9. Una vez conocemos los componentes de los modelos, el siguiente paso es llevarlos a la práctica. Para ello se precisan de herramientas software asistidas por sistemas de información geográfica que lleven a cabo los procesos matemáticos de calibración y validación de estos modelos. Existen muchos y muy variados softwares. Algunos ejemplos son Biomod, Modeco, R y en el que nos vamos a centrar para el ejercicio práctico de este módulo, Maxen. Maxen es un programa de uso general muy utilizado en los últimos años que se descarga de manera gratuita en el link proporcionado y tiene una interfaz muy sencilla. Maxen calcula la probabilidad de ocurrencia de una especie de acuerdo al principio de máxima entropía, precisa de datos de presencia y el mismo define pseudoausencias o background. Funciona con variables tanto continuas como categóricas y la correlación de variables no supone un grave problema en este caso. Maxen proporciona una predicción continua con valores de 0 a 100, refiriéndose a la probabilidad de ocurrencia de la especie. Es un algoritmo que ha mostrado muy buenos resultados con respecto a otros métodos. Para concluir la parte conceptual del módulo y antes de pasar a poner en práctica un modelo de distribución de especies, me gustaría incidir en las fortalezas y limitaciones de los modelos. En los últimos años, y debido a su gran utilidad, han sido usados de manera extensiva, muchas veces hasta abusiva. Es necesario comprender que no se trata de meter una serie de datos y obtener un mapa de colores, sino de ser capaces de interpretar lo que significa ese mapa. Es imprescindible ser muy cautos y tener siempre en cuenta que la calidad del modelo está estrechamente ligada a la calidad de los datos de partida y la de las premisas con las que operamos. Hay que tener mucha precaución cuando los modelos se extrapolan, es decir, se proyectan fuera del rango de valores donde han sido calibrados, por ejemplo si los proyectamos en otro continente, debido a la gran incertidumbre que puede existir en las predicciones. Y también hay que tener muy claro que el mero hecho de usar técnicas complejas no es garantía de que el modelo sea correcto. Por lo tanto, es sumamente importante tener en cuenta las asunciones y decisiones que se han tomado a lo largo de todos los pasos que conllevan la modelización para interpretar los resultados. Todos estos conceptos los aplicaremos en la segunda parte del módulo, con un caso práctico. El caso práctico propuesto será precisamente identificar el riesgo potencial de colonización en España de una especie exótica invasora, Cortaderia selleana o hierba de la pampa, proveniente de Sudamérica. Finalmente, podéis encontrar las referencias citadas en las explicaciones. Como el propósito de este módulo no es profundizar en conceptos teóricos tremendamente complejos y de los que existe una amplia literatura, os dejo dos lecturas recomendadas que sintetizan los aspectos conceptuales más importantes de la modelización de distribución de especies, como documentos bases sobre los cuales podréis ampliar información.