Saltar al contenido
Murcia

Nuestro robot de recogida de datos

Si has llegado aquí desde el registro de tu servidor: esto es lo que hace nuestro robot, y cómo pedirle que no vuelva. Se le hace caso a la primera.

Última actualización

Cómo se identifica

Nuestras peticiones llegan siempre con esta cabecera:

No falsificamos el identificador ni nos hacemos pasar por un navegador. Si en tu registro ves un navegador normal, no somos nosotros.

Qué lee y para qué

Solo páginas públicas de webs oficiales y de servicio del municipio, para reunir datos que luego se publican citando su origen:

  • Predicción del tiempo de AEMET, por su API de datos abiertos.
  • Precios de carburantes del Ministerio para la Transición Ecológica, por su API pública.
  • Ofertas de empleo del Servicio Regional de Empleo y Formación.
  • Publicaciones del Boletín Oficial de la Región de Murcia.
  • Páginas de información municipal: horarios, avisos y programas de actos.

No recogemos datos personales, no rellenamos formularios, no intentamos entrar en zonas privadas y no descargamos ficheros pesados.

Cómo se comporta

QuéCómo
robots.txtSe respeta siempre, incluidas las reglas Disallow y Crawl-delay.
FrecuenciaComo mucho una petición cada dos segundos al mismo dominio. Nunca en paralelo.
Cuántas veces al díaUnas pocas: entre una y tres consultas diarias por fuente, en horario de mañana.
CachéLo que se descarga se guarda hasta 24 horas para no volver a pedirlo.
ErroresAnte un 429 o un 503 se para y no reintenta hasta el día siguiente.
BloqueosSi una web nos bloquea, dejamos de pedirle. No se esquiva nada.

Nunca esquivamos una medida antibot. Ni con proxies, ni falsificando la huella de un navegador, ni resolviendo captchas. Cuando una web nos ha cerrado la puerta —nos ha pasado con varias— la respuesta ha sido dejar de pedirle y buscar otra vía, no colarnos.

Cómo bloquearlo

La forma limpia es tu robots.txt:

User-agent: MurciaDespiertaBot
Disallow: /

Con eso dejamos de entrar en cuanto lo leamos, como mucho al día siguiente. Si solo quieres cerrar una parte:

User-agent: MurciaDespiertaBot
Disallow: /privado/
Crawl-delay: 10

Y si prefieres decírnoslo y ya está, escribe a hola@murciadespierta.es con el dominio. Lo quitamos a mano el mismo día, sin preguntar por qué.

Si crees que te hemos hecho daño

Un bot mal configurado puede tirar una web pequeña. El nuestro está pensado para no hacerlo —una petición cada dos segundos es menos que un visitante leyendo—, pero si has visto carga anormal con nuestro identificador, dínoslo con la fecha y la hora y lo miramos. Y mientras tanto, bloquéanos sin contemplaciones: no nos vamos a ofender.

Y al revés: robots que entran aquí

Nuestro propio robots.txt deja pasar a los buscadores y también a los rastreadores de asistentes de IA. Lo único cerrado es el panel de administración y los enlaces internos de seguimiento. Si haces un buscador o un asistente y necesitas algo concreto, escribe: seguramente haya una forma mejor que rastrear.