Nuestro robot de recogida de datos
Si has llegado aquí desde el registro de tu servidor: esto es lo que hace nuestro robot, y cómo pedirle que no vuelva. Se le hace caso a la primera.
Última actualización
Cómo se identifica
Nuestras peticiones llegan siempre con esta cabecera:
- User-Agent
MurciaDespiertaBot/1.0 (+https://murciadespierta.es/bot/) - Quién murciadespierta.es, medio local de Murcia (Región de Murcia)
- Contacto hola@murciadespierta.es
No falsificamos el identificador ni nos hacemos pasar por un navegador. Si en tu registro ves un navegador normal, no somos nosotros.
Qué lee y para qué
Solo páginas públicas de webs oficiales y de servicio del municipio, para reunir datos que luego se publican citando su origen:
- Predicción del tiempo de AEMET, por su API de datos abiertos.
- Precios de carburantes del Ministerio para la Transición Ecológica, por su API pública.
- Ofertas de empleo del Servicio Regional de Empleo y Formación.
- Publicaciones del Boletín Oficial de la Región de Murcia.
- Páginas de información municipal: horarios, avisos y programas de actos.
No recogemos datos personales, no rellenamos formularios, no intentamos entrar en zonas privadas y no descargamos ficheros pesados.
Cómo se comporta
| Qué | Cómo |
|---|---|
| robots.txt | Se respeta siempre, incluidas las reglas Disallow y Crawl-delay. |
| Frecuencia | Como mucho una petición cada dos segundos al mismo dominio. Nunca en paralelo. |
| Cuántas veces al día | Unas pocas: entre una y tres consultas diarias por fuente, en horario de mañana. |
| Caché | Lo que se descarga se guarda hasta 24 horas para no volver a pedirlo. |
| Errores | Ante un 429 o un 503 se para y no reintenta hasta el día siguiente. |
| Bloqueos | Si una web nos bloquea, dejamos de pedirle. No se esquiva nada. |
Nunca esquivamos una medida antibot. Ni con proxies, ni falsificando la huella de un navegador, ni resolviendo captchas. Cuando una web nos ha cerrado la puerta —nos ha pasado con varias— la respuesta ha sido dejar de pedirle y buscar otra vía, no colarnos.
Cómo bloquearlo
La forma limpia es tu robots.txt:
User-agent: MurciaDespiertaBot
Disallow: /Con eso dejamos de entrar en cuanto lo leamos, como mucho al día siguiente. Si solo quieres cerrar una parte:
User-agent: MurciaDespiertaBot
Disallow: /privado/
Crawl-delay: 10Y si prefieres decírnoslo y ya está, escribe a hola@murciadespierta.es con el dominio. Lo quitamos a mano el mismo día, sin preguntar por qué.
Si crees que te hemos hecho daño
Un bot mal configurado puede tirar una web pequeña. El nuestro está pensado para no hacerlo —una petición cada dos segundos es menos que un visitante leyendo—, pero si has visto carga anormal con nuestro identificador, dínoslo con la fecha y la hora y lo miramos. Y mientras tanto, bloquéanos sin contemplaciones: no nos vamos a ofender.
Y al revés: robots que entran aquí
Nuestro propio robots.txt deja pasar a los buscadores y también a los rastreadores de asistentes de IA. Lo único cerrado es el panel de administración y los enlaces internos de seguimiento. Si haces un buscador o un asistente y necesitas algo concreto, escribe: seguramente haya una forma mejor que rastrear.
