El parte · 5 de agosto de 2026
6 cosas de IA,
y qué haces con ellas.
Día de cosas prácticas más que de titulares. Lo de Hugging Face con la carga de pesos es de esas mejoras que no salen en prensa y te ahorran minutos cada vez que arrancas algo. Y el paper de arXiv sobre citación en contextos largos merece un rato: si estás montando RAG, te está diciendo dónde empieza a mentirte tu sistema.
6 piezas3 con lectura de AIMA6 medios
Los laboratorios
Lo que han anunciado los que fabrican los modelos.
-
Hugging Face5 de agosto de 2026en inglés
Un formato de pesos que carga los modelos grandes cuatro veces más rápido
Cambian cómo se guardan los tensores para que la carga no pase por la CPU. En los ejemplos, un modelo de 70B pasa de 90 a 22 segundos.
Leer en Hugging FaceQué significa
Si arrancas modelos grandes en local o en una máquina que pagas por horas, el tiempo de carga es dinero muerto: la GPU está encendida y no está haciendo nada. Bajar de 90 a 22 segundos suena a poco hasta que lo multiplicas por cada reinicio del día.
El tip: Antes de tocar nada, cronometra tu carga actual. Si estás por debajo de 20 segundos ya, este cambio no te va a devolver el rato que tardas en aplicarlo.
-
Google DeepMind5 de agosto de 2026en inglés
Un modelo pequeño que corre entero en el móvil sin perder el razonamiento largo
Destilan la cadena de razonamiento en vez de las respuestas. Ocupa 3 GB y aguanta contextos de 128k.
Leer en Google DeepMind
El taller
Herramientas, trucos y cosas que ya puedes usar hoy.
-
Simon Willison5 de agosto de 2026en inglés
Cómo dejé de pagar de más por embeddings sin cambiar de proveedor
Cachear por hash del texto normalizado y trocear por párrafo en vez de por caracteres: la factura baja sin tocar la calidad de la búsqueda.
Leer en Simon WillisonQué significa
El coste de embeddings crece en silencio: no es una factura grande de golpe, son céntimos por llamada repetidos miles de veces. Cachear por hash del texto normalizado es lo que corta las repeticiones que ni sabías que tenías.
El tip: Mira tu log de una semana y cuenta cuántos textos distintos has mandado a embeber de verdad. Si el número de únicos es la mitad del total, ahí tienes tu factura partida por dos sin cambiar nada más.
-
Hacker News5 de agosto de 2026en inglés
Un servidor MCP que expone tu base de datos a cualquier cliente sin escribir código
412 puntos · 96 comentarios en Hacker News.
Leer en Hacker News
Los papers
Investigación recién publicada. Denso, pero es donde se ve lo que viene.
-
arXiv · cs.CL5 de agosto de 2026en inglés
Los modelos citan mal las fuentes cuando el contexto pasa de 60k tokens
Miden la fidelidad de la cita según crece el contexto: se degrada mucho antes de lo que sugieren los benchmarks de recuperación.
Leer en arXiv · cs.CLQué significa
Este es el que más te afecta si montas RAG. Dice que la fidelidad de la cita se rompe bastante antes de que se rompa la recuperación: el modelo sigue encontrando el documento bueno, pero empieza a atribuir mal las frases. Los benchmarks habituales no lo ven porque miden si recupera, no si cita bien.
El tip: Añade una prueba tonta a tu sistema: mete un dato falso y único en un documento del fondo del contexto y pregunta por él. Si el modelo te lo devuelve atribuido a otro documento, ya sabes dónde está tu techo.
La prensa
Lo que se está contando fuera, y el ruido que hay que descontar.
-
Ars Technica5 de agosto de 2026en inglés
Las empresas medianas gastan más en tokens que en licencias de software
Una encuesta a 900 empresas encuentra que el gasto en inferencia ha superado por primera vez al de SaaS en la franja de 50 a 250 empleados.
Leer en Ars Technica