RAG en tu propia máquina, con los números encima de la mesa
RAG significa recuperar los fragmentos relevantes de tus documentos y dárselos al modelo antes de que responda. La idea se explica en una frase; lo que decide si te sirve son los detalles: qué formatos entran, cuántos documentos aguanta un índice, dónde se guarda y qué hace falta tener instalado. Aquí están.
Ficha técnica
| Rama | Qué puede hacer |
|---|---|
| Qué hace | Cómo funciona el RAG de Mycel por dentro: formatos que entran, troceado, embeddings, dónde se guarda el índice y los topes reales por índice. |
| Pasos para ponerlo en marcha | 4 |
| Requisitos | 3 |
| Entrega | 3 |
| Actualizado | 6 de agosto de 2026 |
Qué entra en el índice, con la lista exacta
Se indexan PDF, txt, md, csv, tsv, json, jsonl, html, xml, log y rst. Y una ausencia que conviene leer dos veces porque sorprende a todo el mundo: los .docx y los .xlsx NO entran en el índice. El agente sí sabe abrirlos y extraerles el texto cuando trabaja con ellos en una tarea, pero el indexador de RAG no los recorre. Si tu fondo es Word, hay que convertirlo antes.
De un PDF entra el texto que el propio PDF lleva dentro. Un escaneado es una foto por dentro y no aporta nada, así que un archivo histórico digitalizado necesita pasar antes por OCR. El indexador también descarta los ficheros de los que no logra sacar ni un mínimo de texto.
El proceso, paso a paso, y sus topes
El Nodo recorre la carpeta y sus subcarpetas hasta un máximo de 800 ficheros. De cada uno extrae el texto y lo trocea en fragmentos, con un tope de 6.000 fragmentos por índice. Después calcula los vectores en lotes y guarda todo (fragmentos y vectores) en un único fichero JSON dentro de la propia carpeta indexada, en el subdirectorio .mycel_rag. Cuando algún tope corta, el resultado lo dice.
Al consultar, se calcula el vector de la pregunta y se ordenan los fragmentos por similitud coseno. Se devuelven los mejores (cinco por defecto, hasta doce si lo pides) y si ni el primero llega al umbral mínimo, la respuesta es que no hay nada relevante en ese índice, no un fragmento cualquiera para rellenar.
Que el índice viva dentro de la carpeta tiene una consecuencia cómoda: si mueves la carpeta, el índice se va con ella; si la borras, desaparece. No hay un servicio aparte donde queden copias de tus documentos.
Un índice por materia, no uno gigante
Los topes no son solo una cuestión de memoria. Un índice que mezcla la normativa interna, el catálogo y cinco años de actas devuelve fragmentos de todo para cualquier pregunta, y el modelo responde peor con más material delante. Varios índices por materia, cada uno con su nombre, dan respuestas más precisas y se reconstruyen en menos tiempo.
Los índices se nombran al crearlos y se eligen al consultar. Un asistente publicado usa el suyo propio dentro de la carpeta que le señalaste; un índice creado por el agente sobre el workspace usa el nombre por defecto. Reindexar es volver a lanzar el proceso, y también se puede dejar programado o disparado al aparecer un fichero nuevo en la carpeta.

Cómo se pone en marcha
- 1
Agrupas los documentos por materia en carpetas, no todo en un montón.
- 2
Compruebas que hay un modelo de embeddings disponible en el Nodo.
- 3
Lanzas el indexado y lees el recuento: ficheros, fragmentos y si hubo corte.
- 4
Consultas, y reindexas cuando el fondo cambie o lo dejas programado.
Dónde ocurre cada cosa
Tu equipo
Hace el encargo
Tu Nodo
Pone el cómputo
La red
Aporta el conocimiento
Preguntas frecuentes
- ¿De verdad no indexa Word ni Excel?
- No, hoy no: la lista de extensiones del indexador no los incluye. Es la limitación que más sorprende, y por eso está escrita aquí en vez de en una nota al pie. El agente sí extrae su texto cuando trabaja con ellos en una tarea; lo que no hace es meterlos en el índice semántico.
- ¿Qué pasa si no tengo modelo de embeddings?
- No se construye el índice y el Nodo te lo dice con instrucciones concretas para instalarlo, en vez de devolver un índice vacío que fallaría más tarde y sin motivo aparente.
- ¿Se puede indexar una carpeta de red o un disco compartido?
- Mientras el Nodo la vea como una carpeta del sistema y esté dentro de lo que tiene concedido, sí. Ten en cuenta que el índice se escribe dentro de esa misma carpeta, así que hace falta permiso de escritura.
- ¿Cuánto tarda?
- Depende del número de fragmentos y de la velocidad del modelo de embeddings; los vectores se calculan por lotes. Un fondo de unos cientos de documentos es cuestión de minutos en una máquina normal, y solo se hace cuando el fondo cambia.
Pruébalo con tus propios documentos
Creas la cuenta, abres el Nodo y le encargas la primera tarea. Es gratis e ilimitado: el cómputo lo pone tu equipo, así que no hay nada que racionar.