Mycel
Qué puede hacer

RAG en tu propia máquina, con los números encima de la mesa

RAG significa recuperar los fragmentos relevantes de tus documentos y dárselos al modelo antes de que responda. La idea se explica en una frase; lo que decide si te sirve son los detalles: qué formatos entran, cuántos documentos aguanta un índice, dónde se guarda y qué hace falta tener instalado. Aquí están.

Ficha técnica

RamaQué puede hacer
Qué haceCómo funciona el RAG de Mycel por dentro: formatos que entran, troceado, embeddings, dónde se guarda el índice y los topes reales por índice.
Pasos para ponerlo en marcha4
Requisitos3
Entrega3
Actualizado6 de agosto de 2026
01

Qué entra en el índice, con la lista exacta

Se indexan PDF, txt, md, csv, tsv, json, jsonl, html, xml, log y rst. Y una ausencia que conviene leer dos veces porque sorprende a todo el mundo: los .docx y los .xlsx NO entran en el índice. El agente sí sabe abrirlos y extraerles el texto cuando trabaja con ellos en una tarea, pero el indexador de RAG no los recorre. Si tu fondo es Word, hay que convertirlo antes.

De un PDF entra el texto que el propio PDF lleva dentro. Un escaneado es una foto por dentro y no aporta nada, así que un archivo histórico digitalizado necesita pasar antes por OCR. El indexador también descarta los ficheros de los que no logra sacar ni un mínimo de texto.

02

El proceso, paso a paso, y sus topes

El Nodo recorre la carpeta y sus subcarpetas hasta un máximo de 800 ficheros. De cada uno extrae el texto y lo trocea en fragmentos, con un tope de 6.000 fragmentos por índice. Después calcula los vectores en lotes y guarda todo (fragmentos y vectores) en un único fichero JSON dentro de la propia carpeta indexada, en el subdirectorio .mycel_rag. Cuando algún tope corta, el resultado lo dice.

Al consultar, se calcula el vector de la pregunta y se ordenan los fragmentos por similitud coseno. Se devuelven los mejores (cinco por defecto, hasta doce si lo pides) y si ni el primero llega al umbral mínimo, la respuesta es que no hay nada relevante en ese índice, no un fragmento cualquiera para rellenar.

Que el índice viva dentro de la carpeta tiene una consecuencia cómoda: si mueves la carpeta, el índice se va con ella; si la borras, desaparece. No hay un servicio aparte donde queden copias de tus documentos.

03

Un índice por materia, no uno gigante

Los topes no son solo una cuestión de memoria. Un índice que mezcla la normativa interna, el catálogo y cinco años de actas devuelve fragmentos de todo para cualquier pregunta, y el modelo responde peor con más material delante. Varios índices por materia, cada uno con su nombre, dan respuestas más precisas y se reconstruyen en menos tiempo.

Los índices se nombran al crearlos y se eligen al consultar. Un asistente publicado usa el suyo propio dentro de la carpeta que le señalaste; un índice creado por el agente sobre el workspace usa el nombre por defecto. Reindexar es volver a lanzar el proceso, y también se puede dejar programado o disparado al aparecer un fichero nuevo en la carpeta.

Pantalla Sesiones de Mycel con una tarea terminada: las herramientas usadas una a una y, al lado, los ficheros entregados con su vista previa.
Una tarea real: el agente declara el entregable, ejecuta sus herramientas una a una y deja los ficheros listos para descargar.

Cómo se pone en marcha

  1. 1

    Agrupas los documentos por materia en carpetas, no todo en un montón.

  2. 2

    Compruebas que hay un modelo de embeddings disponible en el Nodo.

  3. 3

    Lanzas el indexado y lees el recuento: ficheros, fragmentos y si hubo corte.

  4. 4

    Consultas, y reindexas cuando el fondo cambie o lo dejas programado.

Dónde ocurre cada cosa

  1. Tu equipo

    Hace el encargo

  2. Tu Nodo

    Pone el cómputo

  3. La red

    Aporta el conocimiento

Preguntas frecuentes

¿De verdad no indexa Word ni Excel?
No, hoy no: la lista de extensiones del indexador no los incluye. Es la limitación que más sorprende, y por eso está escrita aquí en vez de en una nota al pie. El agente sí extrae su texto cuando trabaja con ellos en una tarea; lo que no hace es meterlos en el índice semántico.
¿Qué pasa si no tengo modelo de embeddings?
No se construye el índice y el Nodo te lo dice con instrucciones concretas para instalarlo, en vez de devolver un índice vacío que fallaría más tarde y sin motivo aparente.
¿Se puede indexar una carpeta de red o un disco compartido?
Mientras el Nodo la vea como una carpeta del sistema y esté dentro de lo que tiene concedido, sí. Ten en cuenta que el índice se escribe dentro de esa misma carpeta, así que hace falta permiso de escritura.
¿Cuánto tarda?
Depende del número de fragmentos y de la velocidad del modelo de embeddings; los vectores se calculan por lotes. Un fondo de unos cientos de documentos es cuestión de minutos en una máquina normal, y solo se hace cuando el fondo cambia.

Pruébalo con tus propios documentos

Creas la cuenta, abres el Nodo y le encargas la primera tarea. Es gratis e ilimitado: el cómputo lo pone tu equipo, así que no hay nada que racionar.