ForHosting KIT · Búsqueda semántica y RAG

Pregunte a sus documentos

Pregúntele a un modelo de propósito general sobre su manual interno de políticas y adivinará o se negará a responder: nunca vio ese documento. Este endpoint responde a partir de los documentos que usted le entrega, cita los pasajes que usó, y guarda silencio en lugar de inventar una respuesta cuando su material no cubre la pregunta.

● EstablePor solicitud + por consulta$0.003
Úselo desde WebAPIEmailApp prontoTelegram pronto

Ejecute esto en nuestros servidores con su cuenta. Las herramientas gratuitas corren en su navegador; esta cobra de su saldo del KIT según el precio de arriba.

El vacío que cierra

Los modelos de lenguaje genéricos se entrenan con texto público hasta una fecha de corte y no saben nada de su manual de producto, su wiki interna, sus plantillas de contrato ni la actualización de política de la semana pasada. Los equipos que necesitan respuestas precisas sobre su propio material, agentes de soporte, herramientas internas, chat de cara al cliente, o mantienen una búsqueda por palabras clave frágil, o aceptan respuestas que suenan seguras pero están silenciosamente equivocadas. La generación aumentada por recuperación existe justamente para cerrar ese vacío: responde a partir de sus documentos, no de lo que el modelo memorizó durante el entrenamiento.

Qué ocurre entre la pregunta y la respuesta

Envía una pregunta junto con una referencia a su conjunto de documentos indexado, y la tarea corre de forma asíncrona, devolviendo un task_id de inmediato. Detrás de escena recupera los pasajes más relevantes para la pregunta, y luego redacta una respuesta anclada específicamente en ese texto recuperado, incluyendo los pasajes de origen para que la respuesta sea verificable en lugar de una caja negra. El resultado llega mediante su webhook firmado, o un enlace firmado válido por 24 horas si prefiere consultarlo usted mismo.

Por qué el anclaje importa más que la fluidez

El término generación aumentada por recuperación se acuñó en un artículo de investigación de 2020, pero la idea de fondo es más antigua y más simple: una respuesta solo es confiable en la medida del material en que se basa, y una frase fluida sin fuente vale menos que una más corta que pueda verificar. Este enfoque trata la recuperación como el paso principal, encontrar primero los pasajes correctos, y la generación como el paso siguiente que escribe una respuesta estrictamente a partir de lo encontrado, por eso un sistema RAG bien construido dirá que no lo sabe en lugar de inventar cuando los documentos guardan silencio sobre una pregunta.

Dónde encaja en un sistema real

Esto se conecta típicamente detrás de un widget de chat de soporte, una barra de búsqueda interna, o una API que responde preguntas de clientes a partir de una base de conocimiento, documentación de producto o biblioteca de políticas. Como el precio es por solicitud más por consulta, una herramienta de soporte que responde mil preguntas de clientes al día tiene un costo que puede pronosticar en lugar de una factura abierta, y un intento de respuesta que falla se reintenta automáticamente y nunca se cobra, así que los fallos pasajeros no se convierten en gasto perdido.

Lo que no hace

No responderá con confianza desde conocimiento general cuando sus documentos no cubran el tema, es una restricción deliberada, no una limitación, porque una respuesta equivocada dicha con seguridad es peor que ninguna respuesta. También depende por completo de la calidad de los documentos que proporcione: los vacíos, contradicciones o material desactualizado en su conjunto de origen se reflejarán como vacíos, contradicciones o respuestas desactualizadas, así que la precisión del resultado es un reflejo directo de lo que le proporcione.

Chatbot de atención al cliente

Una empresa de software responde preguntas de clientes a partir de la documentación de su centro de ayuda, y cada respuesta cita el artículo específico del que proviene, en lugar de adivinar funciones que no existen.

Preguntas y respuestas de políticas internas

Un equipo de recursos humanos permite que los empleados pregunten en lenguaje sencillo sobre el manual de beneficios y recibe respuestas ancladas en el texto de política vigente, no en la memoria institucional desactualizada.

Consulta de contratos y cumplimiento

Un equipo legal consulta una biblioteca de contratos firmados para saber qué cláusulas aplican a un proveedor específico, y la respuesta cita el pasaje exacto del contrato del que proviene.

Asistente de documentación de producto

Una herramienta para desarrolladores integra esto detrás de su buscador de documentación, así los usuarios obtienen una respuesta directa a 'cómo configuro X' en lugar de una lista de páginas relacionadas que deben leer por su cuenta.

¿Qué es una API RAG y en qué se diferencia de un chatbot?

Una API RAG responde estrictamente a partir de los documentos que usted proporciona, recuperando primero los pasajes relevantes y luego redactando una respuesta anclada en ellos, en lugar de depender solo del conocimiento general de su entrenamiento.

¿Inventará una respuesta si mis documentos no cubren la pregunta?

No, ese es el propósito del anclaje: cuando los documentos recuperados no abordan la pregunta, la respuesta refleja eso en lugar de inventar contenido que suene creíble.

¿Existe un plan gratuito para rag.answer?

No hay capa gratuita: las capas gratis se abusan y ralentizan a todos. El acceso funciona con un saldo prepago de ForHosting KIT: se recarga desde $10.00 (no caduca) y cada solicitud se cobra a su precio publicado, así que una llamada sin saldo devuelve HTTP 402. Sin suscripción, sin tokens ni créditos inventados, y una tarea fallida no se cobra.

¿Cuánto cuesta la API RAG por consulta?

Es de $0.003 por solicitud más $0.015 por consulta, lo que le da un costo predecible por pregunta para presupuestar una herramienta de soporte o de preguntas internas.

¿Las respuestas incluyen citas o fuentes?

Sí, las respuestas se entregan junto con los pasajes de origen en los que se basaron, así que cada respuesta se puede verificar contra el documento original.

¿Qué tan actualizada está la información de las respuestas?

Tan actualizada como los documentos que haya indexado; el endpoint responde a partir de su material proporcionado, no de una fecha de corte fija de entrenamiento, así que mantener su conjunto de documentos al día mantiene las respuestas actualizadas.

¿Cómo recibo la respuesta?

La llamada devuelve un task_id de inmediato, y la respuesta con sus fuentes se entrega mediante webhook firmado o un enlace firmado válido por 24 horas.

¿Puedo usarlo para un volumen alto de preguntas de clientes?

Sí, está construido para ese caso de uso; el precio por consulta hace sencillo pronosticar el costo de una herramienta de soporte que responde cientos o miles de preguntas al día.

Todo lo de esta página está disponible por programación. Esta sección es para equipos que quieren integrarlo en sus sistemas; el resto puede usar la herramienta de arriba sin más.

POSThttps://api.kit.forhosting.com/rag/answer

¿Prefiere automatizarlo? Un POST autenticado crea la tarea; el resultado llega por webhook o enlace firmado. La misma capacidad también se ejecuta aquí en la web, y pronto desde nuestra app, el email y Telegram.

curl -X POST https://api.kit.forhosting.com/rag/answer \
  -H "Authorization: Bearer $KIT_KEY" \
  -H "Content-Type: application/json" \
  -d '{"input":"…"}'
{
  "input": "…"
}
{
  "task_id": "tsk_a1b2c3d4e5f6a1b2c3d4e5f6",
  "type": "rag.answer",
  "status": "queued",
  "_links": {
    "result": "/tasks/tsk_…/result"
  }
}

La API es asíncrona: la llamada devuelve un task_id al instante y el resultado llega por webhook. El polling está limitado a 1 req/s por tarea.

Por solicitud$0.003
Por consulta$0.015

Precio publicado — sin tokens ni créditos inventados. Una tarea fallida no se cobra.

max_chunks10000
max_tokens20000
HTTPCódigoSignificado
401unauthorizedAPI key ausente o inválida.
402insufficient_balanceEl saldo no cubre el precio de la tarea.
404unknown_typeEl tipo de tarea no existe.
429rate_limitedDemasiadas peticiones. Use el webhook en vez de sondear.
422task_failedLa tarea falló tras 3 reintentos. No se cobra.

Ver la documentación completa del KIT →