El 9 de octubre de 2026, Cohere publicó una entrada de blog en la que describe dos formas de ejecutar sus modelos embed y rerank. Los usuarios pueden optar por la inferencia compartida, en la que varios clientes utilizan los mismos recursos de cómputo, o por la inferencia dedicada, en la que un solo cliente cuenta con su propio hardware. La publicación detalla las ventajas y desventajas de cada opción en cuanto a costo y rendimiento. Esto ayuda a los desarrolladores a decidir qué configuración se ajusta mejor a su carga de trabajo.
Por qué importa
Elegir el modo de inferencia adecuado permite a los desarrolladores equilibrar el costo y la velocidad en sus aplicaciones de búsqueda o recomendación.