Usé Colaboratory para ajustar Setence BERT y guardar ese modelo. Luego fui local y construí un entorno con Docker que incluía jupyter y FastAPI, y en ese entorno pude confirmar que el modelo que guardé con Jupyter, lanzado en Docker, arrojó los mismos resultados de estimación que en Collaboratory. Cuando usé ese modelo, obtuve resultados diferentes cuando usé FastAPI iniciado en el mismo entorno de Docker que Jupyter. Todo el texto ingresado en este flujo es el mismo.
El análisis mostró que SentenceTransformer cargó el modelo y luego lo codificó, y descubrió que calculaba incrustaciones completamente diferentes.
Gracias a tu consejo.
lo siento, uso el modelo japonés pero olvidé traducir el BertTokenizer predeterminado a BertJapaneseTokenizer.
Cambiar tokenizador predeterminado solucionó este problema.