
A
Автор
Anubhab Banerjee
1 матеріал
Towards Data Science

Автор
1 матеріал
Towards Data Science

Дослідження показує, що спільне використання GPU LLM-агентами на Kubernetes за допомогою time-slicing може призвести до прихованого погіршення p99 затримки для чутливих до затримки робочих навантажень, попри те, що Kubernetes повідомляє про справність усіх подів.