Xorbits Inference (Xinference) ist eine leistungsfähige und vielseitige Bibliothek für Sprach-, Spracherkennungs- und multimodale Modelle. Mit Xorbits Inference können Sie Ihr eigenes Modell oder integrierte Spitzenmodelle mit nur einem Befehl bereitstellen und als Dienst veröffentlichen. Forschende, Entwickler und Data Scientists können so das Potenzial moderner KI-Modelle vollständig ausschöpfen.
- Xinference 3.0.0 ist mit Migrationshinweisen und Breaking Changes verfügbar: Versionshinweise
- Agent-native Bereitstellung: Xinference ist in Xagent integriert und ermöglicht dynamische Planung, Tool-Nutzung und eigenständige mehrstufige Inferenz, wodurch die Grenzen statischer Pipelines überwunden werden.
- Automatisches Batching: Mehrere gleichzeitige Anfragen werden automatisch gebündelt, was den Durchsatz deutlich erhöht.: #4197
- Xllamacpp: Neue Python-Bindings für llama.cpp, verwaltet vom Xinference-Team, unterstützen fortlaufendes Batching und sind produktionsfreundlicher.: #2997
- Verteilte Inferenz: Modelle können über Worker verteilt ausgeführt werden: #2877
- Verbesserungen für vLLM: Gemeinsame KV-Cache-Nutzung über mehrere Replikate: #2732
- Integrierte Unterstützung für TeleOCR: #5583
- Integrierte Unterstützung für die Ming-Image-Serie (Design, Design Layer): #5582
- Integrierte Unterstützung für Qwen-Image-2.1: #5571
- Integrierte Unterstützung für MinerU2.5: #5550
- Integrierte Unterstützung für die Spark-X2.5-Serie (1.7B, 4B, 1.7B Base, 4B Base): #5538
- Integrierte Unterstützung für die LingBot-World-V2-Serie (14B Fast, 14B Pretrain, 1.3B Fast): #5536
- Integrierte Unterstützung für die Irodori-TTS-v4.1-Serie (Anime, Small): #5527
- Integrierte Unterstützung für YuE2-3B: #5526
- Integrierte Unterstützung für die AuK-Serie (AuK, AuK-Flash): #5525
- Integrierte Unterstützung für MiniCPM5-2B: #5506
- Integrierte Unterstützung für die Fish-Audio-Serie (S1-mini, S2-Pro): #5490
- Integrierte Unterstützung für MonkeyOCR: #5475
- Integrierte Unterstützung für dots.ocr: #5468
- Integrierte Unterstützung für die JoyAI-Bildbearbeitungsserie (Edit, Edit Plus): #5458
- Xagent: Enterprise-Agentenplattform mit Planung, Speicher und Tool-Integration.
- Dify: LLMOps-Plattform zur schnellen Anwendungsentwicklung mit Visualisierung und Bedienoberfläche.
- FastGPT: LLM-basierte Knowledge-Plattform für Datenverarbeitung und Modellaufrufe.
- RAGFlow: Open-Source-RAG-Engine für tiefes Dokumentenverständnis.
- MaxKB: Open-Source-Wissensdatenbank-Assistent mit RAG-Integration.
🌟 Modell-Serving leicht gemacht: Vereinfachen Sie die Bereitstellung von LLMs, Spracherkennung und multimodalen Modellen. Tests und Produktionsmodelle lassen sich mit einem einzigen Befehl einrichten und deployen.
⚡️ State-of-the-art-Modelle einfach nutzbar: Probieren Sie integrierte Spitzenmodelle mit nur einem Befehl aus. Xinference bietet Zugang zu modernen Open-Source-Modellen.
🖥 Heterogene Hardware-Unterstützung: Nutzen Sie GPU und CPU effizient (z. B. über ggml), um Inferenz zu beschleunigen.
⚙️ Flexible APIs und Schnittstellen: OpenAI-kompatible RESTful API (inkl. Function Calling), RPC, CLI, Web UI und mehr.
🌐 Verteiltes Deployment: Einfache Verteilung von Inferenz über mehrere Geräte und Maschinen.
🔌 Third-Party-Integrationen: Nahtlose Integration mit LangChain, [LlamaIndex], [Dify], [Chatbox] u. a.
| Funktion | Xinference | FastChat | OpenLLM | RayLLM |
|---|---|---|---|---|
| OpenAI-kompatible RESTful API | ✅ | ✅ | ✅ | ✅ |
| vLLM-Integration | ✅ | ✅ | ✅ | ✅ |
| Verschiedene Inferenz-Engines (GGML, TensorRT) | ✅ | ❌ | ✅ | ✅ |
| Verschiedene Plattformen (CPU, Metal) | ✅ | ✅ | ❌ | ❌ |
| Multi-Node Cluster Deployment | ✅ | ❌ | ❌ | ✅ |
| Bildmodelle (Text→Bild) | ✅ | ✅ | ❌ | ❌ |
| Text-Embedding-Modelle | ✅ | ❌ | ❌ | ❌ |
| Multimodale Modelle | ✅ | ❌ | ❌ | ❌ |
| Sprachmodelle | ✅ | ❌ | ❌ | ❌ |
| OpenAI-Funktionalität (Function Calling) | ✅ | ❌ | ❌ | ❌ |
-
Self-Hosting Xinference Community Edition Folgen Sie dem Starter-Guide, um Xinference lokal zu starten. Details in der Dokumentation: https://inference.readthedocs.io/.
-
Xinference für Unternehmen Xinference Enterprise ist die kommerzielle Edition für Teams, die Modelle in Produktionsumgebungen betreiben. Sie können sie in Ihrer eigenen Cloud oder Ihrem Rechenzentrum bereitstellen oder eine verwaltete dedizierte Bereitstellung mit Xinference Cloud wählen. Die gehostete Model API bietet über eine OpenAI-kompatible API Zugriff auf unterstützte Modelle, ohne dass Sie die Inferenzinfrastruktur verwalten müssen. Mehr erfahren Sie unter xinference.co. Für Unternehmensanfragen kontaktieren Sie uns per E-Mail.
Sternen Sie Xinference auf GitHub, um Release-Updates zu erhalten.
NVIDIA-GPU-Benutzer können das Xinference Docker Image verwenden. Stellen Sie sicher, dass Docker und CUDA vor der Installation vorhanden sind.
docker run --name xinference -d -p 9997:9997 -e XINFERENCE_HOME=/data -v </on/your/host>:/data --gpus all xprobe/xinference:latest xinference-local -H 0.0.0.0Nach Aktivierung von GPU im Kubernetes-Cluster installieren Sie wie folgt:
# Repository hinzufügen
helm repo add xinference https://xorbitsai.github.io/xinference-helm-charts
# Index aktualisieren und Version prüfen
helm repo update xinference
helm search repo xinference/xinference --devel --versions
# Xinference installieren
helm install xinference xinference/xinference -n xinference --version 0.0.1-v<xinference_release_version>
Weitere K8s-Optionen finden Sie in der Dokumentation.
Installieren Sie Xinference per pip:
pip install "xinference[all]"Starten Sie eine lokale Instanz mit:
$ xinference-localAnschließend können Sie Web UI, cURL, CLI oder den Python-Client verwenden.
| Plattform | Zweck |
|---|---|
| Github Issues | Bug-Reports und Feature-Anfragen |
| Discord | Zusammenarbeit mit anderen Anwendern |
| Telegram | Diskussionen mit der Community |
| Neuigkeiten und Ankündigungen |
Wenn dieses Projekt hilfreich war, zitieren Sie bitte wie folgt:
@inproceedings{lu2024xinference,
title = "Xinference: Making Large Model Serving Easy",
author = "Lu, Weizheng and Xiong, Lingfeng and Zhang, Feng and Qin, Xuye and Chen, Yueguo",
booktitle = "Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing: System Demonstrations",
month = nov,
year = "2024",
address = "Miami, Florida, USA",
publisher = "Association for Computational Linguistics",
url = "https://aclanthology.org/2024.emnlp-demo.30",
pages = "291--300",
}

