Dokumentationerreichbar
Meta, Llama Guard, Modellkarte
huggingface.co (externe Seite)
Die Modellkarte zu einem Sprachmodell, dessen einzige Aufgabe die Einstufung von Eingaben und Antworten ist. Sie legt die Mechanik offen: Das Modell liefert eine Wahrscheinlichkeit, und wer es einsetzt, wählt selbst die Schwelle, ab der etwas als unsicher gilt. Die Gewichte stehen hinter einer Anmeldung. Der Kartentext selbst wird frei ausgeliefert.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
Llama-Guard is a 7B parameter Llama 2-based input-output safeguard model.
bestätigt 24.09.2026It can be used for classifying content in both LLM inputs (prompt classification) and in LLM responses (response classification).
bestätigt 24.09.2026Model users can then make binary decisions by applying a desired threshold to the probability scores.
bestätigt 24.09.2026