Shieldstral: 3B open-weights model pro multimodální moderaci obsahu od Mistralu
Mistral vydal Shieldstral, 3B otevřený model pro bezpečnostní klasifikaci textu a obrázků, který pracuje jako dotazovací systém přijímající politiky v přirozeném jazyce bez potřeby přetrénování. Model dosahuje výkonu srovnatelného s modely 7x větší velikosti a lze ho spustit na jednotné GPU, přičemž je dostupný pod licencí Apache 2.0.
Jak se Shieldstral liší od tradičních modelů pro moderaci obsahu?
Shieldstral přijímá politiky moderace jako text v přirozeném jazyce při inference, což umožňuje adaptaci na různé kontexty bez nutnosti přetrénování. Tradiční modely mají pevně zakódované kategorie škod v trénovacích vahách, takže změna cílového nasazení vyžaduje nové trénování.
Jaký hardware je potřebný pro spuštění Shieldstral?
Model se dá spustit na jediné 16GB NVIDIA GPU. Jeho velikost 3 miliardy parametrů jej činí výpočetně efektivním ve srovnání s většími modely pro moderaci.
Jak se Shieldstral naučil rozlišovat různé bezpečnostní politiky?
Model byl trénován na umělých kontrastních párech, které LLM vytvořila speciálně tak, aby porušovaly jednu politiku, ale ne její podobnou variantu. To učí model rozlišovat přesné hranice různých politik místo pouhého memorování.
- LFM2.5-2.6B malý a dostatečně chytrý AI lokální model — liquid.ai 75 % shoda
- Mysl mimozemšťana: Hlavní vědec OpenAI v nové eseji říká, že jsme vytvořili intelekt, kterému doopravdy nerozumíme — openai.com 74 % shoda
- Inženýrství harnessů pro sebezdokonalování agentů — lilianweng.github.io 72 % shoda
- Mistral3
- Shieldstral
- NVIDIA8
- Open Secure AI Alliance
- Forge
- Hugging Face12