✦AI ROCKSTARSAI solutions made in Berlin Erstgespräch ↗

Gemini 3 Flash: Agentic Vision revolutioniert Bildanalyse

Gemini 3 Flash: Agentic Vision revolutioniert Bildanalyse

Google führt mit Gemini 3 Flash das sogenannte „Agentic Vision“ ein, wodurch das Modell Bilder nicht mehr nur statisch betrachtet, sondern mittels Python-Code aktiv untersucht. Durch diesen neuen „Think-Act-Observe“-Loop kann die KI visuelle Details selbstständig verifizieren, was die Genauigkeit in Benchmarks messbar steigert. Wir analysieren, wie diese Architekturänderung technisch funktioniert und wo das Modell trotz der Code-Execution an seine Grenzen stößt.

Weiterlesen

Qwen2.5-VL-32B: Alibabas KI-Innovation in der visuellen Datenverarbeitung

Qwen2.5-VL-32B

Alibaba Cloud hat mit Qwen2.5-VL-32B ein leistungsstarkes visuell-sprachliches KI-Modell vorgestellt, das bei hoher Effizienz herausragende Ergebnisse in der Bildverarbeitung erzielt. Die neue Version übertrifft in mehreren Benchmarks sogar ihr größeres 72-Milliarden-Parameter-Pendant und repräsentiert einen bedeutenden Fortschritt im Bereich der multimodalen künstlichen Intelligenz.

Weiterlesen