Od redakcie: AI sa 24. augusta posúvala od modelov k infraštruktúre, agentom a suverenite
Denný prehľad 24. augusta: efektívnejšie video uvažovanie od Apple, nové smerovanie inferencie, spravovaný Ray na AWS aj veľká dohoda Mistralu o suverénnej AI.
Tag
Všetky publikované články, v ktorých sa téma multimodálne modely objavuje ako dôležitý kontext. Aktuálne 4 textov v archíve.
Denný prehľad 24. augusta: efektívnejšie video uvažovanie od Apple, nové smerovanie inferencie, spravovaný Ray na AWS aj veľká dohoda Mistralu o suverénnej AI.
Kompaktný model LFM2.5-VL-3B spája OCR, lokalizáciu objektov, porozumenie obrazovkám a volanie nástrojov. Je pripravený na lokálnu inferenciu vo viacerých formátoch, jeho výkonové výsledky však zatiaľ pochádzajú najmä od výrobcu a slovenčina nepatrí medzi výslovne podporované jazyky.
Nový preprint tvrdí, že multimodálne modely vedia priestorovo uvažovať spoľahlivejšie vtedy, keď si scénu preložia do kódu s kockami, guľami a valcami, než keď majú odpovedať priamo na zdanlivo jednoduché otázky o obraze.
Apple ukazuje, že pri titulkovaní obrázkov nestačí tlačiť len na dĺžku a detail. BalCapRL kombinuje viac cieľov naraz, aby multimodálne modely menej halucinovali a písali použiteľnejšie popisy.