# Qwen en Gemini: hoe AI kiest wat het van je video bekijkt

AI kan videobeelden met vaste tussenpozen verwerken of gericht naar relevante fragmenten zoeken. De documentatie van Qwen en Gemini laat zien waarom een korte aanwijzing of ontbrekend geluid verschil kan maken voor je samenvatting.

- Canonieke URL: https://nxtnews.nl/artikel/qwen-en-gemini-hoe-ai-kiest-wat-het-van-je-video-bekijkt
- Gepubliceerd: 2026-09-20T23:02:37Z
- Rubriek: Tech
- Uitgever: Nxt

Door Annemiek ter Haar

![AI-illustratie van een vergrootglas dat één scène in een filmstrook uitlicht, met een afzonderlijke geluidsgolf eronder.](https://nxtnews.nl/web/images/nxt-a60735192be3ad1da539.jpg)

AI-illustratie · Nxt Generation News · Geen foto van de beschreven gebeurtenis.

Je laat een AI-assistent een lange uitlegvideo samenvatten. Heeft hij dan werkelijk alles bekeken? Dat hangt af van de manier waarop hij zoekt. Qwen beschreef op 18 september bij Qwen3.8-Omni-Flash hoe een assistent vanuit je vraag steeds gerichter beeld en geluid opzoekt. Zo hoeft hij niet ieder beeld te verwerken. Dat is nuttig als je één stap uit een les wilt terugvinden, maar een selectie is geen bewijs dat niets ontbreekt. De leverancier vermeldt ook Nederlandse spraakherkenning. Daarmee is nog niet aangetoond hoe goed een drukke Nederlandse of Vlaamse lesopname wordt begrepen.

Bronnen bij deze passage: [6. Qwen — oorspronkelijke uitleg, 18 september 2026](https://qwen.ai/blog?id=qwen3.8-omni-flash)

## Waarom kan een kort moment verdwijnen?

Bij een vaste steekproef krijgt het model slechts beelden met een bepaalde tussenruimte. Google beschrijft voor de gewone videoverwerking in de Gemini API standaard één beeld per seconde. Een API is de aansluiting waarmee een app een model gebruikt. Google waarschuwt dat snelle bewegingen en korte beeldwisselingen daardoor details kunnen verliezen. Stel dat een docent heel kort een verkeerde uitkomst aanwijst. Die aanwijzing kan tussen twee geselecteerde beelden vallen. Dezelfde documentatie beschrijft voor onder meer Gemini 3.8 Flash een zoekende stand: het model verkent de tijdlijn en past de beeldfrequentie en resolutie aan de vraag aan.

Bronnen bij deze passage: [2. Google — video begrijpen met Gemini](https://ai.google.dev/gemini-api/docs/video-understanding)

## Inzoomen helpt bij een andere beperking

Ook de grootte van een geselecteerd beeld telt mee. De Core-hulpmiddelen van Qwen halen videobeelden op met een automatisch gekozen resolutie en beeldfrequentie. Resolutie gaat over de hoeveelheid beeldpunten; beeldfrequentie over hoeveel beelden per seconde worden gekozen. Dat zijn verschillende instellingen. De gereedschappen kunnen daarnaast een los videobeeld bewaren en een deel van een afbeelding uitsnijden. Bij een rekenvoorbeeld op een schoolbord kun je zo gericht naar het stukje met de berekening kijken. Onze gevolgtrekking: vraag bij onduidelijke kleine tekst om dat fragment of die uitsnede. Alleen een vloeiende samenvatting geeft je geen zicht op het gebruikte beeld.

Bronnen bij deze passage: [3. Qwen — Core: beelden uit een video halen](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/core/cookbook/)

## Eerst zoeken in een inhoudsopgave

Qwens afzonderlijke Video Memory maakt een doorzoekbare beschrijving van een lange video. Die is geordend van een algemeen overzicht naar kleinere gebeurtenissen, met onder meer schermtekst en uitgeschreven spraak. Bij een vraag zoekt de assistent eerst een passend onderdeel, bekijkt de details en kan hij daarna het oorspronkelijke fragment controleren. Vergelijk het met een inhoudsopgave die je naar de juiste bladzijde helpt. De beschrijving helpt zoeken; het oorspronkelijke beeld blijft nodig wanneer een detail daarin onvoldoende duidelijk is.

Bronnen bij deze passage: [1. Qwen — Video Memory: zoeken en terugkijken](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/video-memory/cookbook/)

## Beeld en geluid zijn niet hetzelfde

De aparte uitbreiding Omni Memory verwerkt bij het opbouwen van zijn video-overzicht stukken van dertig seconden, met beeld én bijbehorend geluid. Volgens de handleiding koppelt het model uitspraken aan personen en legt het ook toon en omgevingsgeluid vast. Dat is een ontworpen werkwijze, geen garantie dat iedere spreker correct wordt herkend. Het verschil is praktisch: een docent kan iets aanwijzen terwijl iemand buiten beeld een vraag stelt. Losse plaatjes vertellen niet wie wat zei. De handleiding zegt expliciet dat Qwens gereedschap voor losse videobeelden het geluid weglaat. Omni Memory kan gevonden fragmenten juist opnieuw mét geluid laten onderzoeken.

Bronnen bij deze passage: [4. Qwen — Omni Memory: beeld en geluid samen](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/omni-memory/cookbook/)

## Een nette pdf kan toch iets missen

De Video2Note-uitbreiding laat zien waarom je ook de uitkomst moet controleren. Ze maakt lesnotities door eerst de video te analyseren, daarna tekst met tijdstippen te laten opstellen en daarbij beelden te verzamelen. De huidige instructies beschrijven geen afzonderlijke eindcontrole van de pdf door een model. Ook kan een eenvoudiger document verschijnen wanneer een deel van de verwerking mislukt; waarschuwingen moeten dan ontbrekende stukken melden. Voor je huiswerk betekent dat: bekijk zulke meldingen en leg een belangrijke uitleg naast het genoemde fragment. Mooie opmaak en een passende afbeelding bewijzen niet dat alle stappen uit de les zijn meegenomen.

Bronnen bij deze passage: [7. Qwen — Video2Note: grenzen van automatisch gemaakte lesnotities](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/omni-video2note/)

## Welke onderdelen gebruikt jouw assistent?

Qwen-MM-Plugins is een verzameling losse uitbreidingen voor AI-werkomgevingen, geen kant-en-klare schoolapp. De openbare projectbeschrijving maakt onderscheid tussen lokaal beelden uitlezen en een modeldienst aanroepen voor inhoudelijke verwerking. Voor de video-overzichten en lesnotities noemt ze aanvullende software en toegang tot zo’n dienst als vereisten. Welke onderdelen zijn geïnstalleerd, bepaalt dus mede wat een assistent met je bestand kan doen. Voor leerlingen en makers in Nederland en België is deze uitleg daarom geen aankondiging dat alle functies in hun eigen chatapp beschikbaar zijn. Controleer welke videofunctie die app werkelijk aanbiedt. Vraag vervolgens om concrete tijdstippen en bekijk beslissende passages zelf.

Bronnen bij deze passage: [5. Qwen — gereedschappen en afhankelijkheden](https://github.com/QwenLM/Qwen-MM-Plugins)

## In beeld

![Schema van Qwen Video Memory: vraag, index doorzoeken, details bekijken en zo nodig het oorspronkelijke fragment controleren.](https://nxtnews.nl/web/images/nxt-video-selectie-499c839fb0e351713fd6.png)

Illustratie · De video-index helpt een fragment terug te vinden. De laatste stap is controle in de bron.

Credit: Schema: Nxt Generation News · met code getekend

[Beeldbron](https://nxtnews.nl/colofon)

## Bronnen

- [1. Qwen — Video Memory: zoeken en terugkijken](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/video-memory/cookbook/)
- [2. Google — video begrijpen met Gemini](https://ai.google.dev/gemini-api/docs/video-understanding)
- [3. Qwen — Core: beelden uit een video halen](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/core/cookbook/)
- [4. Qwen — Omni Memory: beeld en geluid samen](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/omni-memory/cookbook/)
- [5. Qwen — gereedschappen en afhankelijkheden](https://github.com/QwenLM/Qwen-MM-Plugins)
- [6. Qwen — oorspronkelijke uitleg, 18 september 2026](https://qwen.ai/blog?id=qwen3.8-omni-flash)
- [7. Qwen — Video2Note: grenzen van automatisch gemaakte lesnotities](https://qwenlm.github.io/qwen-mm-plugins-hub/plugins/omni-video2note/)

[Bronnen en werkwijze](https://nxtnews.nl/bronnen#werkwijze)
