<!-- mobian-agent-page publisher="dailydev" canonical="https://daily.dev/posts/apple-announces-mm1-advancements-in-multimodal-ai-with-30b-parameters-fgxulzwaf" -->

---
title: Apple Announces MM1: Advancements in Multimodal AI with...
description: Apple has unveiled MM1, a set of multimodal LLMs designed for image captioning, answering visual questions, and natural language inference. MM1 supports up to...
canonical: https://daily.dev/posts/apple-announces-mm1-advancements-in-multimodal-ai-with-30b-parameters-fgxulzwaf
twitter:card: summary_large_image
twitter:site: @dailydotdev
og:type: website
og:site_name: daily.dev
og:title: Apple Announces MM1: Advancements in Multimodal AI with 30B Parameters | daily.dev
og:description: Apple has unveiled MM1, a set of multimodal LLMs designed for image captioning, answering visual questions, and natural language inference. MM1 supports up to...
og:url: https://daily.dev/posts/apple-announces-mm1-advancements-in-multimodal-ai-with-30b-parameters-fgxulzwaf
og:image: https://api.daily.dev/og/posts/FgXuLzWaF.png
og:image:alt: Apple Announces MM1: Advancements in Multimodal AI with 30B Parameters
og:image:width: 1200
og:image:height: 630
og:locale: en
---

> ## Documentation Index
> Fetch the complete documentation index at: https://daily.dev/llms.txt
> Use this file to discover all available pages before exploring further.

# Apple Announces MM1: Advancements in Multimodal AI with 30B Parameters

**[Collections](https://daily.dev/sources/collections)** · 1 min read · 2 upvotes · 0 comments

## Summary

Apple has unveiled MM1, a set of multimodal LLMs designed for image captioning, answering visual questions, and natural language inference. MM1 supports up to 30 billion parameters and shows competitive performance in supervised fine-tuning on multimodal benchmarks. The study highlights the importance of diverse pre-training data and emphasizes transparency and detailed documentation.

## Content

Apple has quietly revealed MM1, a set of multimodal LLMs designed for captioning images, answering visual questions, and natural language inference. MM1 supports up to 30 billion parameters and shows competitive performance in supervised fine-tuning on multimodal benchmarks. This family of multimodal LLMs, announced by Apple, has the potential to set new standards in multimodal understanding. The study highlights the importance of diverse pre-training data in model performance and emphasizes the significance of transparency and detailed documentation in advancing MLLM development. Apple researchers have made significant insights into building highly capable systems that combine vision and language understanding. Their findings, including the importance of image resolution, encoder size, data mixing strategies, and intentional architecture, contribute to the advancements in multimodal AI research. The MM1 model, scaled up to 30B parameters, achieved state-of-the-art few-shot results. While it demonstrates superior performance across benchmarks, there are limitations and questions that need to be addressed for further advancements in multimodal AI research.

## Similar posts on daily.dev

- [Don’t just attend KubeCon \+ CloudNativeCon, Merge Forward your experience\!](https://daily.dev/posts/don-t-just-attend-kubecon-cloudnativecon-merge-forward-your-experience--l0rpp73x8) · CNCF · 1 upvotes · 0 comments
- [Announcing H2 2026 KCDs](https://daily.dev/posts/announcing-h2-2026-kcds-m96goajm1) · CNCF · 1 upvotes · 0 comments
- [Two months of Open Community Groups](https://daily.dev/posts/two-months-of-open-community-groups-asf52zhbs) · CNCF · 0 upvotes · 0 comments
- [CNCF Unveils Schedule for KubeCon \+ CloudNativeCon Europe 2026](https://daily.dev/posts/cncf-unveils-schedule-for-kubecon-cloudnativecon-europe-2026-ikhcoa5cb) · CNCF · 2 upvotes · 0 comments
- [CNCF Debuts KubeCon \+ CloudNativeCon Japan 2026 Schedule](https://daily.dev/posts/cncf-debuts-kubecon-cloudnativecon-japan-2026-schedule-xp5pyudub) · CNCF · 1 upvotes · 0 comments

---

Tags: [#ai](https://daily.dev/tags/ai), [#apple](https://daily.dev/tags/apple), [#llm](https://daily.dev/tags/llm), [#multimodal](https://daily.dev/tags/multimodal)

[View this post on daily.dev](https://daily.dev/posts/apple-announces-mm1-advancements-in-multimodal-ai-with-30b-parameters-fgxulzwaf)

```json
{"@context":"https://schema.org","@graph":[{"@type":"Organization","@id":"https://daily.dev/#organization","name":"daily.dev","url":"https://daily.dev","logo":{"@type":"ImageObject","url":"https://daily.dev/apple-touch-icon.png","width":180,"height":180},"sameAs":["https://twitter.com/dailydotdev","https://github.com/dailydotdev","https://www.linkedin.com/company/daily-dev-ltd"]},{"@type":"WebSite","@id":"https://daily.dev/#website","url":"https://daily.dev","name":"daily.dev","publisher":{"@id":"https://daily.dev/#organization"},"potentialAction":{"@type":"SearchAction","target":{"@type":"EntryPoint","urlTemplate":"https://daily.dev/search?q={search_term_string}"},"query-input":"required name=search_term_string"}}]}
{"@context":"https://schema.org","@type":"TechArticle","headline":"Apple Announces MM1: Advancements in Multimodal AI with 30B Parameters","url":"https://daily.dev/posts/apple-announces-mm1-advancements-in-multimodal-ai-with-30b-parameters-fgxulzwaf","mainEntityOfPage":{"@type":"WebPage","@id":"https://daily.dev/posts/apple-announces-mm1-advancements-in-multimodal-ai-with-30b-parameters-fgxulzwaf"},"datePublished":"2024-03-17T00:04:13.481Z","dateModified":"2024-03-18T10:47:46.645Z","description":"Apple has unveiled MM1, a set of multimodal LLMs designed for image captioning, answering visual questions, and natural language inference. MM1 supports up to...","image":"https://media.daily.dev/image/upload/f_auto,q_auto/v1/posts/18590c20cb9011959e44824130591c0f?_a=AQAEufR","thumbnailUrl":"https://media.daily.dev/image/upload/f_auto,q_auto/v1/posts/18590c20cb9011959e44824130591c0f?_a=AQAEufR","isAccessibleForFree":true,"articleSection":"Collections","inLanguage":"en","publisher":{"@type":"Organization","name":"daily.dev","url":"https://daily.dev","logo":{"@type":"ImageObject","url":"https://daily.dev/apple-touch-icon.png","width":180,"height":180}},"author":{"@type":"Organization","name":"Collections","logo":"https://media.daily.dev/image/upload/s--fk_6ycEi--/f_auto,q_auto/v1780996001/logos/collections?_a=BAMAMiWQ0","url":"https://daily.dev/sources/collections"},"commentCount":0,"discussionUrl":"https://daily.dev/posts/apple-announces-mm1-advancements-in-multimodal-ai-with-30b-parameters-fgxulzwaf","interactionStatistic":[{"@type":"InteractionCounter","interactionType":{"@type":"LikeAction"},"userInteractionCount":2},{"@type":"InteractionCounter","interactionType":{"@type":"CommentAction"},"userInteractionCount":0}],"keywords":"ai,apple,llm,multimodal","timeRequired":"PT1M"}
{"@context":"https://schema.org","@type":"BreadcrumbList","itemListElement":[{"@type":"ListItem","position":1,"name":"Home","item":"https://daily.dev"},{"@type":"ListItem","position":2,"name":"Collections","item":"https://daily.dev/sources/collections"},{"@type":"ListItem","position":3,"name":"Apple Announces MM1: Advancements in Multimodal AI with 30B Parameters"}]}
```

