Minigpt-4
minigpt-4.github.io · 316 words · saved by 1 readers
Minigpt-4
Enhancing Vision-language Understanding with Advanced Large Language Models ▶ King Abdullah University of Science and Technology *Equal Contribution Abstract The recent GPT-4 has demonstrated extraordinary multi-modal abilities, such as directly generating websites from handwritten text and identifying humorous elements within images. These features are rarely observed in previous vision-language models. We believe the primary reason for GPT-4's advanced multi-modal generation capabilities lies in the utilization of a more advanced large language model (LLM). To examine this phenomenon,…
saved by
related reading
- GPT-4openai.com
- gpt-4.pdfcdn.openai.com
- [2301.13823] Grounding Language Models to Images for Multimodal Generationarxiv.org
- 2403.09611.pdfarxiv.org
- An Image is Worth One Word: Personalizing Text-to-Image Generation using Textual Inversiontextual-inversion.github.io
- google/diffusiongemma-26B-A4B-it · Hugging Facehuggingface.co
- Replicate - Run AI with an APIreplicate.com
- [2005.14165] Language Models are Few-Shot Learnersarxiv.org
- 2303.08774.pdfarxiv.org
- MMHal Bencharxiv.org
- Scaling Autoregressive Multi-Modal Models: Pretraining and Instruction Tuning | Researchai.meta.com
- cs.unc.edu/~mbansal/teaching/nlp-comp790-590-spring23.htmlcs.unc.edu