Benötige ich spezielle Software oder Tools, um den Kurs erfolgreich abzuschließen?

<text variant="body1">Für die Teilnahme an diesem Kurs und allen praktischen Übungen ist lediglich ein moderner Webbrowser erforderlich. Sie erhalten kostenlosen Zugang zu Cloud-basierten Umgebungen, um die Übungen durchzuführen.

Was bekomme ich, wenn ich dieses Zertifikat abonniere?

Wenn Sie sich für den Kurs anmelden, erhalten Sie Zugang zu allen Kursen des Zertifikats, und Sie erhalten ein Zertifikat, wenn Sie die Arbeit abgeschlossen haben. Ihr elektronisches Zertifikat wird zu Ihrer Seite "Leistungen" hinzugefügt - von dort aus können Sie Ihr Zertifikat ausdrucken oder zu Ihrem LinkedIn-Profil hinzufügen.

Generative AI Erweiterte Feinabstimmung für LLMs

Sparen Sie mit 40% Rabatt auf 3 Monate Coursera Plus bei den Fähigkeiten, die Sie zum Strahlen bringen. Jetzt sparen

Generative AI Erweiterte Feinabstimmung für LLMs

Dieser Kurs ist Teil mehrerer Programme.

Dozenten: Joseph Santarcangelo

22.850 bereits angemeldet

Bei enthalten

Mehr erfahren

2 Module

Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.

130 Bewertungen

Stufe Mittel

Empfohlene Erfahrung

9 Stunden zu vervollständigen

Flexibler Zeitplan

In Ihrem eigenen Lerntempo lernen

2 Module

Verschaffen Sie sich einen Einblick in ein Thema und lernen Sie die Grundlagen.

130 Bewertungen

Stufe Mittel

Empfohlene Erfahrung

9 Stunden zu vervollständigen

Flexibler Zeitplan

In Ihrem eigenen Lerntempo lernen

Was Sie lernen werden

Gefragt sind generative KI-Engineering-Fähigkeiten zur Feinabstimmung von LLMs, die von Arbeitgebern aktiv gesucht werden
Anweisungsabstimmung und Belohnungsmodellierung unter Verwendung von Hugging Face, sowie Verständnis von LLMs als Richtlinien und Anwendung von RLHF-Techniken
Direkte Präferenzoptimierung (DPO) mit Partitionsfunktion und Hugging Face, einschließlich der Definition optimaler Lösungen für DPO-Probleme
Proximale Politikoptimierung (PPO) mit Hugging Face zur Erstellung von Bewertungsfunktionen und Tokenisierung von Datensätzen für die Feinabstimmung

Kompetenzen, die Sie erwerben

Kategorie: Modell-Optimierung
Kategorie: Feinabstimmung
Kategorie: Generative Modellarchitekturen
Kategorie: Methoden des maschinellen Lernens
Kategorie: Reinforcement Learning
Kategorie: Modell Ausbildung
Kategorie: Bewertung des Modells
Kategorie: Modellierung großer Sprachen

Werkzeuge, die Sie lernen werden

Kategorie: Generative KI

Wichtige Details

Zertifikat zur Vorlage

Zu Ihrem LinkedIn-Profil hinzufügen

Bewertungen

5 Aufgaben

Unterrichtet in Englisch

Erfahren Sie, wie Mitarbeiter führender Unternehmen gefragte Kompetenzen erwerben.

Weitere Informationen zu Coursera für Unternehmen

Logos von Petrobras, TATA, Danone, Capgemini, P&G und L'Oreal

Erweitern Sie Ihre Fachkenntnisse

Dieser Kurs ist als Teil verfügbar

Wenn Sie sich für diesen Kurs anmelden, müssen Sie auch ein bestimmtes Programm auswählen.

Lernen Sie neue Konzepte von Branchenexperten
Gewinnen Sie ein Grundverständnis bestimmter Themen oder Tools
Erwerben Sie berufsrelevante Kompetenzen durch praktische Projekte
Erwerben Sie ein Berufszertifikat zur Vorlage

In diesem Kurs gibt es 2 Module

"Die Feinabstimmung großer Sprachmodelle (Large Language Models, LLMs) ist unerlässlich, um sie auf spezifische Geschäftsanforderungen abzustimmen, die Genauigkeit zu verbessern und die Leistung zu optimieren. In der heutigen KI-gesteuerten Welt sind Unternehmen auf fein abgestimmte Modelle angewiesen, um präzise, umsetzbare Erkenntnisse zu generieren, die Innovation und Effizienz fördern. Dieser Kurs stattet angehende KI-Ingenieure mit den gefragten Fähigkeiten aus, die Arbeitgeber aktiv suchen. Sie werden fortgeschrittene Feinabstimmungstechniken für kausale LLMs erforschen, einschließlich Instruktionsabstimmung, Belohnungsmodellierung und direkte Präferenzoptimierung. Sie erfahren, wie LLMs als probabilistische Richtlinien für die Generierung von Antworten fungieren und wie sie mit Hilfe von Tools wie Hugging Face an menschliche Präferenzen angepasst werden können. Sie werden in die Belohnungsberechnung, das Verstärkungslernen aus menschlichem Feedback (RLHF), die proximale Policy-Optimierung (PPO), den PPO-Trainer und optimale Strategien für die direkte Präferenzoptimierung (DPO) eintauchen. Die praktischen Übungen in diesem Kurs vermitteln Ihnen praktische Erfahrungen mit der Abstimmung von Instruktionen, der Belohnungsmodellierung, der PPO und der DPO und geben Ihnen die Werkzeuge an die Hand, mit denen Sie LLMs für hochwirksame Anwendungen selbstbewusst feinabstimmen können. Erwerben Sie in nur zwei Wochen berufsreife generative KI-Fähigkeiten! Melden Sie sich noch heute an und bringen Sie Ihre Karriere in der KI voran!"

In diesem Modul werden Sie fortgeschrittene Techniken zur Feinabstimmung großer Sprachmodelle (LLMs) durch Instruktionsabstimmung und Belohnungsmodellierung erkunden. Sie beginnen mit der Definition der Befehlsabstimmung und lernen den Prozess kennen, einschließlich des Ladens von Datensätzen, Texterzeugungspipelines und Trainingsargumenten mit Hugging Face. Anschließend tauchen Sie in die Belohnungsmodellierung ein, wo Sie Datensätze vorverarbeiten, Low-Rank-Adaptation (LoRA)-Konfigurationen anwenden und Qualitätsreaktionen quantifizieren, um die Modelloptimierung zu steuern und mit menschlichen Präferenzen in Einklang zu bringen. Sie werden auch Reward-Trainer und Reward-Modell-Verlustfunktionen beschreiben und anwenden. Darüber hinaus werden Sie in den praktischen Übungen Ihre Kenntnisse durch praktische Erfahrungen mit der Abstimmung von Anweisungen und der Belohnungsmodellierung vertiefen und so in die Lage versetzt, LLMs für bestimmte Aufgaben effektiv anzupassen.

Das ist alles enthalten

6 Videos4 Lektüren2 Aufgaben2 App-Elemente3 Plug-ins

6 VideosInsgesamt 36 Minuten

Einführung in den Kurs3 Minuten
Grundlagen des Instruktionstunings7 Minuten
Instruktions-Tuning mit umarmendem Gesicht7 Minuten
Belohnungsmodellierung: Auswertung der Antworten5 Minuten
Belohnungsmodell Training7 Minuten
Belohnungsmodellierung mit umarmendem Gesicht8 Minuten

4 LektürenInsgesamt 18 Minuten

Überblick über den Kurs3 Minuten
Übersicht über die Spezialisierung10 Minuten
Bewährte Praktiken für das Instruction-Tuning großer Sprachmodelle3 Minuten
Zusammenfassung und Highlights2 Minuten

2 AufgabenInsgesamt 30 Minuten

Praxis-Quiz: Instruktionsabstimmung und Belohnungsmodellierung9 Minuten
Verschiedene Ansätze zur Unterrichtsabstimmung21 Minuten

2 App-ElementeInsgesamt 150 Minuten

Anweisung Feinabstimmung LLMs90 Minuten
Labor: Modellierung von Belohnungen60 Minuten

3 Plug-insInsgesamt 35 Minuten

Hilfreiche Tipps für den Kursabschluss5 Minuten
Anweisung Tuning15 Minuten
Belohnungsmodellierung und Reaktionsbewertung15 Minuten

In diesem Modul erforschen Sie fortgeschrittene Techniken zur Feinabstimmung großer Sprachmodelle (LLMs) unter Verwendung von Reinforcement Learning from Human Feedback (RLHF), Proximal Policy Optimization (PPO) und Direct Preference Optimization (DPO). Sie werden zunächst beschreiben, wie LLMs als probabilistische Verteilungen funktionieren und wie diese in Richtlinien umgewandelt werden können, um Antworten auf der Grundlage von Eingabetext zu generieren. Sie werden die Beziehung zwischen Richtlinien und Sprachmodellen als Funktion von Parametern, wie z.B. Omega, untersuchen und wie Belohnungen unter Verwendung menschlichen Feedbacks berechnet werden können. Dazu gehören das Trainieren von Antwortmustern, die Bewertung der Leistung von Agenten und die Definition von Bewertungsfunktionen für Aufgaben wie die Analyse von Gefühlen mit PPO. Sie werden auch in der Lage sein, die PPO-Konfiguration, Lernraten und die Rolle des PPO-Trainers bei der Optimierung von Chatbot-Antworten mit Hugging Face-Tools zu erklären. Das Modul stellt außerdem DPO vor, eine direktere und effizientere Methode zur Anpassung von Modellen an menschliche Präferenzen. Obwohl komplexe Themen wie PPO und Reinforcement Learning vorgestellt werden, wird von Ihnen nicht erwartet, dass Sie sie in diesem Kurs in der Tiefe verstehen. In den praktischen Übungen in diesem Modul können Sie die Anwendung von RLHF und DPO üben. Zur Unterstützung Ihres Lernens sind ein Spickzettel und ein Glossar zum schnellen Nachschlagen enthalten.

Das ist alles enthalten

10 Videos5 Lektüren3 Aufgaben2 App-Elemente4 Plug-ins

10 VideosInsgesamt 59 Minuten

Große Sprachmodelle (LLMs) als Verteilungen7 Minuten
Von Verteilungen zu Policen4 Minuten
Verstärkungslernen aus menschlichem Feedback (RLHF)8 Minuten
Proximale Optimierung der Politik (PPO)5 Minuten
PPO mit Umarmungsgesicht4 Minuten
PPO-Trainer6 Minuten
DPO: Teilungsfunktion6 Minuten
DPO: Optimale Lösung8 Minuten
Von der Optimalen Politik zum DPO6 Minuten
DPO mit Umarmungsgesicht5 Minuten

5 LektürenInsgesamt 18 Minuten

Zusammenfassung und Highlights4 Minuten
Zusammenfassung und Highlights3 Minuten
Kurs Schlussfolgerung6 Minuten
Glückwünsche und nächste Schritte3 Minuten
Danke vom Kursteam2 Minuten

3 AufgabenInsgesamt 61 Minuten

Praxis-Quiz: Proximale Optimierung der Politik (PPO)21 Minuten
Praxis-Quiz: Direkte Präferenz-Optimierung (DPO)10 Minuten
Feinabstimmung kausaler LLMs mit menschlichem Feedback und direkter Präferenz30 Minuten

2 App-ElementeInsgesamt 75 Minuten

Übung: Verstärkungslernen aus menschlichem Feedback mit PPO30 Minuten
Labor: Direkte Präferenz-Optimierung (DPO) mit Hugging Face45 Minuten

4 Plug-insInsgesamt 60 Minuten

Trick mit der Logarithmusableitung15 Minuten
Feinabstimmung von LLMs vor Ort mit InstructLab15 Minuten
Spickzettel: Generative AI Fortgeschrittene Feinabstimmung für LLMs15 Minuten
Glossar: Generative KI - Fortschrittliche Feinabstimmung für LLMs15 Minuten

Erwerben Sie ein Karrierezertifikat.

Fügen Sie dieses Zeugnis Ihrem LinkedIn-Profil, Lebenslauf oder CV hinzu. Teilen Sie sie in Social Media und in Ihrer Leistungsbeurteilung.

Dozenten

Lehrkraftbewertungen

(16 Bewertungen)

Joseph Santarcangelo

IBM

37 Kurse2.458.702 Lernende

von

IBM

Mehr von Maschinelles Lernen entdecken

Status: Kostenloser Testzeitraum
Simplilearn
LLM Fine-Tuning and Customization Training
Kurs
Status: Kostenloser Testzeitraum
Packt
Building and Fine-Tuning LLM Applications
Kurs
Status: Kostenloser Testzeitraum
Edureka
Fine-Tuning & Optimizing Large Language Models
Kurs
Status: Kostenloser Testzeitraum
Coursera
Harnessing LLMs: Strategy, Fine-Tuning & Evaluation
Spezialisierung

Warum entscheiden sich Menschen für Coursera für ihre Karriere?

Felipe M.

Lernender seit 2018

„Es ist eine großartige Erfahrung, in meinem eigenen Tempo zu lernen. Ich kann lernen, wenn ich Zeit und Nerven dazu habe.“

Jennifer J.

Lernender seit 2020

„Bei einem spannenden neuen Projekt konnte ich die neuen Kenntnisse und Kompetenzen aus den Kursen direkt bei der Arbeit anwenden.“

Larry W.

Lernender seit 2021

„Wenn mir Kurse zu Themen fehlen, die meine Universität nicht anbietet, ist Coursera mit die beste Alternative.“

Chaitanya A.

„Man lernt nicht nur, um bei der Arbeit besser zu werden. Es geht noch um viel mehr. Bei Coursera kann ich ohne Grenzen lernen.“

Bewertungen von Lernenden

5 stars
75 %
4 stars
8,33 %
3 stars
3,78 %
2 stars
4,54 %
1 star
8,33 %

Zeigt 3 von 130 an

Geprüft am 20. Aug. 2025

An excellent course with a wealth of high-quality material, featuring highly informative lessons such as DPO and PPO.

Geprüft am 10. März 2025

Great course, love the deep-rooted content. All my concepts are so clear now. Kudos!!

Geprüft am 29. Apr. 2026

Good course starts with origins of LLM and brings you up to date with DPO

Weitere Bewertungen anzeigen

Häufig gestellte Fragen

Der Kurs dauert etwa 3-5 Stunden, so dass Sie innerhalb von nur zwei Wochen über die Fähigkeiten verfügen, die Sie brauchen, um einen Arbeitgeber zu beeindrucken!

Dieser Kurs ist auf mittlerem Niveau angesiedelt. Um den größtmöglichen Lernerfolg zu erzielen, müssen Sie über Grundkenntnisse in Python, großen Sprachmodellen (LLMs), Verstärkungslernen und Befehlsabstimmung verfügen. Sie sollten auch mit Konzepten des maschinellen Lernens und neuronaler Netze vertraut sein.

Dieser Kurs ist Teil der Spezialisierung Generative AI Engineering mit LLMs. Wenn Sie die Spezialisierung abschließen, haben Sie die Fähigkeiten und das Selbstvertrauen, um Berufsrollen wie KI-Ingenieur, Datenwissenschaftler, Ingenieur für maschinelles Lernen, Deep-Learning-Ingenieur, KI-Ingenieur und Entwickler, die mit LLMs arbeiten wollen, zu übernehmen.

Um Zugang zu den Kursmaterialien und Aufgaben zu erhalten und um ein Zertifikat zu erwerben, müssen Sie die Zertifikatserfahrung erwerben, wenn Sie sich für einen Kurs anmelden. Sie können stattdessen eine kostenlose Testversion ausprobieren oder finanzielle Unterstützung beantragen. Der Kurs kann stattdessen die Option "Vollständiger Kurs, kein Zertifikat" anbieten. Mit dieser Option können Sie alle Kursmaterialien einsehen, die erforderlichen Bewertungen abgeben und eine Abschlussnote erhalten. Dies bedeutet auch, dass Sie kein Zertifikat erwerben können.