המקור הרשמי דיווח על עדכון: b11177: CUDA: איחוד RMS_NORM ו-SCALE לגרעין אחד. #28068 בונה את GDN q/k l2norm כ ggml_scale(ggml_rms_norm(x, eps/n), 1/sqrt(n)). זה מוסיף 2 נוגדי SCALE לכל שכבה GDN, 96 פתיחות גרעין נוספות לכל ubatch על Qwen3.8-27B (48 שכבות GDN). הגרעין הנוסף לא לוקח זמן GPU נמדד, אבל כל פתיחה גוררת עלות מארח/נהג. העלות קטנה בעיבוד בשורה פשוטה וכמעט 10 פעמים גדולה יותר בעיבוד דקודי מוקדם עם בינה מלאכותית.
אירוע בינה קנוני
התמזגות גרעיני CUDA קיצרה את ההשקות ב-96 לכל דלף ב-Qwen3.8-27B.
שילוב RMS_NORM ו-SCALE קיצר את הפעלת הגרעין ב-96 פעמים למיקרו-בוט בחלקי Qwen3.8-27B. ביצועים שיפרו עד 4.8% בדק-מטפ' ספקולטיבי.
26 בספט׳ 20261 טענות מאומתות1 מקורות1 תצפיות
עדכון רשמי מדווח על התפתחות של b11177: CUDA: איחוד RMS_NORM ו-SCALE לגרעין אחד. משמעות הפיתוח תלויה בטווח והראיות שצוינו על ידי המקור.
קראו את עדכון המקור הרשמי ווידאו את היקפו, הראיות והזמן לפני שתפעלו על פי זה.
ידע מקושר
ישויות שמושפעות מהאירוע
המשך בנושא
עדכונים מאומתים קשורים
שרשרת ראיות
המקורות שמאחורי האירוע
הצגה מערכתית
פתיחת הכתבה