Qeravio
אירוע בינה קנוני

התמזגות גרעיני CUDA קיצרה את ההשקות ב-96 לכל דלף ב-Qwen3.8-27B.

שילוב RMS_NORM ו-SCALE קיצר את הפעלת הגרעין ב-96 פעמים למיקרו-בוט בחלקי Qwen3.8-27B. ביצועים שיפרו עד 4.8% בדק-מטפ' ספקולטיבי.

26 בספט׳ 20261 טענות מאומתות1 מקורות1 תצפיות
מה קרה

המקור הרשמי דיווח על עדכון: b11177: CUDA: איחוד RMS_NORM ו-SCALE לגרעין אחד. #28068 בונה את GDN q/k l2norm כ ggml_scale(ggml_rms_norm(x, eps/n), 1/sqrt(n)). זה מוסיף 2 נוגדי SCALE לכל שכבה GDN, 96 פתיחות גרעין נוספות לכל ubatch על Qwen3.8-27B (48 שכבות GDN). הגרעין הנוסף לא לוקח זמן GPU נמדד, אבל כל פתיחה גוררת עלות מארח/נהג. העלות קטנה בעיבוד בשורה פשוטה וכמעט 10 פעמים גדולה יותר בעיבוד דקודי מוקדם עם בינה מלאכותית.

למה זה חשוב

עדכון רשמי מדווח על התפתחות של b11177: CUDA: איחוד RMS_NORM ו-SCALE לגרעין אחד. משמעות הפיתוח תלויה בטווח והראיות שצוינו על ידי המקור.

מה כדאי לבדוק בהמשך

קראו את עדכון המקור הרשמי ווידאו את היקפו, הראיות והזמן לפני שתפעלו על פי זה.

ידע מקושר

ישויות שמושפעות מהאירוע

המשך בנושא
שרשרת ראיות

המקורות שמאחורי האירוע