Qeravio
אירוע בינה קנוני

הפעלת CUDA sparse-fa לדסב"ד 4 הושבתה מחדש, לולאת השאלה נפתחה.

עדכון CUDA ל-dsv4 קוצר את זמן הסריקה ל-17 מיקרושניות ב-49 אלף עמודים.

24 בספט׳ 20261 טענות מאומתות1 מקורות1 תצפיות
מה קרה

המקור הרשמי דיווח על עדכון: b11140: CUDA: אפשרו sparse-fa עבור dsv4 prefill (שוב). CUDA: אפשרו sparse-fa עבור dsv4 prefill (שוב) (#29298). CUDA: אפשרו sparse-fa עבור dsv4 prefill (שוב). CUDA: פיתחו את לולאת השאילתות של הסריקה מסכת הספארס. לולאת השאילתות של flash_attn_mask_to_sparse_indices מחזיקה מספר סיבובים בזמן ריצה, שמגביל את הסריקה הפתוחה על ערכי נתיב מאפשרת טעינה משותפת. תבניתו את הגרעין על ncols1 כך שהלולאה מוגבלת בזמן הקומפילציה: דקוד של דקוד אחד מתקומפל לקוד ישר, והסריקה יורדת מ-46 ל-17 מיקרושניות ב-49 אלף עמודים בצורות דקוד ספארס.

למה זה חשוב

עדכון רשמי מדווח על התפתחות בנוגע ל-b11140: CUDA: הפעלת sparse-fa עבור dsv4 prefill (שוב). משמעות הפיתוח תלויה בטווח והראיות שצוינו על ידי המקור.

מה כדאי לבדוק בהמשך

קראו את עדכון המקור הרשמי ולאמת את היקף, הראיות והזמן המפורטים לפני שתפעילו אותו.

ידע מקושר

ישויות שמושפעות מהאירוע

המשך בנושא
שרשרת ראיות

המקורות שמאחורי האירוע