Qeravio
אירוע בינה קנוני

Llama.cpp מעודכן את נורמליזציה GDN כדי להתאים את l2norm של flash-linear-attention.

עדכון בינה מלאכותית llama.cpp תיקן את הבדלים בנורמליזציה של GDN ו-flash-linear-attention.

6 בספט׳ 20261 טענות מאומתות1 מקורות1 תצפיות
מה קרה

מקור רשמי דיווח על עדכון: b10829. צוות המשימה תיקן את נורמליזציה של GDN ממקס ל-rsqrt. בנוסף, צוות המשימה החל להשתמש בנורמליזציה של l2norm של flash-linear-attention עבור gated delta net q/k. נורמליזציה זו מוגדרת כ- l2norm(x) = x * rsqrt(sum(x*x) + eps) עם eps בתוך השורש. בכל אתר קורא של GDN בעץ משתמשים ב-ggml_l2_norm, אשר מוגדר כ- x / max(sqrt(sum(x*x)), eps), כלומר torch.nn.functional.normalize. כליפת הערך מעולם לא מתעוררת בגדלים אלה, ולכן בפועל llama.cpp מנורמל עם אפס אפסילון שם שיש אפסילון בתוך השורש.

למה זה חשוב

עדכון רשמי מדווח על התפתחות בנוגע ל-b10829: תיקון נורמליזציה של GDN ממקסימום לשורש ריבועי הפוך. משמעות הפעולה תלויה בטווח והראיות המובאות על ידי המקור.

מה כדאי לבדוק בהמשך

קראו את עדכון המקור הרשמי ווידאו את היקפו, הראיות והזמן הנקובים לפני שתפעילו אותו.

ידע מקושר

ישויות שמושפעות מהאירוע

שרשרת ראיות

המקורות שמאחורי האירוע