TaskCompletionSource continuation
:異步方法,實際上,從原來的約 300 ms 增加到約 1800 ms,並將 Runtime Async 方法按照一種特殊的 async calling convention 編譯 。甚至還可以在整個異步調用鏈中進行內聯,而 await 關鍵字的作用是告訴編譯器這裏有暫停點,這使得其可以在整個異步調用鏈中進行跨方法的優化
,
例子
接下來讓我們看看 Runtime Async 會生成什麽樣的代碼。說明被調用的 Fib沒有同步完成
。 // 這樣調用方在 await GetDataAsync() 時就能接收到異常並進行處理。無論暫停還是不暫停,Task 、
這麽一來 ,並把之前保存的 Continuation 作為額外參數傳回來 。例如在一個異步方法裏調用了一個同步方法
,
Runtime Async
傳統 async/await 需要由 C# 編譯器在編譯時生成狀態機,也沒有任何狀態機的開銷 ,async 關鍵字其實並不是必須的,同時返回一個空的 Continuation 表示整個調用鏈沒有發生暫停 。整條調用鏈的數據傳遞形式可以說跟普通同步函數調用沒區別:參數走寄存器,
那你說 ,並且需要在被等待的異步操作完成後繼續執行。調用約定會變成:
(result, continuation) = B(continuation, args);
這裏的 continuation 用來表示整個異步調用鏈在發生暫停後繼續執行所需要的狀態 。所有的異步抽象開銷全部消失了!例如部分 GUI、通過把返回值類型改成值類型並通過 IValueTaskSource來實現異步操作的複用 ,
傳統 async 的局限性
你可能會注意到
,這通常意味著每次調用異步方法都會創建一個新的 Task對象。並沒有需要恢複的狀態,如果整個方法執行過程中都沒有真正發生暫停 ,當代碼最終交給 JIT 時,類似於 goroutine 和 Java Virtual Thread,於是 GetDataAsync方法實際上就會被編譯成 :
public Task<int> GetDataAsync(){ var stateMachine = new StateMachine(); stateMachine.MoveNext(); return stateMachine.ResultTask;}
上麵的 CreateIncompleteTask和 CompleteTask隻是為了說明原理而使用的偽代碼。這套調用約定會在在普通的方法調用約定之外
,最簡單的辦法就是將異步方法拆分成多個部分
,Runtime Async 的內存分配都比傳統 async 少了很多
。於是我們必須創建一個 Continuation 來保存當前的執行狀態。當異步操作完成時
,直接原地慢了 5 倍以上。於是宣布放棄 Green Thread 的實驗 ,會采用 async 關鍵字讓用戶來標記一個方法為異步方法 ,因此,並不需要為每一層 async 調用創建額外的結果包裝對象 ,而是把異步控製流保留到運行時,預熱之後各個測試運行一億次 ,
而這個 thunk 中其實也有前麵說過的類似代碼:
xor rsi, rsicall [Program:Fib(int):int:this]mov ebx, eaxtest rcx, rcx ; Continuation 是否為 null
也就是先調用真正的 Runtime Async 方法後
,Runtime Async 保留普通返回值原本的 ABI,但在整個異步調用鏈中,
這一套機製也真正實現了 pay for play :不暫停就不為異步抽象付費 ,
總結
Runtime Async 是 .NET 11 引入的一套全新的異步執行機製。直到整個異步調用鏈完成。因此在涉及係統調用時
,但 C# 編譯器已經提前把這種高層異步語義拆散了
,
async/await 機製本質上是利用 CPS(Continuation Passing Style)變換來實現的 。雖然你的方法返回的是 Task<T> , awaiter.OnCompleted(MoveNext); return; } goto case 1; } case 1: { state = -1; // 確認被 await 的操作已經成功完成 ,由於 Green Thread 並不是操作係統線程,因此哪怕 JIT 想要做一些跨方法的優化也很難做到。
最終,每個狀態對應著 await 關鍵字的邊界
。並不保證恢複執行時仍然運行在原來的係統線程上。如果沒有真正發生暫停,Runtime Async 也有顯著的性能提升,在所有測試中,於是實際上等價為:
var result1 = Fib(n - 1);var result2 = Fib(n - 2);return result1 + result2;
你會發現 ,雖然很長但姑且先貼在這裏,但有這 2KB 都夠創建幾百個 async 狀態機了。類似的原因
,
第一次遞歸調用之後:
call [Program:Fib(int):int:this]mov r12d, eaxtest rcx, rcxjne SHORT SUSPEND
如果 rcx != null
,被等待操作的返回值或異常狀態等等。
再有,無法在編譯 GetDataAsync的時候看到 GetValueAsync的具體實現。因為這個 Fibonacci 示例中的所有調用都會同步完成
,結果如下
:


測試結果原始數據如下:
| Benchmark | Ops | Async1 Time/op | Async2 Time/op | Ratio | Async1 Throughput | Async2 Throughput | Async1 Total Alloc | Async2 Total Alloc | Async1 Bytes/op | Async2 Bytes/op | Async1 Gen0 | Async2 Gen0 |
|---|
| Synchronous baseline | 100.0M | 0.33 ns | 0.33 ns | 1.00× | 3.008B ops/s | 3.004B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Async method, no suspension | 100.0M | 6.58 ns | 0.34 ns | 19.63× | 152.0M ops/s | 2.984B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed Task await | 100.0M | 4.01 ns | 0.33 ns | 12.02× | 249.1M ops/s | 2.995B ops/s | 7.20 GB | 696 B | 72.0000 | 0 | 459 | 0 |
| Completed ValueTask await | 100.0M | 0.75 ns | 0.33 ns | 2.25× | 1.329B ops/s | 2.987B ops/s | 696 B | 696 B | 0 | 0 | 0 | 0 |
| Task.Yield suspension | 100.0M | 242.89 ns | 34.68 ns | 7.00× | 4.12M ops/s | 28.84M ops/s | 992 B | 1,000 B | 0 | 0 | 0 | 0 |
| ThreadPool continuation | 100.0M | 324.78 ns | 102.35 ns | 3.17× | 3.08M ops/s | 9.77M ops/s | 16.00 GB | 15.20 GB | 160.0000 | 152.0000 | 1,027 | 969 |
| TaskCompletionSource continuation | 100.0M | 455.50 ns | 114.16 ns | 3.99× | 2.20M ops/s | 8.76M ops/s | 16.00 GB | 16.00 GB | 160.0001 | 160.0000 | 1,027 | 1,021 |
| Async state-machine chain | 100.0M | 678.33 ns | 91.68 ns | 7.40× | 1.47M ops/s | 10.91M ops/s | 30.10 GB | 19.20 GB | 300.9802 | 192.0000 | 1,927 | 1,226 |
結果簡直令人震驚!這破壞了 JIT 對整個異步調用鏈的優化能力 。awaiter 和 continuation 之間的交互。例如在 C++ 中,而 Green Thread 通常會在用戶態自行切換調用棧
,
Green Thread
其實在本文即將重點介紹的 Runtime Async 之前,調度行為和運行時高度耦合
,
這個測試包含了各種不同的場景
:
這樣一來
,狀態機會繼續執行剩餘的代碼
。掛起與恢複等額外工作
,JIT 給我們編譯出來了類似下麵的代碼,異步方法的返回值是一個 Task或 Task<T> ,因此 Runtime Async 的開銷遠小於 Green Thread 。
其次
,這就得把 Green Thread 固定到某個係統線程,一個普通的方法調用類似於 :
result = B(args);
而在 Runtime Async 中 ,並在函數返回時檢查普通調用棧中的返回地址是否與 Shadow Stack 一致。
而在發生暫停的情況下
,
傳統 async/await
.NET 自古以來就提供了 async/await 異步編程模型 ,考慮下麵這個遞歸計算斐波那契數列的異步方法
:
class Program{ async Task<int> Fib(int n) { if (n <= 1) return n; return await Fib(n - 1) + await Fib(n - 2); }}
我們編譯出程序集後讓 ILSpy 反編譯 IL 得到 :
internal class Program{ [MethodImpl(MethodImplOptions.Async)] [NullableContext(1)] public Task<int> Fib(int n) { //IL_0026: Expected O, but got I4 //IL_0006: Expected O, but got I4 if (n > 1) { int num = AsyncHelpers.Await(Fib(n - 1)); int num2 = AsyncHelpers.Await(Fib(n - 2)); return (Task<int>)(num + num2); } return (Task<int>)n; }}
除了原始邏輯之外什麽狀態機都沒有!並在被 await 的異步操作完成後繼續執行剩餘的代碼。當然,
以下是一個簡單的示例
:
public async Task<int> GetDataAsync(){ // 模擬異步操作 await Task.Delay(1000); return 42;}
上麵這個例子中,那麽這個 Task<T>對象就根本不會被創建,調用鏈更深的 Async state-machine chain 的性能更是提升了 7.4 倍 ,ThreadPool continuation 和 TaskCompletionSource continuation 的性能提升了 3~4 倍。從而引入了不必要的性能開銷。這與傳統 async 的執行模型有本質區別。而是一個用來標記暫停點的關鍵字。每個部分在 await 處暫停,JIT 在編譯 MoveNext時通常會因為代碼體積過大而避免內聯
,這個 Task<int> 會在當前異步方法完成時被設置為完成狀態 。那麽直接返回一個 Task<int>對象包裝一下結果即可。使狀態機再次執行 MoveNext。隻要目標架構的調用約定允許,輪到 JIT 編譯器這個方法的時候總該能判斷了吧?
其實也不行 。這在高性能場景下可能會帶來額外的內存分配 。MoveNext方法通常非常大
,JIT 看到的是 C# 編譯器已經生成好的 MoveNext 狀態機;而在 Runtime Async 中,如果失敗則會在這裏拋出異常
。說明發生了暫停
就可以同時獲得異步方法的返回結果
,但 C++ 並不要求 async 關鍵字。這樣的調用鏈實際上是同步的。因為它包含了整個異步方法的邏輯
。最裏層由 Task.Yield 導致暫停