CodingBox Q&A Ask question

Brocade 200e, Proxmox ile FreeNAS arasında: tüm portlar online iken Buffer I/O error ve isp0: Receive Error

Asked Active Viewed 153 AI translation from Русский
5

Küçük bir sanallaştırma ortamı işletiyorum: iki adet Proxmox 6 node'u ve FreeNAS 11.2 üzerinde bir target. HBA'lar target'a doğrudan bağlıyken, aylarca tek bir hata olmadan çalıştı. Kabloları çapraz çekmemek için aralarına ikinci el bir Brocade 200e koydum ve başladı.

  • iki Proxmox 6 node'u, HBA olarak QLogic QLE2462 ve QLE2432
  • target: FreeNAS 11.2
  • switch: Brocade 200e, Fabric OS 6.1.0a
  • eski stoktan SFP'ler ve LC patch kordonlar, üzerinde işaret yok

Node'lardaki log'da:

Buffer I/O error on dev dm-5

ve ardından cihazın sürekli sıfırlanması. Target tarafında - komutlarda (CTIO7) firmware timeout'ları, yaklaşık dakikada bir de:

isp0: Receive Error

Bundan sonra target iki initiator'dan da anında düşüyor ve bu sadece node'un yeniden başlatılmasıyla geçiyor.

Şimdiye kadar yaptığım:

  • doğrudan bağlantıya geri döndüm - hiç hata yok, yani HBA'lar, diskler ve target'ın kendisi suçlu değil
  • switchshow üç portun da online olduğunu gösteriyor, zoning minimal, tek bir zone
  • patch kordonları yeniden taktım, switch'i yeniden başlattım

Switch'in kendisinde nereye bakmalıyım? switchshow'daki online beni açıkça yanıltıyor ama bunu neyle kontrol edeceğimi henüz bilmiyorum.

Comments 4

Accepted answer

Sen zaten her şeyi kendin buldun: artan crc_err ve enc_out, hat üzerindeki frame bozulması demek, stack'te ilerledikçe bu firmware timeout'larına, cihaz sıfırlanmalarına ve isp0: Receive Error'a dönüşüyor. Ne node'lardaki kernel ne de target burada suçlu, ikisi de kendilerine ne geldiyse onu dürüstçe anlatıyor.

Senin zaten topladıkların şöyle okunuyor:

  • sayaçları sıfırlayıp yük altında baktın, yani switch açıldığından beri birikmiş toplamı değil artış hızını gördün. Ve sıçramalar node'lardaki Buffer I/O error ile çakıştı - fabric hatalarını disklerin gördüğüyle bağlayan da bu
  • aynı uzunluktaki kordonlarla aynı iki portta sfpshow'daki düşük alım seviyesi - bu kafadan uydurulmuş bir normla değil, simetrik link'lerin birbiriyle karşılaştırılması. Üçüncü, temiz port da sende referans görevi görüyor

Geriye pek bir şey kalmıyor. fabriclog -s çalıştır - switchshow o anda online çizse bile portların nasıl kesilip bağlandığı orada görünür. Ve şüpheli portlarda SFP'yi LC patch kordonlarla birlikte değiştir, ayrı ayrı değil. Bende benzer bir hikaye tam da böyle bitti: iki sorunlu portta modül ve kordon değişimi, sonrasında porterrshow yük altında bir gün boyunca sıfırda kaldı ve fabric bir daha dağılmadı.

Mantık basit: doğrudan bağlantıda hat üzerinde iki konnektör var, switch üzerinden - dört, artı iki fazla modül. Doğrudan bağlantıyı zar zor çeken, gücü sınırda bir SFP ya da tozlu bir kordon, böyle bir hattı artık çekemiyor. Yani switchshow'daki online bir teşhis değil, sadece bir login gerçeği.

4 Russialambdaops44RU Show original (Русский) AI translation

switchshow tam olarak bir şey söylüyor: port ışığı gördü ve fabric'e login oldu. Sinyal kalitesi hakkında hiçbir şey bilmiyor, o yüzden böyle bir durumda ona inanmak anlamsız.

Üç portun hepsinde portstatsclear yap, yük bindir, sonra porterrshow'a bak - ilgilendiğimiz crc_err ve enc_out, artıyorlar mı ve tam olarak hangi portlarda. Aynı zamanda her port için sfpshow: alım gücü ve voltaj, bunları portlar arasında karşılaştırmakta fayda var. Bir de target düştüğü anda FreeNAS tarafında sysctl dev.isp.0'ın ne verdiğini göster.

0 KazakhstanlinkguruKZ Show original (Русский) AI translation

Sayaçları temizledim, yük verdim, baktım. Tablo şöyle: iki portta crc_err ve enc_out paketler halinde artıyor, hem de tam olarak node'larda Buffer I/O error yağdığı anlarda, üçüncü portta ise sıfırda.

Aynı iki portta sfpshow, aynı uzunluktaki kordonlarla komşu porta göre belirgin şekilde daha düşük bir alım gösteriyor. Düşme anında sysctl dev.isp.0, HBA'nın yeniden initialize olduğunu gösteriyor, yani o bir kopmayı yaratmıyor, ona tepki veriyor. Görünen o ki bu Proxmox ya da target değil, fizik.

3 KazakhstannetopsKZ Show original (Русский) AI translation

Benzer bir tuzak FC dışında da oluyor, o yüzden sayaçlara her durumda bakmakta fayda var. Bir Intel X520-2 ile 850 nm'de 10Gtek SR modülleri ve FCX-2XG modülüyle Brocade FastIron CX 648S-PoE ile brokad XFP'ler kombinasyonu vardı, aralarında beş metre fiber.

Sunucu 10GbE'yi dürüstçe kaldırıyor ve gönderiyordu, alım ise hiç yoktu, switch'teki port de None hızıyla Up asılı kalıyordu. show media'ya baktık, iki taraftaki dalga boyu ve menzili karşılaştırdık, porttaki trunk negotiation'ı kapattık - hiçbiri bir sonuç vermedi, XFP'de hızı sabitleyemezsin. Aynı fiber SFP+ portlarda gigabit'te sorunsuz koşuyordu. Ahlaki ders tam olarak seninkiyle aynı: porttaki Up, frame'lerin ulaştığı anlamına gelmiyor.

3 Ukrainecoaxeng7UA Show original (Русский) AI translation
Log in to comment. Log in