Thanks Bernd, I will give it a go, for some reason I thought that this --index parameter didn&#39;t work in lustre.<br><br><div class="gmail_quote">On 22 October 2010 19:05, Bernd Schubert <span dir="ltr">&lt;<a href="mailto:bernd.schubert@fastmail.fm">bernd.schubert@fastmail.fm</a>&gt;</span> wrote:<br>
<blockquote class="gmail_quote" style="margin: 0pt 0pt 0pt 0.8ex; border-left: 1px solid rgb(204, 204, 204); padding-left: 1ex;">Er no, mkfs.lustre --index=${the_right_index}.<br>
<br>
<br>
Cheers,<br>
<font color="#888888">Bernd<br>
</font><div><div></div><div class="h5"><br>
On Friday, October 22, 2010, Wojciech Turek wrote:<br>
&gt; Ok, but this means that new OST will come up with a new index (next<br>
&gt; available). Maybe this is a stupid question, but how MDS will know that<br>
&gt; the missing files are residing now on a new OST?<br>
&gt;<br>
&gt; On 22 October 2010 18:52, Bernd Schubert &lt;<a href="mailto:bernd.schubert@fastmail.fm">bernd.schubert@fastmail.fm</a>&gt; wrote:<br>
&gt; &gt; Hmm, I would probably format a small fake device on a ramdisk and copy<br>
&gt; &gt; files<br>
&gt; &gt; over, run tunefs --writeconf /mdt and then start everything (inlcuding<br>
&gt; &gt; all OSTs) again.<br>
&gt; &gt;<br>
&gt; &gt;<br>
&gt; &gt; Cheers,<br>
&gt; &gt;<br>
&gt; &gt; On Friday, October 22, 2010, Wojciech Turek wrote:<br>
&gt; &gt; &gt; I have tried Bernd&#39;s suggestion and it seem to have worked, after<br>
&gt; &gt; &gt; running e2fsck -D ll_recover_lost_found_objs didn&#39;t cause kernel panic<br>
&gt; &gt; &gt; but moved<br>
&gt; &gt;<br>
&gt; &gt; a<br>
&gt; &gt;<br>
&gt; &gt; &gt; number of objects to O directory. Problem is that I do not have<br>
&gt; &gt; &gt; last_rcvd file so the OST has no index at the moment. What would be<br>
&gt; &gt; &gt; the next step<br>
&gt; &gt;<br>
&gt; &gt; to<br>
&gt; &gt;<br>
&gt; &gt; &gt; enable access to those files in the filesystem?<br>
&gt; &gt; &gt;<br>
&gt; &gt; &gt; Best regards,<br>
&gt; &gt; &gt;<br>
&gt; &gt; &gt; Wojciech<br>
&gt; &gt; &gt;<br>
&gt; &gt; &gt; On 22 October 2010 17:15, Andreas Dilger &lt;<a href="mailto:andreas.dilger@oracle.com">andreas.dilger@oracle.com</a>&gt;<br>
&gt; &gt;<br>
&gt; &gt; wrote:<br>
&gt; &gt; &gt; &gt; On 2010-10-22, at 5:42, Bernd Schubert &lt;<a href="mailto:bernd.schubert@fastmail.fm">bernd.schubert@fastmail.fm</a>&gt;<br>
&gt; &gt;<br>
&gt; &gt; wrote:<br>
&gt; &gt; &gt; &gt; &gt; Hmm, e2fsck didn&#39;t catch that? rec_len is the length of a directory<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; entry, so<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt; after how many bytes the next entry follows.<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; I agree that e2fsck should have caught that.<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt; You can try to force e2fsck to do<br>
&gt; &gt; &gt; &gt; &gt; something about that: e2fsck -D<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; No, I would recommend against using -D at this point. That will cause<br>
&gt; &gt;<br>
&gt; &gt; it<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; to re-write the directory contents, and given that the filesystem was<br>
&gt; &gt; &gt; &gt; previously corrupted I would prefer making as few changes as possible<br>
&gt; &gt; &gt; &gt; before the data is estranged.<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; Wojciech,<br>
&gt; &gt; &gt; &gt; note that if you are able to mount the filesystem you could just copy<br>
&gt; &gt;<br>
&gt; &gt; all<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; of the objects (with xattrs!) from lost+found on the bad filesystem,<br>
&gt; &gt; &gt; &gt; along with the last_rcvd file (if you can find it) into a new ldiskfs<br>
&gt; &gt; &gt; &gt; filesystem and then run ll_recover_lost_found_objs on that.<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt; On Friday, October 22, 2010, Wojciech Turek wrote:<br>
&gt; &gt; &gt; &gt; &gt;&gt; Ok, removing and recreating the journal fixed that problem and I<br>
&gt; &gt; &gt; &gt; &gt;&gt; am able<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; to<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; mount device as ldiskfs filesystem. Now I hit another wall when<br>
&gt; &gt;<br>
&gt; &gt; trying<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; to<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; run ll_recover_lost_found_objs<br>
&gt; &gt; &gt; &gt; &gt;&gt; When I first time run ll_recover_lost_found_objs -d<br>
&gt; &gt; &gt; &gt; &gt;&gt; /mnt/ost/lost+found<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; it<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; only creates the O dir and exits. When I repeat this command again<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; kernel<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; panics. Any idea what could be the problem here?<br>
&gt; &gt; &gt; &gt; &gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; LDISKFS-fs error (device dm-4): ldiskfs_readdir: bad entry in<br>
&gt; &gt; &gt; &gt; &gt;&gt; directory #6831: rec_len is smaller than minimal - offset=0,<br>
&gt; &gt;<br>
&gt; &gt; inode=0,<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; rec_len=0, name_len=0<br>
&gt; &gt; &gt; &gt; &gt;&gt; Aborting journal on device dm-4.<br>
&gt; &gt; &gt; &gt; &gt;&gt; Unable to handle kernel NULL pointer dereference at<br>
&gt; &gt; &gt; &gt; &gt;&gt; 0000000000000000<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; RIP:<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff88033448&gt;] :jbd:journal_commit_transaction+0xc5b/0x12db<br>
&gt; &gt; &gt; &gt; &gt;&gt; PGD 1a118d067 PUD 1ce7e7067 PMD 0<br>
&gt; &gt; &gt; &gt; &gt;&gt; Oops: 0002 [1] SMP<br>
&gt; &gt; &gt; &gt; &gt;&gt; last sysfs file: /class/infiniband_mad/umad0/port<br>
&gt; &gt; &gt; &gt; &gt;&gt; CPU 3<br>
&gt; &gt; &gt; &gt; &gt;&gt; Modules linked in: ldiskfs(U) crc16(U) autofs4(U) hidp(U) l2cap(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt; bluetooth(U) rdma_ucm(U) rdma_cm(U) iw_cm(U) ib_addr(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt; ib_ipoib(U) ipoib_helper(U) ib_cm(U) ipv6(U) xfrm_nalgo(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt; crypto_api(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; ib_uverbs(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; ib_umad(U) mlx4_vnic(U) mlx4_vnic_helper(U) ib_sa(U) ib_mthca(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; mptctl(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; dm_mirror(U) video(U) backlight(U) sbs(U) power_meter(U) hwmon(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; i2c_ec(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; i2c_core(U) dell_wmi(U) wmi(U) button(U) battery(U) asus_acpi(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt; acpi_memhotplug(U) ac(U) parport_pc(U) lp(U) parport(U) sr_mod(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; cdrom(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; mlx4_ib(U) ib_mad(U) ib_core(U) joydev(U) mlx4_core(U)<br>
&gt; &gt;<br>
&gt; &gt; usb_storage(U)<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; pcspkr(U) shpchp(U) serio_raw(U) i5000_edac(U) edac_mc(U)<br>
&gt; &gt;<br>
&gt; &gt; dm_raid45(U)<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; dm_message(U) dm_region_hash(U) dm_log(U) dm_mod(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt; dm_mem_cache(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; nfs(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; lockd(U) fscache(U) nfs_acl(U) sunrpc(U) mptsas(U) mptscsih(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; mptbase(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; scsi_transport_sas(U) mppVhba(U) megaraid_sas(U) mppUpper(U) sg(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt; sd_mod(U) scsi_mod(U) bnx2(U) ext3(U) jbd(U) uhci_hcd(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt; ohci_hcd(U) ehci_hcd(U) Pid: 11360, comm: kjournald Tainted: G<br>
&gt; &gt; &gt; &gt; &gt;&gt; 2.6.18-194.3.1.el5_lustre.1.8.4 #1<br>
&gt; &gt; &gt; &gt; &gt;&gt; RIP: 0010:[&lt;ffffffff88033448&gt;] [&lt;ffffffff88033448&gt;]<br>
&gt; &gt; &gt; &gt; &gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; :jbd:journal_commit_transaction+0xc5b/0x12db<br>
&gt; &gt; &gt; &gt; &gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; RSP: 0018:ffff8101c6481d90 EFLAGS: 00010246<br>
&gt; &gt; &gt; &gt; &gt;&gt; RAX: 0000000000000000 RBX: 0000000000000000 RCX: 00000000ffffffff<br>
&gt; &gt; &gt; &gt; &gt;&gt; RDX: 0000000000000000 RSI: ffff8101e9dab0c0 RDI: ffff81022fa46000<br>
&gt; &gt; &gt; &gt; &gt;&gt; RBP: ffff81022fa46000 R08: ffff81022fa46068 R09: 0000000000000000<br>
&gt; &gt; &gt; &gt; &gt;&gt; R10: ffff810105925b20 R11: 00000000fffffffa R12: 0000000000000000<br>
&gt; &gt; &gt; &gt; &gt;&gt; R13: 0000000000000000 R14: ffff8101e9dab0c0 R15: 0000000000000000<br>
&gt; &gt; &gt; &gt; &gt;&gt; FS: 0000000000000000(0000) GS:ffff810107b9a4c0(0000)<br>
&gt; &gt; &gt; &gt; &gt;&gt; knlGS:0000000000000000 CS: 0010 DS: 0018 ES: 0018 CR0:<br>
&gt; &gt; &gt; &gt; &gt;&gt; 000000008005003b CR2: 0000000000000000 CR3: 00000001eaffb000 CR4:<br>
&gt; &gt; &gt; &gt; &gt;&gt; 00000000000006e0 Process kjournald (pid: 11360, threadinfo<br>
&gt; &gt; &gt; &gt; &gt;&gt; ffff8101c6480000, task ffff81021c14c0c0)<br>
&gt; &gt; &gt; &gt; &gt;&gt; Stack: ffff8101a61b9000 000000002b8263c0 ffffffff00000000<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; 0000000000000000<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; 0000113b00000001 0000000000000013 0000000000000000<br>
&gt; &gt; &gt; &gt; &gt;&gt; 0000000000000111 0000000000000000 0000000000000000<br>
&gt; &gt; &gt; &gt; &gt;&gt; 0000000001282dd7 00000000000020dd Call Trace:<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff8003da91&gt;] lock_timer_base+0x1b/0x3c<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff8004b347&gt;] try_to_del_timer_sync+0x7f/0x88<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff88037386&gt;] :jbd:kjournald+0xc1/0x213<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff800a0ab2&gt;] autoremove_wake_function+0x0/0x2e<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff800a089a&gt;] keventd_create_kthread+0x0/0xc4<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff880372c5&gt;] :jbd:kjournald+0x0/0x213<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff800a089a&gt;] keventd_create_kthread+0x0/0xc4<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff80032890&gt;] kthread+0xfe/0x132<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff8005dfb1&gt;] child_rip+0xa/0x11<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff800a089a&gt;] keventd_create_kthread+0x0/0xc4<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff8014bcf4&gt;] deadline_queue_empty+0x0/0x23<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff80032792&gt;] kthread+0x0/0x132<br>
&gt; &gt; &gt; &gt; &gt;&gt; [&lt;ffffffff8005dfa7&gt;] child_rip+0x0/0x11<br>
&gt; &gt; &gt; &gt; &gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; Code: f0 0f ba 33 01 e8 42 fc 02 f8 8b 03 a8 04 75 07 8b 43 58 85<br>
&gt; &gt; &gt; &gt; &gt;&gt; RIP [&lt;ffffffff88033448&gt;]<br>
&gt; &gt; :<br>
&gt; &gt; :jbd:journal_commit_transaction+0xc5b/0x12db<br>
&gt; &gt; :<br>
&gt; &gt; &gt; &gt; &gt;&gt; RSP &lt;ffff8101c6481d90&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; CR2: 0000000000000000<br>
&gt; &gt; &gt; &gt; &gt;&gt; &lt;0&gt;Kernel panic - not syncing: Fatal exception<br>
&gt; &gt; &gt; &gt; &gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt; On 22 October 2010 03:09, Andreas Dilger<br>
&gt; &gt; &gt; &gt; &gt;&gt; &lt;<a href="mailto:andreas.dilger@oracle.com">andreas.dilger@oracle.com</a><br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; wrote:<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; On 2010-10-21, at 18:44, Wojciech Turek &lt;<a href="mailto:wjt27@cam.ac.uk">wjt27@cam.ac.uk</a>&gt; wrote:<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; fsck has finished and does not find any more errors to correct.<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; However when I try to mount the device as ldiskfs kernel panics<br>
&gt; &gt;<br>
&gt; &gt; with<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; following message:<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Assertion failure in cleanup_journal_tail() at<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; fs/jbd/checkpoint.c:459: &quot;blocknr != 0&quot;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Hmm, not sure, maybe your journal is broken? You can delete it<br>
&gt; &gt;<br>
&gt; &gt; with<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; &quot;tune2fs -O ^has_journal&quot; (maybe after running e2fsck again to<br>
&gt; &gt;<br>
&gt; &gt; clear<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; the<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; journal), then re-create it with &quot;tune2fs -j&quot;.<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ----------- [cut here ] --------- [please bite here ] ---------<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Kernel BUG at fs/jbd/checkpoint.c:459<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; invalid opcode: 0000 [1] SMP<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; last sysfs file: /class/infiniband_mad/umad0/<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; port<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; CPU 2<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Modules linked in: obdfilter(U) fsfilt_ldiskfs(U) ost(U) mgc(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ldiskfs(U) crc16(U) lustre(U) lov(U) mdc(U) lquota(U) osc(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; ksocklnd(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ko2iblnd(U) ptlrpc(U) obdclass(U) lnet(U) lvfs(U) libcfs(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; autofs4(U) hidp(U) l2cap(U) bluetooth(U) rdma_ucm(U) rdma_cm(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; iw_cm(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; ib_addr(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ib_ipoib(U) ipoib_helper(U) ib_cm(U) ipv6(U) xfrm_nalgo(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; crypto_api(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ib_uverbs(U) ib_umad(U) mlx4_vnic(U) mlx4_vnic_helper(U) ib_sa(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ib_mthca(U) mptctl(U) dm_mirror(U) video(U) backlight(U) sbs(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; power_meter(U) hwmon(U) i2c_ec(U) i2c_core(U) dell_wmi(U) wmi(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; button(U) battery(U) asus_acpi(U) acpi_memhotplug(U) ac(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; parport_pc(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; lp(U) parport(U) sr_mod(U) cdrom(U) mlx4_ib(U) ib_mad(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ib_core(U) joydev(U) mlx4_core(U) usb_storage(U) shpchp(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; i5000_edac(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; edac_mc(U)<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; serio_raw(U) pcspkr(U) dm_raid45(U) dm_message(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; dm_region_hash(U) dm_log(U) dm_mod(U) dm_mem_cache(U) nfs(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; lockd(U) fscache(U) nfs_acl(U) sunrpc(U) mptsas(U) mptscsih(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; mptbase(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; scsi_transport_sas(U) mppVhba(U) megaraid_sas(U) mppUpper(U)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; sg(U) sd_mod(U) scsi_mod(U) bnx2(U) ext3(U) jbd(U) uhci_hcd(U)<br>
&gt; &gt;<br>
&gt; &gt; ohci_hcd(U)<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ehci_hcd(U) Pid: 13891, comm: mount Tainted: G<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; 2.6.18-194.3.1.el5_lustre.1.8.4 #1 RIP: 0010:[&lt;ffffffff88034a95&gt;]<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff88034a95&gt;]<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; :jbd:cleanup_journal_tail+0x9d/0x118<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; RSP: 0018:ffff81016f00da68 EFLAGS: 00010286<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; RAX: 000000000000005a RBX: ffff81012ca12c00 RCX: ffffffff80311da8<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; RDX: ffffffff80311da8 RSI: 0000000000000000 RDI: ffffffff80311da0<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; RBP: 0000000000000000 R08: ffffffff80311da8 R09: 0000000000000001<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; R10: 0000000000000000 R11: 0000000000000080 R12: 0000000000000002<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; R13: ffff81012ca12d4c R14: ffff81012ca12c24 R15: ffff81017a8d7400<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; FS: 00002abd7cef1f70(0000) GS:ffff810107b9acc0(0000)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; knlGS:0000000000000000<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; CS: 0010 DS: 0000 ES: 0000 CR0: 000000008005003b<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; CR2: 000000000042b000 CR3: 000000012813f000 CR4: 00000000000006e0<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Process mount (pid: 13891, threadinfo ffff81016f00c000, task<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ffff81022e1b7820)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Stack: 0000000000000000 ffff81012ca12c00 ffff81017a8d7400<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ffffffff88037690<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; ffff81012ca12c00 ffff8102034ff000 ffff81017a8d7400<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; 0000000000000000 ffff8102034ff000 ffffffff88a9be56<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; 0000000001000000 ffff8101bf788000<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Call Trace:<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff88037690&gt;] :jbd:journal_flush+0xbe/0x248<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff88a9be56&gt;]<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; :ldiskfs:ldiskfs_mark_recovery_complete+0x36/0x90<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff88aa02e0&gt;] :ldiskfs:ldiskfs_fill_super+0x1790/0x1950<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800eccd2&gt;] get_filesystem+0x12/0x3b<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800e343e&gt;] test_bdev_super+0x0/0xd<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff88a9eb50&gt;] :ldiskfs:ldiskfs_fill_super+0x0/0x1950<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800e43fd&gt;] get_sb_bdev+0x10a/0x16c<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800e3d9a&gt;] vfs_kern_mount+0x93/0x11a<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800e3e63&gt;] do_kern_mount+0x36/0x4d<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800ee601&gt;] do_mount+0x6a9/0x719<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800090d2&gt;] __handle_mm_fault+0x96f/0xfaa<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff8002c9e0&gt;] mntput_no_expire+0x19/0x89<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff8000a72a&gt;] __link_path_walk+0xf1e/0xf42<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800220ce&gt;] __up_read+0x19/0x7f<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff80066b88&gt;] do_page_fault+0x4fe/0x874<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff8002c9e0&gt;] mntput_no_expire+0x19/0x89<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff8000ea45&gt;] link_path_walk+0xa6/0xb2<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff800cc329&gt;] zone_statistics+0x3e/0x6d<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff8000f2cf&gt;] __alloc_pages+0x78/0x308<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff8004c68e&gt;] sys_mount+0x8a/0xcd<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; [&lt;ffffffff8005d28d&gt;] tracesys+0xd5/0xe0<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Code: 0f 0b 68 3a 94 03 88 c2 cb 01 44 39 a3 58 01 00 00 75 0e c7<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; RIP [&lt;ffffffff88034a95&gt;] :jbd:cleanup_journal_tail+0x9d/0x118<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; RSP &lt;ffff81016f00da68&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; &lt;0&gt;Kernel panic - not syncing: Fatal exception<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Any idea how to fix this?<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Many thanks<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; Wojciech<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; On 21 October 2010 17:54, Wojciech Turek &lt; &lt;<a href="mailto:wjt27@cam.ac.uk">wjt27@cam.ac.uk</a>&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt; <a href="mailto:wjt27@cam.ac.uk">wjt27@cam.ac.uk</a>&gt; wrote:<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt; Thanks Ken, that worked.<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt; On 21 October 2010 17:39, Ken Hornstein &lt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt; &lt;<a href="mailto:kenh@cmf.nrl.navy.mil">kenh@cmf.nrl.navy.mil</a>&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt; <a href="mailto:kenh@cmf.nrl.navy.mil">kenh@cmf.nrl.navy.mil</a>&gt; wrote:<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; Now I have another problem. After last segfault I can not<br>
&gt; &gt;<br>
&gt; &gt; restart<br>
&gt; &gt;<br>
&gt; &gt; &gt; &gt; the<br>
&gt; &gt; &gt; &gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt; fsck<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; due to MMP.<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; [...]<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; Also when I try to access filesystem via debugfs it fails:<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; debugfs -c -R &#39;ls&#39; /dev/scratch2_ost16vg/ost16lv<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; debugfs 1.41.10.sun2 (24-Feb-2010)<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; /dev/scratch2_ost16vg/ost16lv: MMP: fsck being run while<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; opening<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt; filesystem<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; ls: Filesystem not open<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;&gt; Is there a way to clear teh MMP flag so it allows fsck to run?<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt; You want tune2fs -f -E clear-mmp<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt;<br>
&gt; &gt; &gt; &gt; &gt;&gt;&gt;&gt;&gt; --Ken<br>
<br>
</div></div></blockquote></div><br><br clear="all"><br>-- <br>Wojciech Turek<br><br>Senior System Architect<br><br>High Performance Computing Service<br>University of Cambridge<br>Email: <a href="mailto:wjt27@cam.ac.uk" target="_blank">wjt27@cam.ac.uk</a><br>
Tel: (+)44 1223 763517 <br>